OCR (reconnaissance de caractères)
L’OCR (optical character recognition) transforme une image de document (scan, photo, PDF image) en texte exploitable, première étape de l’extraction automatique d’informations.
Mise en contexte
L’OCR seule lit ; combinée à un modèle de langage, elle comprend : quel est le montant, la date, le fournisseur, le numéro de dossier. C’est la base de l’automatisation documentaire : factures, bons de livraison, formulaires papier, pièces justificatives.
Nous concevons ces chaînes de traitement avec un seuil de confiance : ce qui est lu avec certitude passe, le reste est présenté à un humain pour validation. Par exemple, l’extraction de champs dans des factures alimente un logiciel de gestion sans ressaisie.
La qualité dépend de celle des documents : un scan propre vaut mieux qu’un modèle plus gros.
Questions fréquentes
Partiellement : les modèles récents lisent l’écriture manuscrite lisible avec une bonne précision, mais un seuil de confiance et une validation humaine restent nécessaires.
Ce que vous décidez : archivage dans votre GED, conservation limitée, suppression. Les règles de conservation sont écrites au cadrage, en cohérence avec le RGPD.