Le problème, formulé correctement
Beaucoup d’entreprises décrivent ce besoin comme « il faudrait un OCR ». C’est une formulation qui conduit à un mauvais projet.
L’OCR — la reconnaissance optique de caractères — répond à la question « quels caractères y a-t-il sur cette page ». Ce n’est pas la question qui vous intéresse. Votre question est : quel est le montant HT, qui est le fournisseur, à quelle commande cette facture se rapporte-t-elle.
La différence est considérable dans le résultat. Un OCR vous rend un mur de texte que quelqu’un devra relire. Une extraction structurée vous rend des champs prêts à être écrits dans votre outil.
Ce qui a changé récemment
Pendant vingt ans, l’extraction reposait sur des gabarits : on indiquait au système où regarder dans la page pour trouver chaque champ. Cela fonctionnait tant que le fournisseur ne bougeait rien, et cassait au premier changement de mise en page. La maintenance de ces gabarits représentait l’essentiel du coût.
Les modèles de langage multimodaux ont supprimé cette contrainte. Ils lisent le document dans son ensemble et identifient les informations par leur sens, pas par leur position. Concrètement, cela signifie qu’un flux d’extraction se met en place aujourd’hui en quelques jours plutôt qu’en quelques mois, et qu’il ne demande presque plus d’entretien.
C’est l’un des rares domaines où l’arrivée de l’IA a réellement changé l’équation économique, et pas seulement le discours commercial.
L’architecture qui tient
1. Une porte d’entrée unique. Une boîte e-mail dédiée, un dossier surveillé, ou les deux. Tous les documents y passent, quelle que soit leur origine.
2. Une identification. De quel type de document s’agit-il, et de qui vient-il.
3. Une extraction avec indice de confiance. Chaque champ est rendu avec un niveau de certitude.
4. Des contrôles de cohérence. La somme des lignes correspond-elle au total ? Le taux de TVA est-il plausible ? Ce fournisseur existe-t-il ? Ce numéro de commande existe-t-il et n’est-il pas déjà facturé ?
5. Une file de validation. Ce qui ne passe pas les contrôles s’affiche côte à côte avec le document, pour une correction en quelques secondes.
6. Une écriture dans le système cible, et un journal de ce qui a été fait.
C’est l’étape 4 que les projets ratés oublient. Sans contrôles de cohérence, on remplace une erreur humaine visible par une erreur machine silencieuse — et c’est un très mauvais échange.
Ce qu’il ne faut pas viser
Le zéro validation. Un flux réglé pour n’exiger aucune intervention humaine est un flux qui écrit des données fausses avec assurance. Le bon objectif, c’est 90 % des documents qui passent seuls et 10 % qui demandent dix secondes d’attention — pas 100 % qui passent et dont on découvre les erreurs six mois plus tard.