7DaysAutomatisation des process
Cas d’usage · Documents et données

Automatiser l’extraction de données depuis des PDF

C’est la tâche la plus universellement pénible de l’entreprise : lire un document, et retaper ce qu’il contient dans un autre système.

L’extraction automatique lit un PDF, identifie les champs qui vous intéressent — émetteur, date, montants, références, lignes de détail — et les dépose dans votre outil sans ressaisie. Sur des documents récurrents et bien structurés, l’extraction se trompe rarement sur les champs clés — mais le taux réel dépend de vos documents et se mesure sur vos propres pièces, pas sur une promesse. Le bon réglage consiste à laisser passer ce dont le système est sûr et à faire valider le reste, plutôt qu’à viser une automatisation totale.

DéclencheurUn fichier est déposé
L’automateExtrait, vérifié, rangé
VousVous validez les cas douteux

Aujourd’hui, à la main

2 à 5 minutes par document, et une erreur de saisie tous les quelques dizaines de documents.

Une fois automatisé

Quelques secondes par document, dont une fraction seulement demande un regard humain.

À savoir

Le gain croît fortement avec le volume et avec la répétition des émetteurs : un même fournisseur envoie toujours la même mise en page.

Le problème, formulé correctement

Beaucoup d’entreprises décrivent ce besoin comme « il faudrait un OCR ». C’est une formulation qui conduit à un mauvais projet.

L’OCR — la reconnaissance optique de caractères — répond à la question « quels caractères y a-t-il sur cette page ». Ce n’est pas la question qui vous intéresse. Votre question est : quel est le montant HT, qui est le fournisseur, à quelle commande cette facture se rapporte-t-elle.

La différence est considérable dans le résultat. Un OCR vous rend un mur de texte que quelqu’un devra relire. Une extraction structurée vous rend des champs prêts à être écrits dans votre outil.

Ce qui a changé récemment

Pendant vingt ans, l’extraction reposait sur des gabarits : on indiquait au système où regarder dans la page pour trouver chaque champ. Cela fonctionnait tant que le fournisseur ne bougeait rien, et cassait au premier changement de mise en page. La maintenance de ces gabarits représentait l’essentiel du coût.

Les modèles de langage multimodaux ont supprimé cette contrainte. Ils lisent le document dans son ensemble et identifient les informations par leur sens, pas par leur position. Concrètement, cela signifie qu’un flux d’extraction se met en place aujourd’hui en quelques jours plutôt qu’en quelques mois, et qu’il ne demande presque plus d’entretien.

C’est l’un des rares domaines où l’arrivée de l’IA a réellement changé l’équation économique, et pas seulement le discours commercial.

L’architecture qui tient

1. Une porte d’entrée unique. Une boîte e-mail dédiée, un dossier surveillé, ou les deux. Tous les documents y passent, quelle que soit leur origine.

2. Une identification. De quel type de document s’agit-il, et de qui vient-il.

3. Une extraction avec indice de confiance. Chaque champ est rendu avec un niveau de certitude.

4. Des contrôles de cohérence. La somme des lignes correspond-elle au total ? Le taux de TVA est-il plausible ? Ce fournisseur existe-t-il ? Ce numéro de commande existe-t-il et n’est-il pas déjà facturé ?

5. Une file de validation. Ce qui ne passe pas les contrôles s’affiche côte à côte avec le document, pour une correction en quelques secondes.

6. Une écriture dans le système cible, et un journal de ce qui a été fait.

C’est l’étape 4 que les projets ratés oublient. Sans contrôles de cohérence, on remplace une erreur humaine visible par une erreur machine silencieuse — et c’est un très mauvais échange.

Ce qu’il ne faut pas viser

Le zéro validation. Un flux réglé pour n’exiger aucune intervention humaine est un flux qui écrit des données fausses avec assurance. Le bon objectif, c’est 90 % des documents qui passent seuls et 10 % qui demandent dix secondes d’attention — pas 100 % qui passent et dont on découvre les erreurs six mois plus tard.

Questions fréquentes

Quelle différence entre OCR et extraction intelligente ?
L’OCR transforme une image en texte : il vous rend des mots, pas des informations. L’extraction intelligente va plus loin — elle comprend que ce nombre est un montant TTC, que cette date est une échéance, que ce bloc est une ligne de commande. C’est cette compréhension qui supprime la ressaisie ; l’OCR seul ne fait que déplacer le problème.
Et si le fournisseur change sa mise en page ?
Les approches modernes, fondées sur des modèles de langage, ne dépendent plus de la position des champs dans la page : elles lisent le document comme un humain le lirait. Un changement de mise en page ne casse donc plus l’extraction, ce qui était le défaut majeur des systèmes à gabarits d’il y a dix ans.
Comment être sûr qu’aucune erreur ne passe ?
On ne l’est jamais complètement, et c’est pour ça qu’on ne conçoit pas le flux ainsi. On demande au système un indice de confiance par champ, et on fixe un seuil : en dessous, le document part en validation. On y ajoute des contrôles de cohérence — la somme des lignes égale le total, la TVA correspond au taux, le fournisseur existe dans la base. Ce sont ces contrôles, plus que la performance brute de lecture, qui rendent le flux sûr.
Les documents manuscrits sont-ils traitables ?
Partiellement, et avec une fiabilité bien moindre. Une écriture manuscrite régulière sur un formulaire structuré se lit correctement ; des notes libres, non. Quand une part importante de vos documents est manuscrite, il est souvent plus rentable de changer le mode de saisie à la source que de chercher à lire l’existant.
Combien coûte l’extraction automatique de données depuis des PDF ?
Entre 2 500 et 6 000 € selon le nombre de formats différents à traiter. Un seul type de document bien structuré se construit vite ; dix mises en page distinctes demandent un travail proportionnel. Nous conseillons presque toujours de commencer par les deux ou trois formats les plus fréquents, qui représentent l’essentiel du volume.
Quel taux d’extraction peut-on espérer ?
Nous refusons d’annoncer un chiffre avant d’avoir vu vos documents, parce qu’il varie énormément : un même réglage donne un résultat excellent sur des factures récurrentes et médiocre sur des scans de travers. Le taux réel se mesure pendant la semaine à blanc, sur vos propres pièces — et c’est ce taux-là qui figure dans le bilan de livraison.
Combien de temps pour mettre ça en place ?
Trois à six semaines. La construction est rapide ; ce qui prend du temps, c’est de rassembler un échantillon représentatif de vos documents, y compris les cas tordus que personne ne pense à fournir — la facture d’un fournisseur étranger, celle qui tient sur trois pages, celle qui a été photographiée plutôt que scannée.
Que se passe-t-il quand un fournisseur change sa mise en page ?
Le taux de reconnaissance chute, et c’est détecté par les contrôles de cohérence plutôt que constaté trois semaines plus tard. Le flux bascule ces documents en validation et signale l’anomalie. La reprise du réglage fait partie de l’exploitation : c’est précisément le genre d’événement pour lequel un abonnement mensuel existe.

Pour aller plus loin

Ce process, chez vous

Les chiffres de cette page sont des ordres de grandeur observés. Les vôtres seront différents — et c’est précisément ce que l’audit mesure.

Parlons-en

Ce process, chez vous

Celui qui vous agace le plus, ou celui qui coûte le plus. Dites-nous en deux phrases qui le fait, combien de fois par semaine, et avec quels outils. Nous vous dirons franchement s’il mérite d’être automatisé — y compris quand la réponse est non.

  • Réponse garantie sous 24 heures
  • Un premier échange d’une demi-heure, sans engagement
  • Aucun formulaire tiers : votre message part par votre messagerie

Ou directement : nicolas@oli-via-net.fr· 06 89 96 40 79

Le message s’ouvrira dans votre messagerie, prêt à partir.