7DaysAutomatisation des process
Cas d’usage · Documents et données

Numériser et traiter le courrier papier automatiquement

Une pile de courrier scannée dans un dossier « scans » n’est pas numérisée. Elle est juste devenue invisible.

Une chaîne de traitement du courrier récupère les scans, sépare les documents, lit leur contenu par reconnaissance de caractères, identifie l’expéditeur et la nature du courrier, range, et prévient la bonne personne — avec un délai si le courrier appelle une réponse. Le courrier qu’aucune règle ne couvre part dans une file de tri humain, jamais au hasard.

DéclencheurUn fichier est déposé
L’automateExtrait, vérifié, rangé
VousVous validez les cas douteux

Aujourd’hui, à la main

30 à 90 minutes par jour d’ouverture, tri et distribution, et des courriers qui dorment sur un bureau absent.

Une fois automatisé

Le courrier du matin est classé, routé et horodaté avant l’arrivée de l’équipe.

À savoir

Le gain décisif est ailleurs : plus aucun courrier à échéance ne se perd sur un bureau pendant des congés.

Le problème n’est pas le scan

Numériser est facile et beaucoup d’entreprises le font déjà. Le résultat est un dossier de fichiers nommés scan_20260114_001.pdf, dont personne ne connaît le contenu sans les ouvrir.

Le courrier papier crée trois problèmes distincts, et le scanner n’en résout qu’un.

La distribution. Qui doit voir ce pli ? Tant que le tri est manuel, il dépend d’une personne, de sa disponibilité et de sa connaissance des dossiers.

L’échéance. Une mise en demeure, une relance d’organisme, un recommandé : ce sont des délais. Un pli posé sur un bureau vide pendant deux semaines de congés devient un problème beaucoup plus cher que le temps qu’il aurait fallu pour le traiter.

La recherche. Six mois plus tard, retrouver ce courrier suppose de se souvenir de sa date approximative et de parcourir les scans un par un.

Ce qu’on automatise

La collecte. Dossier surveillé du scanner, adresse de dépôt dédiée, ou prestataire de numérisation — un point d’entrée unique.

La séparation des plis dans un lot scanné en continu.

La lecture. Reconnaissance de caractères, y compris sur des documents inclinés, tamponnés ou de qualité moyenne.

L’identification. Expéditeur, nature du courrier — facture, relance, courrier administratif, candidature, réclamation —, dossier ou client concerné, date et échéance éventuelle.

Le routage. Vers la personne ou le service, avec le niveau d’urgence, et une trace de qui a été prévenu.

Le déclenchement. Une facture fournisseur rejoint la chaîne de saisie ; une relance ouvre une tâche avec date limite ; une candidature rejoint le tri des candidatures.

L’archivage. Fichier recherchable par son texte, nommé selon votre convention, rangé, horodaté.

Comment ça marche techniquement — pour qui veut le détail

L’entrée. Le scanner dépose en SMB ou FTPS sur un partage, ou envoie à une boîte dédiée. Côté serveur, un systemd path unit réagit au dépôt, avec une temporisation courte pour ne pas saisir un fichier en cours d’écriture — un scan de trente pages met plusieurs secondes à s’écrire, et le traiter trop tôt donne un PDF tronqué.

La préparation d’image. Avant toute reconnaissance, on redresse et on nettoie : correction d’inclinaison, suppression des pages blanches par mesure de densité de pixels, recadrage des bords noirs, binarisation adaptative. OpenCV ou ImageMagick pour la transformation, img2pdf ou qpdf pour la recomposition. Cette étape fait plus pour le taux de reconnaissance que le choix du moteur qui suit — un document redressé et nettoyé gagne plusieurs points, systématiquement.

La reconnaissance. Tesseract en français, avec les données linguistiques adéquates, produit un PDF avec couche de texte invisible (pdf output, mode sandwich) : l’image reste fidèle, le texte devient sélectionnable et indexable. Sur des documents dégradés ou des mises en page complexes, un modèle multimodal fait sensiblement mieux, au prix d’une sortie de données — on l’active alors uniquement sur les documents dont l’indice de confiance Tesseract est faible, ce qui limite à la fois le coût et l’exposition.

La séparation des plis. Plusieurs signaux combinés : pages de séparation imprimées avec un code-barres ou un QR reconnu par ZBar ; détection de rupture visuelle par comparaison d’histogrammes entre pages consécutives ; changement d’expéditeur détecté dans le texte de l’en-tête. On agrège ces signaux en un score, et les lots ambigus partent en contrôle humain plutôt qu’en découpe hasardeuse.

L’extraction structurée. Même architecture par couches que pour les autres documents : d’abord les motifs bon marché — SIRET, numéro de facture, IBAN, dates, montants, références de dossier par expression régulière ; ensuite un modèle qui reçoit le texte de la première page et renvoie un objet validé par schéma, avec indice de confiance. Un IBAN extrait par motif est vérifié par sa clé de contrôle avant d’être accepté — un contrôle arithmétique attrape la plupart des erreurs de reconnaissance.

La recherche plein texte. Indexation en PostgreSQL avec tsvector et la configuration française, ou dans un moteur dédié si le volume le justifie. Un index de trigrammes en complément rattrape les fautes de reconnaissance : chercher « Dupond » retrouve un document où le moteur a lu « Dupont ».

L’horodatage. Empreinte SHA-256 du fichier à l’entrée, conservée avec la date d’arrivée. Pour les documents à enjeu, un horodatage par un tiers de confiance apporte une preuve opposable de la date ; sans cela, la date reste celle de votre serveur, ce qui suffit pour l’usage courant et pas pour un contentieux.

La confidentialité du pipeline. Les fichiers intermédiaires — images redressées, textes extraits — sont écrits dans un répertoire éphémère et supprimés à la fin du traitement. Un pipeline de courrier qui laisse traîner des versions intermédiaires en clair pendant des mois est une fuite lente.

Questions fréquentes

Faut-il un scanner particulier ?
Un scanner de bureau avec chargeur automatique et recto-verso suffit pour la plupart des volumes. Ce qui compte n’est pas le modèle mais la capacité à déposer les fichiers dans un dossier surveillé ou à les envoyer à une adresse dédiée — la quasi-totalité des scanners professionnels savent faire l’un ou l’autre. Au-delà d’une centaine de plis par jour, un scanner de production change les choses ; en dessous, c’est un faux problème.
Comment le système sait-il où s’arrête un courrier et où commence le suivant ?
Trois méthodes, combinables. Une page de séparation glissée entre les plis lors de la mise en pile — la plus fiable, et la plus contraignante. La détection automatique par changement d’en-tête, de mise en page ou d’expéditeur. Et un contrôle humain sur les lots où la séparation est douteuse. En pratique, la deuxième méthode couvre l’essentiel et la troisième rattrape le reste.
Et les courriers manuscrits ?
La reconnaissance de l’écriture manuscrite reste nettement moins fiable que celle du texte imprimé, même avec les modèles récents. On ne prétend pas le contraire. Un courrier manuscrit est identifié comme tel, routé vers une personne, et son image est conservée et indexée : il devient retrouvable même si son texte n’est pas parfaitement extrait.
Peut-on jeter le papier après ?
Cela dépend du document, et c’est une question juridique avant d’être technique. Certaines pièces doivent être conservées sous leur forme d’origine ; pour beaucoup d’autres, une copie numérique conforme aux exigences en vigueur suffit. Nous mettons en place la chaîne technique — empreinte, horodatage, archivage non modifiable — qui permet cette conservation ; la décision de détruire un original se prend avec votre comptable ou votre conseil, pas avec nous.
Est-ce que ça marche avec le courrier reçu par voie électronique aussi ?
Oui, et c’est même l’intérêt : une seule chaîne pour le papier scanné, les pièces jointes des messages et les dépôts sur portail. Le courrier d’un fournisseur suit le même circuit, qu’il arrive par la poste ou par courriel. Sans cela, on remplace une pile de papier par trois flux parallèles, ce qui n’est pas un progrès.
Combien coûte l’automatisation du traitement du courrier papier ?
Entre 3 000 et 6 000 € selon le volume et la variété des courriers reçus. À cela s’ajoute éventuellement un scanner à chargeur automatique, qui se trouve pour quelques centaines d’euros. L’exploitation se situe entre 150 et 350 € par mois. Le chantier se justifie à partir de quelques dizaines de courriers par jour.
Combien de temps pour le mettre en place ?
Quatre à six semaines. Le découpage du lot scanné en courriers distincts est le point technique le plus délicat, et il se règle en quelques jours avec des pages de séparation. Le reste du temps va au classement : apprendre au flux à distinguer une facture d’un courrier administratif d’une candidature spontanée.

Pour aller plus loin

Ce process, chez vous

Les chiffres de cette page sont des ordres de grandeur observés. Les vôtres seront différents — et c’est précisément ce que l’audit mesure.

Parlons-en

Ce process, chez vous

Celui qui vous agace le plus, ou celui qui coûte le plus. Dites-nous en deux phrases qui le fait, combien de fois par semaine, et avec quels outils. Nous vous dirons franchement s’il mérite d’être automatisé — y compris quand la réponse est non.

  • Réponse garantie sous 24 heures
  • Un premier échange d’une demi-heure, sans engagement
  • Aucun formulaire tiers : votre message part par votre messagerie

Ou directement : nicolas@oli-via-net.fr· 06 89 96 40 79

Le message s’ouvrira dans votre messagerie, prêt à partir.