Le vrai coût du désordre
Il n’est pas dans le rangement — deux minutes par document, on s’en accommode. Il est dans la recherche.
Une pièce qu’on ne retrouve pas coûte dix à trente minutes, souvent à plusieurs personnes, et parfois un appel au client pour la redemander. Un dossier photo incomplet coûte une position de faiblesse dans une discussion de fin de chantier. Une facture classée au mauvais endroit revient en question au moment du bilan, six mois plus tard.
Et le désordre est cumulatif : une arborescence tenue par trois personnes avec trois logiques dérive en quelques mois, quelles que soient les bonnes intentions du départ.
Ce qu’on automatise
La collecte. Un point d’arrivée unique : une boîte dédiée, un dossier surveillé, un numéro auquel on envoie des photos. Tout y converge, quelle que soit la source.
L’identification. De quel type de document s’agit-il, à quel client ou chantier se rattache-t-il, de quelle date.
Le renommage. Selon votre convention, écrite une fois : date, client, type, référence. Le même format pour tout le monde et pour toujours.
Le rangement. Dans l’arborescence existante, en créant le dossier client ou chantier s’il manque.
La trace. Quel fichier est arrivé, quand, d’où, où il a été rangé. Utile quand quelqu’un jure avoir envoyé quelque chose.
Comment ça marche techniquement — pour qui veut le détail
La surveillance. Un dossier local se surveille par systemd path unit sous Linux ou par un observateur de système de fichiers, qui réagit à la seconde sans interroger en boucle. Une boîte mail se lit en IMAP. Un espace partagé en ligne expose généralement des notifications de changement.
L’identification. Trois couches, de la moins chère à la plus chère. D’abord les métadonnées : type MIME réel — pas l’extension, qui ment —, date de création, données EXIF pour les photos (date de prise de vue, position si activée). Ensuite les motifs : un numéro de facture, un SIRET, une référence de chantier reconnus par expression régulière dans le texte. Enfin, seulement si nécessaire, un modèle qui lit la première page et renvoie une structure : type, émetteur, date, référence, indice de confiance.
L’OCR quand c’est un scan. Un PDF issu d’un scanner ne contient pas de texte. Tesseract en local suffit pour du document propre ; les modèles multimodaux font mieux sur les documents dégradés, au prix d’une sortie de données.
Le nommage. Un gabarit paramétrable, du type AAAA-MM-JJ_client_type_reference.ext. Trois règles qui évitent beaucoup d’ennuis : date en tête et au format ISO pour que le tri alphabétique soit chronologique ; pas d’accents ni d’espaces si les fichiers transitent entre Windows, Linux et des outils tiers ; longueur totale surveillée, Windows plafonnant historiquement les chemins à 260 caractères.
Les collisions. Deux fichiers qui produisent le même nom : on ne remplace jamais. Suffixe incrémental, et signalement si les contenus diffèrent — c’est souvent le symptôme d’un vrai problème en amont.
L’idempotence. Une empreinte SHA-256 du contenu est stockée. Le même fichier envoyé deux fois est reconnu et ignoré, ce qui évite les doublons quand quelqu’un renvoie « au cas où ».
Le journal. Chaque opération en base : empreinte, nom d’origine, destination, méthode d’identification, indice. C’est ce qui permet de revenir en arrière et de mesurer le taux d’erreur réel.