7DaysAutomatisation des process

Vos agents IA sont capables. Ils ne sont pas fiables — et ce n’est pas la même chose.

Par · · vulgarisation, IA, agents

haut bas génération 1 génération 2 génération 3 Capacité — ce que le modèle sait faire Fiabilité — ce qu’il refait à chaque fois l’écart
D’une génération de modèles à la suivante, la capacité progresse nettement plus vite que la fiabilité. C’est l’écart entre les deux courbes qui décide de ce qu’on peut confier à un agent.

Il existe une confusion, très répandue et très coûteuse, entre deux notions que tout oppose : la capacité d’un modèle et sa fiabilité.

La capacité, c’est : est-ce qu’il sait faire cette tâche ? La fiabilité, c’est : est-ce qu’il la fait correctement à chaque fois ?

Les travaux de Arvind Narayanan et Sayash Kapoor, chercheurs à Princeton, portent précisément sur cet écart. Leur constat, relayé par la presse économique en mars 2026, tient en une phrase : la fiabilité progresse beaucoup moins vite que la capacité, et l’industrie mesure presque exclusivement la seconde.

Ce travail n’a pas été traduit en français. Il mérite de l’être, parce qu’il donne un vocabulaire utilisable pour décider si l’on confie ou non une tâche à un agent.

Le problème des moyennes

La plupart des modèles sont évalués sur leur précision moyenne sur un ensemble de tâches. C’est une métrique commode et, disent les chercheurs, une métrique qui « autorise des performances extrêmement peu fiables ».

Prenons un exemple. Un agent réussit 90 % des tâches qu’on lui confie. Excellent, en apparence. Mais si les 10 % d’échecs se répartissent au hasard, cela signifie que sur dix factures traitées, une sera fausse — et vous ne savez pas laquelle.

Pour une assistance humaine, c’est acceptable : la personne relit. Pour une automatisation complète, c’est disqualifiant. C’est exactement la distinction que posent les auteurs : l’automatisation sans supervision exige la fiabilité comme préalable absolu, là où l’assistance tolère beaucoup d’incohérence.

Les quatre dimensions de la fiabilité

C’est l’apport le plus directement utilisable de leur travail. Plutôt qu’un score unique, ils décomposent la fiabilité en quatre questions distinctes.

CohérenceRobustesse CalibrationSécurité Deux fois la mêmetâche, deux fois lemême résultat ? Tient-il quand ledocument est malscanné, le champ vide ? Sait-il direqu’il ne sait pas ? Que coûte l’erreurquand elle arrive ? un modèle n’est pasdéterministe c’est-à-dire :la réalité la plus importante en entreprise classer un e-mail ≠payer un fournisseur
Quatre questions distinctes plutôt qu’un score unique. La calibration — savoir dire « je ne suis pas sûr » — est celle qui décide si un agent peut être encadré ou non.

La cohérence. L’agent produit-il le même résultat si on lui soumet deux fois la même tâche ? Cette question surprend souvent : on imagine un système informatique déterministe. Un modèle de langage ne l’est pas. Deux exécutions identiques peuvent suivre des chemins différents et aboutir à des conclusions différentes.

La robustesse. Fonctionne-t-il encore quand les conditions ne sont pas idéales ? Un document mal scanné, un champ vide, une formulation inhabituelle, un format inattendu. C’est-à-dire : la réalité.

La calibration. Sait-il dire qu’il ne sait pas ? C’est, de loin, la dimension la plus importante en entreprise. Un système qui signale son incertitude peut être encadré : on fait valider les cas douteux. Un système qui répond toujours avec le même aplomb ne peut pas l’être.

La sécurité. Quelle est l’ampleur des dégâts quand il se trompe ? Une erreur de classement d’e-mail se corrige en trois secondes. Un paiement envoyé au mauvais fournisseur, non.

Les chiffres

Ils sont éclairants, et ils invitent à la prudence.

Fiabilité globaleCalibrationÉviter l’erreur grave 85 %52 %25 % Meilleurs modèles testés — le score moyen cache les sous-scores
Un modèle annoncé à 85 % de fiabilité tombe à 25 % sur ce qui compte le plus en entreprise : ne pas commettre l’erreur grave. C’est-à-dire échouer trois fois sur quatre quand la situation s’y prête.

Sur un ensemble de tâches générales, l’amélioration de la fiabilité entre générations de modèles représente environ la moitié de l’amélioration de la précision. Sur des tâches de support client, elle n’en représente qu’un septième.

Autrement dit : quand un nouveau modèle est annoncé comme nettement meilleur, il est nettement plus capable. Il n’est que marginalement plus fiable.

Sur les scores mesurés par les chercheurs, les meilleurs modèles du moment atteignaient environ 85 % de fiabilité globale. Mais les sous-scores racontent une autre histoire : sur la calibration — la capacité à dire « je ne suis pas sûr » —, l’un des modèles testés tombait à 52 %. Et sur l’évitement des erreurs catastrophiques, à 25 %.

Ce dernier chiffre est le plus important de tous. Il signifie que, dans ce test, le modèle échouait à éviter l’erreur grave trois fois sur quatre lorsque la situation s’y prêtait.

Ce que ça change, concrètement

Ce n’est pas un argument contre les agents. C’est un argument pour la conception.

Voici ce que nous en tirons, et ce que nous appliquons systématiquement.

Ne jamais demander seulement une réponse. Demander la réponse et le niveau de certitude, champ par champ. En dessous d’un seuil, le cas part en validation humaine. C’est la calibration, traitée par la conception plutôt que par l’espoir.

Ajouter des contrôles qui ne dépendent pas du modèle. La somme des lignes correspond-elle au total ? Ce fournisseur existe-t-il dans la base ? Ce numéro de facture a-t-il déjà été saisi ? Ce sont des vérifications de programmation ordinaire, et ce sont elles qui rendent un flux sûr — pas la performance du modèle.

Borner les conséquences. Un agent qui lit et propose ne présente aucun risque. Un agent qui écrit dans vos systèmes ou envoie des messages doit avoir une liste d’actions autorisées, des plafonds, et une validation humaine sur tout ce qui est irréversible.

Tester la cohérence, pas seulement la justesse. Soumettre vingt fois le même dossier et regarder si les réponses concordent. C’est un test que presque personne ne fait, et qui révèle immédiatement si un flux est mûr pour la production.

Commencer en observation. L’agent propose, un humain valide, pendant quelques semaines. On mesure l’écart. On n’élargit son autonomie que sur les catégories où l’écart est nul.

La phrase à retenir

Un agent capable n’est pas un agent fiable, et c’est la fiabilité qui détermine si vous pouvez le laisser travailler seul.

C’est une distinction ennuyeuse. Elle sépare les automatisations qui tiennent deux ans de celles qu’on débranche au bout de trois mois.

Sources

  1. AI agents are getting more capable, but reliability is lagging. And that is a problem — Fortune (mars 2026)
  2. AI reliability is a decade-old problem. And we’re still only solving half of it — Temporal (2026)

Questions fréquentes

Quelle est la différence entre capacité et fiabilité pour un agent IA ?
La capacité, c’est réussir une tâche. La fiabilité, c’est la réussir à chaque fois, dans les mêmes conditions, y compris quand l’entrée est inhabituelle. Un agent qui réussit neuf fois sur dix a une capacité excellente et une fiabilité inacceptable pour la plupart des process d’entreprise — parce que la dixième fois passe inaperçue et se découvre chez le client.
Comment mesurer la fiabilité d’un agent avant de le mettre en production ?
En le faisant tourner en parallèle du travail humain pendant une semaine, sur des cas réels, et en comparant. C’est ce que nous appelons la semaine à blanc, et elle n’est négociable dans aucune de nos livraisons. Les taux de réussite annoncés par les fournisseurs sont mesurés sur des jeux de tests publics ; les vôtres se mesurent sur vos documents, vos exceptions et vos clients.
Faut-il renoncer aux agents IA en entreprise ?
Non — il faut les placer là où une erreur coûte peu. Un agent qui prépare un brouillon relu par une personne apporte un gain réel sans risque. Le même agent autorisé à écrire dans un système ou à répondre à un client sans relecture crée une exposition qui n’est pas justifiée par l’état actuel de la technique. C’est une question de périmètre, pas de principe.
Qu’est-ce qui rend un agent moins fiable qu’un flux classique ?
Le fait qu’il choisisse. Un flux déterministe exécute toujours la même suite d’étapes et son comportement se prédit par lecture. Un agent décide à chaque exécution de ce qu’il va faire, ce qui le rend adaptable — et non reproductible. Pour un process aux règles écrites, cette adaptabilité n’apporte rien et coûte la vérifiabilité. C’est pourquoi l’agent n’occupe souvent qu’une étape dans nos chaînes.
Comment savoir ce qu’un agent a réellement fait ?
En l’exigeant à la construction, car aucun outil ne le fournit correctement par défaut. Chacune de nos mises en œuvre journalise les décisions prises, les données consultées et les actions effectuées, sous une forme lisible par une personne non technique. Un agent dont on ne peut pas reconstituer le raisonnement n’est pas exploitable en entreprise, quelle que soit la qualité de ses résultats.

Et chez vous ?

Si ce sujet recoupe un process qui vous prend du temps, décrivez-le-nous en deux phrases. Nous vous dirons franchement s’il mérite d’être automatisé.

Parlons-en

Un process, pour commencer

Celui qui vous agace le plus, ou celui qui coûte le plus. Dites-nous en deux phrases qui le fait, combien de fois par semaine, et avec quels outils. Nous vous dirons franchement s’il mérite d’être automatisé — y compris quand la réponse est non.

  • Réponse garantie sous 24 heures
  • Un premier échange d’une demi-heure, sans engagement
  • Aucun formulaire tiers : votre message part par votre messagerie

Ou directement : nicolas@oli-via-net.fr· 06 89 96 40 79

Le message s’ouvrira dans votre messagerie, prêt à partir.