Aller au contenu
Implementa.
Opinion··6 min

Pourquoi 95 % de précision de ton IA ne suffisent pas en production

La précision de l'IA en production se lit autrement qu'en démo : 95 % sonnent comme un 18/20 jusqu'à ce que tu te rappelles que c'est une mauvaise réponse sur vingt, et celle-là tombe devant un client. La thèse : le seuil n'est pas un chiffre universel, il est fixé par le coût de l'erreur. Quand 95 % suffisent, quand c'est un désastre, et quoi faire des 5 % qui restent toujours.

Managing Partner

Implementa

En démo, le chiffre brille : « 95 % de précision ». Applaudissements, hochements de tête, quelqu'un note que c'est « presque parfait ». Et ça en a l'air —jusqu'à ce que le système passe en production et que ces 95 % se traduisent en ce qu'ils signifient vraiment : une mauvaise réponse sur vingt. À cent cas par jour, cela fait cinq erreurs quotidiennes. À mille, cinquante. Et contrairement à la démo, où l'on montre les succès, en production les erreurs ne se cachent pas : elles tombent devant un client, dans un e-mail envoyé, dans un chiffre que quelqu'un a cru.

La thèse en une phrase : la précision de l'IA en production n'est pas un chiffre qu'on poursuit vers 100, c'est un seuil qui dépend du coût de l'erreur. 95 % peuvent suffire sur une tâche et être un désastre sur une autre, et le chiffre seul —hors contexte— ne te dit pas laquelle est la tienne. Ce qui décide si ton système est prêt n'est pas ce qu'il réussit, mais ce qui se passe quand il se trompe et qui le voit.

Ce que signifie vraiment la précision de l'IA en production

95 % de précision sonnent comme une mention parce qu'on les lit comme une note d'examen. Mais en production ce n'est pas une note, c'est un taux d'échec réparti sur du volume. Les 5 % restants ne s'évaporent pas : ils s'accumulent cas après cas, jour après jour, et croissent avec le trafic. Le système qui « ne ratait presque jamais » au test se met à rater tous les jours dès qu'il traite pour de vrai, simplement parce qu'il y a plus de cas où se tromper.

Il y a un deuxième piège dans le mot « précision » lui-même : c'est une moyenne, et les moyennes cachent. Un 95 % global peut vouloir dire que tu réussis 99 % des cas faciles et 60 % des cas difficiles —ceux qui comptent justement. En démo on montre les cas faciles ; en production arrivent les rares, les ambigus, les imprévus. Un chiffre moyen sans voir où tombent les erreurs est du marketing, pas une mesure de la solidité du système.

Le seuil n'est pas un chiffre, c'est le coût de l'erreur

La bonne question n'est pas « quelle précision ? », c'est « que coûte chaque erreur et qui la subit ? ». Le même 95 % est excellent ou inacceptable selon ce qui se passe quand ça échoue. Voici la carte courte :

Ce que fait le systèmeCoût d'une erreur95 % suffisent ?
Suggérer un brouillon qu'un humain relit avant l'envoiFaible : corrigé avant de sortirOui, largement
Classer et router (tickets, documents, leads)Moyen : re-routé ou reluEn général oui
Répondre à un client sans relecture humaineÉlevé : dommage d'image ou juridiqueNon
Décider sur l'argent, la santé ou la conformitéCritique : irréversible ou sanctionnableLoin de là

Remarque que la technologie est la même dans les quatre lignes ; ce qui change, c'est le filet en dessous. Quand l'erreur est bon marché et que quelqu'un l'attrape avant qu'elle sorte, 95 % sont une bonne nouvelle. Quand l'erreur est chère et sort directement, sans relecture, ces mêmes 95 % sont une bombe à retardement dont le compte à rebours dépend du volume. Le seuil ne s'hérite donc pas du benchmark du fournisseur : il se décide tâche par tâche, en regardant ce qui se passe le jour où ça se trompe.

Les 5 % ne disparaissent pas : ils se gèrent

Le 100 % n'existe pas, et le poursuivre est la façon la plus chère de ne jamais finir. Le vrai travail n'est pas d'arracher deux décimales de plus ; c'est de concevoir ce qui arrive aux 5 % qui échoueront toujours. Un système en production ne se juge pas à sa réussite, mais à son comportement quand il se trompe. Ça se construit en quatre pièces :

  • Détecter l'incertitude. Un bon système sait quand il n'est pas sûr et le dit, au lieu de répondre avec la même assurance à ce qu'il maîtrise et à ce qu'il ignore. Ce signal déclenche tout le reste.
  • Contenir avec une relecture humaine là où l'erreur est chère. Pas partout —ça tue les économies— mais précisément sur les cas à coût élevé. C'est l'humain dans la boucle placé là où il faut vraiment : filtrer les 5 % dangereux, laisser passer les 95 % sûrs.
  • Mesurer avec des cas réels, pas les faciles. Un système d'évaluation qui fait tourner tes cas difficiles —pas un échantillon aimable— est la seule chose qui te dit si les 95 % sont réels ou de vitrine.
  • Le borner : qu'il dise « je ne sais pas ». Un système qui admet ne pas pouvoir répondre vaut plus qu'un qui invente avec aplomb. L'erreur silencieuse —celle qui a l'air correcte et ne l'est pas— est la plus chère de toutes.

C'est d'ailleurs la différence entre un projet qui atteint la production et un qui reste un pilote éternel. Les pilotes meurent quand quelqu'un découvre que les 5 % n'étaient pas gérés et que personne n'ose les lâcher sans filet. C'est une des raisons de fond de pourquoi les projets d'automatisation IA échouent : pas par manque de précision, mais par manque de plan pour l'erreur.

Pourquoi le chiffre du fournisseur ment un peu

Quand un fournisseur te montre « 95 % », ce n'est presque jamais sur tes données : c'est sur son benchmark, choisi par lui, avec une distribution de cas qui n'a pas à ressembler à la tienne. Ton 95 % réel peut devenir 88 % dès que tu lui donnes tes cas rares, ton jargon, tes exceptions. Pas forcément de la mauvaise foi ; c'est que la précision n'est pas une propriété du modèle, c'est une propriété du couple modèle + tes données. Bien la mesurer, c'est faire tourner des évaluations sur tes propres cas avant de faire confiance au chiffre, pas après la première plainte.

Et une nuance qui évite des disputes : demande toujours de séparer la précision des cas faciles de celle des difficiles. Si le fournisseur n'a que la moyenne globale, il n'a pas regardé où ça fait mal. S'il l'a détaillée et te la montre, tu as affaire à quelqu'un qui sait ce qu'il vend.

Alors, quand 95 % suffisent-ils ?

La réponse honnête en deux phrases. Ça suffit quand l'erreur est bon marché et qu'il y a un filet : un humain qui relit le coûteux, une nouvelle tentative, un « je ne sais pas » qui évite d'inventer. Ça ne suffit pas quand l'erreur est chère et va droit au client sans personne pour la filtrer. Le chiffre seul ne te dit pas dans lequel des deux mondes tu es ; c'est le design autour des 5 % qui te le dit. Alors quand on te vend un pourcentage comme argument final, la bonne question n'est pas « c'est bien 95 ? », c'est « et les 5 autres ? ».

Continue à lire

D'autres articles sur Opinion

Opinion

IA générative et propriété intellectuelle : ce que ton prestataire ne signe pas

L'IA générative et la propriété intellectuelle en entreprise cessent d'être des petites lignes dès que ton équipe génère des textes, des images et du code avec l'outil d'un autre. Trois questions décident si ce que tu produis est à toi ou un procès à date ouverte : à qui appartient ce que la machine génère, sur quoi elle a été entraînée, et ce qui se passe si elle copie quelque chose de protégé. Et ce sont justement celles que le contrat du prestataire esquive. Pas de théâtre : ce qu'il faut exiger par écrit avant de signer.

8 min de lectura

Opinion

Benchmarks de LLM : pourquoi le classement ne prédit pas ton résultat

Choisir un modèle par les benchmarks de LLM pour l'entreprise, c'est commencer au mauvais endroit. Le numéro un du classement gagne un examen standardisé qui ne ressemble en rien à ton travail : tes données, ta tâche et ton contexte décident qui performe dans ton cas, et ça n'est dans aucun tableau. Pas de théâtre : pourquoi le classement est du marketing et le seul benchmark qui compte est celui que tu lances.

6 min de lectura

GEOOpinion

GEO : comment distinguer celui qui l’implémente de celui qui vend du vent

Le marché du GEO se remplit de théâtre : des agences qui vendent du vent en ré-étiquetant le « SEO avec des prompts ». Quatre signaux pour distinguer celui qui l’implémente vraiment de celui qui a juste changé la couverture du rapport. Et les questions exactes qui démontent le discours.

7 min de lectura

On le laisse tourner ?

Si ça t'a parlé, conversation de 30 minutes sans engagement. On te dit ce qui colle, ce qui ne colle pas et le prix approximatif.

Voir les cas
Pourquoi 95 % de précision de ton IA ne suffisent pas en production · Implementa