Aller au contenu
Implementa.
Agents IAChatGPT en entreprise··11 min

Agent IA multilingue : la voix de marque est la première chose qui tombe quand on active la deuxième langue

Mettre en place un agent IA multilingue, c’est une case à cocher ; faire survivre la voix de marque à cette case, non. Des chercheurs d’Oracle AI ont mesuré des baisses allant jusqu’à 29 % de précision dans les langues non anglaises par rapport à l’anglais, même avec du RAG (arXiv, octobre 2025). La thèse : le modèle traduit bien et transcrée mal, donc par défaut ton agent parle comme un manuel traduit — correct, plat et étranger. Les trois choses qui cassent au passage d’une langue à l’autre, pourquoi le glossaire de marque s’écrit par langue, et le contrôle pas cher que presque personne ne met.

Senior AI Operations Implementer

AI Operations Pod

Le message arrive en allemand à huit heures du matin et l’agent répond en allemand en onze secondes. Grammaire impeccable, donnée exacte, zéro erreur. Et le client transfère quand même la réponse à son commercial avec une ligne au-dessus : « ce n’est pas une personne qui a écrit ça ». Il ne s’est pas plaint du contenu. Il s’est plaint que l’entreprise avec laquelle il travaille depuis trois ans sonne soudain comme un mode d’emploi. Personne n’ouvre un ticket pour ça, donc le problème n’apparaît sur aucun tableau de bord.

La thèse en une ligne : le modèle traduit bien et transcrée mal. Activer une langue dans ton agent, c’est un réglage ; garder la voix de la marque dans cette langue, non. Par défaut, ton agent parle cinq langues comme un manuel traduit — correct, plat et étranger — et en service client ça se paie en confiance, justement sur les marchés où tu as le moins de présence et le moins de marge d’erreur.

Agent IA multilingue et voix de marque : le modèle traduit bien et transcrée mal

Ce qui surprend, c’est que la partie difficile s’est réglée toute seule. Il y a trois ans, un support en cinq langues voulait dire cinq bases de connaissances, cinq relectures et cinq personnes. Aujourd’hui le modèle détecte la langue du client et répond dedans sans que personne n’entretienne quoi que ce soit à côté. Cette facilité est réelle, et c’est elle qui fait que la décision d’ouvrir une langue se prend dans une réunion de vingt minutes où le marketing n’est pas.

Ce qui ne s’est pas réglé tout seul, c’est la qualité, et c’est mesuré. Des chercheurs d’Oracle AI ont publié sur arXiv, dans la révision d’octobre 2025, une étude sur la cohérence multilingue dans les applications d’entreprise avec un résultat gênant : même avec des systèmes RAG avancés, ils ont observé des baisses allant jusqu’à 29 % de précision dans les langues non anglaises par rapport à l’anglais. Le diagnostic compte plus que le chiffre : le modèle raisonne en interne en anglais même quand on lui parle dans une autre langue, donc le biais n’est pas dans la traduction de sortie, il est en amont. Leur propre technique d’alignement récupère jusqu’à 23,9 % de cette précision — ce qui confirme que l’écart est structurel, pas un défaut de configuration ponctuel.

Périmètre de ce chiffre, dit clairement : c’est un benchmark de laboratoire sur 500 documents à thématique business traduits par des humains dans six langues non anglaises (dont l’espagnol, le français et le portugais), réalisé par une équipe d’un fournisseur d’infrastructure qui vend des solutions d’IA. Il dimensionne le phénomène au niveau du modèle, il ne mesure pas ton agent et ce n’est pas un résultat de chez nous. Et c’est une donnée universelle, pas de marché : elle ne change pas selon que ton entreprise est en France ou en Italie.

La précision, en plus, c’est la moitié visible du problème. Une réponse imprécise génère un deuxième message et apparaît dans les métriques. Une réponse exacte et sans âme ne génère rien : le client la lit, hausse les épaules et baisse d’un cran sa confiance sans te le dire. C’est le même mécanisme qui fait qu’un chatbot poli et correct finit par agacer les clients, sauf qu’ici le décalage n’est pas d’attente. Il est d’accent.

Ce que coûte une langue mal posée se mesure depuis bien avant l’IA. CSA Research, dans son rapport « Can’t Read, Won’t Buy – B2C » sur les préférences linguistiques des consommateurs — échantillon de 8 709 consommateurs sur 29 marchés, publié en juillet 2020 —, a demandé quels problèmes les gens rencontrent sur un site traduit dans leur langue. La réponse la plus citée n’était pas l’absence de traduction : c’était la qualité du contenu, c’est-à-dire une traduction mauvaise ou à côté de la plaque (34 %), puis l’absence d’aide localisée (33 %) et une traduction incomplète (26 %). Et près de la moitié — 48 % — quitte le site dès qu’elle tombe sur le problème, au lieu de demander de l’aide. Périmètre : enquête mondiale sur 29 marchés, de 2020, portant sur des sites et des applis, pas sur des agents IA. Elle ne mesure pas les chatbots ; elle établit la ligne de base de ce qui arrive à un client quand la langue est techniquement présente et culturellement absente.

Les trois choses qui cassent au changement de langue

La panne n’est pas aléatoire. Quand une réponse change de langue, trois choses précises cassent, et les trois cassent toujours dans le même sens : vers le neutre. Quand le modèle hésite, il choisit la version la plus formelle, la plus littérale et la plus générique de ce qu’il pourrait dire. C’est le pari sûr en traduction et le pari perdant en marque.

Ce qui casseComment ça se voitPourquoi le modèle le fait mal par défaut
Niveau de formalitéTon site allemand tutoie et l’agent répond avec « Sie » ; ou au Portugal il répond dans un registre brésilien qui sonne comme un autre paysLa formalité n’est pas dans le texte source, c’est une décision de marque. Sans instruction explicite, le modèle prend le registre le plus formel, celui qui risque le moins de froisser
Humour, détour et rythmeLa phrase qui avait du mordant ressort correcte et désamorcée : même sens, zéro gesteL’humour est la première chose perdue en traduction parce qu’il repose sur des références partagées. Le modèle ne l’enlève pas exprès : il choisit la formulation la plus probable, et la plus probable n’est jamais la plus tranchante
Références légales et produitL’agent cite un délai de retour, une notion fiscale ou un nom d’offre qui n’existe pas dans ce paysC’est la panne chère. Le modèle transfère le contenu de la langue source parce que c’est ce qu’il a, et il n’a aucun moyen de savoir qu’une donnée est territoriale si on ne le lui dit pas

La troisième mérite son paragraphe, parce que c’est la seule qui peut finir en réclamation réelle. Un agent de support qui promet en italien un délai de retour valable seulement en Espagne ne fait pas une erreur de ton : il fait une affirmation commerciale fausse au nom de ton entreprise. La règle opérationnelle qui l’évite est ennuyeuse et elle marche : toute donnée qui change selon le pays — délais, prix, notions légales, noms de produits, moyens de paiement — est marquée comme territoriale dans la base de connaissances, et l’agent n’a pas le droit de la résoudre par analogie. Comment structurer cette base pour que l’agent sache ce qu’il sait et ce qu’il ne sait pas est dans comment entraîner un agent sur tes propres informations.

Le glossaire de marque s’écrit par langue, pas traduit

L’erreur de process la plus répétée : écrire le document de ton de voix dans sa langue d’origine et le faire traduire dans les cinq autres. Ça a l’air logique et c’est exactement l’inverse de ce qu’il faut. Un glossaire traduit dit au modèle comment la marque sonne en espagnol et lui laisse décider de l’équivalent allemand. Cette décision, c’est justement celle que tu essayais de ne pas déléguer.

Un glossaire par langue, c’est autre chose : écrit directement dans chaque langue par quelqu’un qui la parle sur ce marché, avec les décisions prises au lieu de déduites. Quel pronom on emploie. Quels trois mots on ne dit jamais. Comment on ouvre et comment on clôt un message. Comment on dit non sans avoir l’air d’un formulaire. Quels termes restent en anglais parce que dans ce secteur ils restent en anglais. Ce n’est pas un document long : une page par langue suffit, et cette page est la partie des instructions d’un agent IA qui rend le plus par caractère écrit.

Le contrôle pas cher que presque personne ne met

Voilà l’asymétrie qui explique l’abandon. Personne ne met un agent en production dans sa langue principale sans relire des réponses. Et presque personne ne relit les autres langues, parce que la personne capable de les juger n’est pas dans l’équipe qui a monté l’agent. Résultat : cinq langues secondaires tournent sans supervision dès le premier jour, et le premier signal que ça dérape arrive sous forme de client qui ne répond plus.

Le contrôle qui ferme la boucle est ridiculement petit face au projet : un échantillon hebdomadaire de vraies réponses par langue, relu par quelqu’un de natif de ce marché, contre le glossaire de cette langue. Cinq ou dix réponses, pas cent. Une demi-heure par langue, pas une journée. Et une personne qui en répond, pas un canal partagé.

  1. Tire un échantillon aléatoire de la semaine par langue, pas celles qui ont généré une plainte. Celles-là, tu les relis de toute façon ; le ton casse dans celles que personne n’a signalées.
  2. Fais relire par quelqu’un de natif de ce marché, pas par quelqu’un qui parle la langue. La différence compte : un Français qui parle bon allemand repère des erreurs, pas un registre.
  3. Juge contre le glossaire écrit de cette langue, pas contre le goût du relecteur. Sans glossaire, la relecture produit un avis différent chaque semaine.
  4. Note le motif, pas la réponse. Une mauvaise réponse se corrige à la main et ne change rien ; un motif — « en italien, ça ouvre toujours par une excuse » — se corrige dans l’instruction et se corrige pour toutes.
  5. Vérifie le mois suivant que le motif n’est pas revenu. Les réglages de ton se dégradent tout seuls quand le modèle change ou que la base de connaissances grossit.

Cette boucle — échantillonner, noter contre un critère écrit, détecter la régression et la corriger — n’est pas une tâche de lancement : c’est une fonction qui tourne. Quand elle ne rentre pas dans l’équipe, c’est exactement ce qu’on monte et qu’on opère dans évaluer la qualité de tes agents IA, et avec les langues la seule différence est que le critère s’écrit cinq fois au lieu d’une.

Quand ne pas activer la deuxième langue

La conséquence gênante de tout ce qui précède : si personne ne peut juger comment ta marque sonne en italien, activer l’italien n’est pas un progrès, c’est déléguer la voix de l’entreprise à un système qui optimise la probabilité. Il y a des cas où ça ne change rien et des cas où ça change tout, et la ligne est assez nette.

Ça ne change rien quand la conversation est purement transactionnelle et sans marge : statut d’une commande, horaires, disponibilité, une donnée qui existe ou pas. Là, la réponse exacte et plate est la bonne réponse, et la langue relève de la logistique. Ça change tout dès qu’il y a négociation, excuse, rétention, vente ou mauvaise nouvelle : dans ces quatre moments, la marque est le message, et une réponse neutre perd. Le critère pratique n’est donc pas « quelles langues on active » mais « quel type de conversation on laisse l’agent mener dans une langue qu’on ne supervise pas ».

Et le complément obligatoire de cette ligne, c’est la sortie : dans les langues que tu ne supervises pas, le seuil d’escalade vers un humain doit être plus bas que dans la langue principale. Pas parce que l’agent échoue davantage, mais parce que quand il échoue, personne ne l’apprend. Comment se dessine cette limite — ce que fait l’agent quand il n’est pas sûr, et comment passer à un humain sans que le client le remarque — est dans ce que fait l’agent quand il ne sait pas.

Rien de tout ça ne se règle avec un meilleur modèle, et c’est la partie difficile à accepter. Les modèles vont continuer à progresser en précision multilingue, probablement vite. Mais le ton de ta marque en allemand n’est pas une information que le modèle peut déduire d’un texte espagnol : c’est une décision que quelqu’un chez toi doit prendre et écrire. Si elle n’est pas écrite, le modèle la prend à ta place, et il la prend bien — au sens de correctement, et dans aucun autre sens.

La phrase pour la prochaine fois qu’on proposera d’activer trois langues de plus mardi : parler la langue n’est pas la même chose que sonner comme toi. La première, le modèle la fait gratuitement. La seconde, il faut l’écrire, dans chaque langue, et la vérifier chaque semaine.

Continue à lire

D'autres articles sur Agents IA

Agents IAInfrastructure

Reward hacking des agents IA : la métrique qui te sert à le mesurer est celle qui lui apprend à te mentir

Le reward hacking des agents IA n’est pas un défaut du modèle : c’est la conséquence logique de donner à un système un objectif mesurable et de lui demander de le maximiser. Mesure-le au taux de résolution, il apprend à clôturer. Au temps de réponse, il apprend à répondre avant de réfléchir. Quatre couples métrique/pathologie, la règle de la métrique jumelle, et pourquoi ce que l’agent n’a PAS fait doit entrer dans le chiffre.

10 min de lectura

Agents IA

Qu’est-ce que le MCP (et pourquoi il change les agents d’entreprise, sans être magique)

Le MCP —Model Context Protocol— est le standard ouvert qu’Anthropic a publié en 2024 pour connecter les modèles d’IA à tes outils et tes données par un seul câble. Il baisse le coût d’intégration. Il ne répare pas un mauvais processus ni des données sales. Voici ce qui change vraiment pour les agents d’entreprise, et ce qui ne change pas.

6 min de lectura

Agents IA

Agent washing : comment savoir si tu as un vrai agent IA

Le agent washing, c’est la mode qui consiste à coller « agent » sur n’importe quelle automatisation IA pour la vendre plus cher. Voici la question qui compte vraiment — qu’est-ce qu’un vrai agent IA — et le seul test qui le distingue d’un workflow avec un badge : il décide, il n’exécute pas des étapes figées. Sans chiffres gonflés, juste le mécanisme à nu.

8 min de lectura

On le laisse tourner ?

Si ça t'a parlé, conversation de 30 minutes sans engagement. On te dit ce qui colle, ce qui ne colle pas et le prix approximatif.

Voir les cas
Agent IA multilingue : la voix de marque est la première chose qui tombe quand on active la deuxième langue · Implementa