Il messaggio arriva in tedesco alle otto del mattino e l’agente risponde in tedesco in undici secondi. Grammatica impeccabile, dato esatto, zero errori. E il cliente inoltra comunque la risposta al suo commerciale con una riga sopra: «questo non l’ha scritto una persona». Non si è lamentato del contenuto. Si è lamentato che l’azienda con cui lavora da tre anni suoni all’improvviso come un libretto di istruzioni. Per questo nessuno apre un ticket, quindi il problema non compare in nessuna dashboard.
La tesi in una riga: il modello traduce bene e transcrea male. Attivare una lingua nel tuo agente è un’impostazione; mantenere la voce del brand dentro quella lingua, no. Per default il tuo agente parla cinque lingue come un manuale tradotto — corretto, piatto ed estraneo — e nel servizio clienti questo si paga in fiducia, proprio nei mercati dove hai meno presenza e meno margine d’errore.
Agente IA multilingua e voce del brand: il modello traduce bene e transcrea male
Quello che sorprende è che la parte difficile si è risolta da sola. Tre anni fa un supporto in cinque lingue significava cinque basi di conoscenza, cinque revisioni e cinque persone. Oggi il modello rileva la lingua del cliente e risponde in quella senza che nessuno mantenga nulla a parte. Quella facilità è reale, ed è il motivo per cui la decisione di aprire una lingua si prende in una riunione di venti minuti in cui il marketing non c’è.
Quello che non si è risolto da solo è la qualità, ed è misurato. Ricercatori di Oracle AI hanno pubblicato su arXiv, nella revisione di ottobre 2025, uno studio sulla coerenza multilingua nelle applicazioni aziendali con un risultato scomodo: anche con sistemi RAG avanzati hanno osservato cali fino al 29% di precisione nelle lingue non inglesi rispetto all’inglese. La diagnosi conta più del numero: il modello ragiona internamente in inglese anche quando gli parli in un’altra lingua, quindi il bias non sta nella traduzione in uscita, sta prima. La loro tecnica di allineamento recupera fino al 23,9% di quella precisione — il che conferma che il divario è strutturale, non un difetto di configurazione isolato.
Ambito di quel dato, detto chiaro: è un benchmark di laboratorio su 500 documenti di tema aziendale tradotti da esseri umani in sei lingue non inglesi (fra cui spagnolo, francese e portoghese), realizzato da un team di un fornitore di infrastruttura che vende soluzioni di IA. Dimensiona il fenomeno a livello di modello, non misura il tuo agente e non è un risultato nostro. Ed è un dato universale, non di mercato: non cambia a seconda che la tua azienda sia in Italia o in Spagna.
La precisione, poi, è la metà visibile del problema. Una risposta imprecisa genera un secondo messaggio e compare nelle metriche. Una risposta esatta e senz’anima non genera nulla: il cliente la legge, alza le spalle e abbassa di un punto la fiducia senza dirtelo. È lo stesso meccanismo per cui un chatbot educato e corretto finisce per irritare i clienti, solo che qui lo scarto non è di aspettativa. È di accento.
Quanto costa una lingua messa male si misura da ben prima dell’IA. CSA Research, nel suo rapporto «Can’t Read, Won’t Buy – B2C» sulle preferenze linguistiche dei consumatori — campione di 8.709 consumatori in 29 mercati, pubblicato a luglio 2020 —, ha chiesto quali problemi incontra la gente su un sito tradotto nella propria lingua. La risposta più citata non era la traduzione mancante: era la qualità del contenuto, cioè una traduzione sbagliata o fuori bersaglio (34%), seguita dall’assenza di aiuto localizzato (33%) e da una traduzione incompleta (26%). E quasi la metà — il 48% — abbandona il sito appena incontra il problema, invece di chiedere aiuto. Ambito: indagine globale su 29 mercati, del 2020, su siti e app, non su agenti di IA. Non misura i chatbot; stabilisce la linea di base di cosa succede a un cliente quando la lingua è tecnicamente presente e culturalmente assente.
Le tre cose che si rompono cambiando lingua
Il guasto non è casuale. Quando una risposta cambia lingua si rompono tre cose precise, e tutte e tre si rompono sempre nella stessa direzione: verso il neutro. Quando il modello esita, sceglie la versione più formale, più letterale e più generica di quello che potrebbe dire. In traduzione è la scommessa sicura; per il brand è quella perdente.
| Cosa si rompe | Come si vede | Perché il modello lo sbaglia per default |
|---|---|---|
| Livello di formalità | Il tuo sito tedesco dà del tu e l’agente risponde con «Sie»; oppure in Portogallo risponde in un registro brasiliano che suona come un altro paese | La formalità non sta nel testo di partenza, è una decisione di marca. Senza istruzione esplicita il modello sceglie il registro più formale, quello che rischia meno di offendere |
| Ironia, giro di frase e ritmo | La frase che aveva mordente esce corretta e disinnescata: stesso significato, zero gesto | L’ironia è la prima cosa che si perde traducendo perché poggia su riferimenti condivisi. Il modello non la toglie apposta: sceglie la formulazione più probabile, e la più probabile non è mai la più affilata |
| Riferimenti legali e di prodotto | L’agente cita un termine di reso, una voce fiscale o un nome di piano che in quel paese non esiste | È il guasto caro. Il modello trasferisce il contenuto dalla lingua di partenza perché è quello che ha, e non ha modo di sapere che un dato è territoriale se non glielo dici |
La terza merita un paragrafo a parte, perché è l’unica che può finire in un reclamo vero. Un agente di supporto che promette a un cliente italiano un termine di reso valido solo in Spagna non sta facendo un errore di tono: sta facendo un’affermazione commerciale falsa a nome della tua azienda. La regola operativa che lo evita è noiosa e funziona: ogni dato che cambia in base al paese — termini, prezzi, voci legali, nomi di prodotto, metodi di pagamento — viene marcato come territoriale nella base di conoscenza, e l’agente non può risolverlo per analogia. Come si struttura quella base perché l’agente sappia cosa sa e cosa non sa è in come addestrare un agente con le tue informazioni.
Il glossario di marca si scrive per lingua, non tradotto
L’errore di processo più ripetuto: scrivere il documento di tono di voce nella lingua d’origine e farlo tradurre nelle altre cinque. Sembra la cosa logica ed è esattamente il contrario di quello che serve. Un glossario tradotto dice al modello come suona il brand in spagnolo e gli lascia decidere quale sia l’equivalente in tedesco. Quella decisione è proprio quella che stavi cercando di non delegare.
Un glossario per lingua è un’altra cosa: scritto direttamente in ogni lingua da qualcuno che la parla in quel mercato, con le decisioni prese invece che dedotte. Quale pronome si usa. Quali tre parole non si dicono mai. Come si apre e come si chiude un messaggio. Come si dice no senza sembrare un modulo. Quali termini restano in inglese perché in quel settore restano in inglese. Non è un documento lungo: una pagina per lingua basta, e quella pagina è la parte delle istruzioni di un agente di IA che rende di più per carattere scritto.
Il controllo economico che quasi nessuno mette
Ecco l’asimmetria che spiega l’abbandono. Nessuno manda in produzione un agente nella lingua principale senza rivedere le risposte. E quasi nessuno rivede le altre lingue, perché chi potrebbe giudicarle non è nel team che ha montato l’agente. Risultato: cinque lingue secondarie girano senza supervisione dal primo giorno, e il primo segnale che qualcosa non va arriva sotto forma di cliente che smette di rispondere.
Il controllo che chiude il cerchio è ridicolmente piccolo rispetto al progetto: un campione settimanale di risposte reali per lingua, riletto da qualcuno nativo di quel mercato, contro il glossario di quella lingua. Cinque o dieci risposte, non cento. Mezz’ora per lingua, non una giornata. E una persona che ne risponde, non un canale condiviso.
- Estrai un campione casuale della settimana per lingua, non quelle che hanno generato un reclamo. Quelle le rivedi comunque; il tono si rompe in quelle che nessuno ha segnalato.
- Falle rileggere da qualcuno nativo di quel mercato, non da qualcuno che parla la lingua. La differenza conta: un italiano che parla buon tedesco individua errori, non registro.
- Giudica contro il glossario scritto di quella lingua, non contro il gusto del revisore. Senza glossario, la revisione produce un parere diverso ogni settimana.
- Annota lo schema, non la risposta. Una risposta sbagliata si corregge a mano e non cambia nulla; uno schema — «in italiano apre sempre con una scusa» — si corregge nell’istruzione e si corregge per tutte.
- Verifica il mese dopo che lo schema non sia tornato. Le correzioni di tono si degradano da sole quando cambia il modello o cresce la base di conoscenza.
Quel ciclo — campionare, valutare contro un criterio scritto, individuare la regressione e correggerla — non è un compito di lancio: è una funzione che gira. Quando non entra nel team, è esattamente quello che montiamo e operiamo in valutare la qualità dei tuoi agenti di IA, e con le lingue l’unica differenza è che il criterio si scrive cinque volte invece di una.
Quando non attivare la seconda lingua
La conseguenza scomoda di tutto questo: se nessuno può giudicare come suona il tuo brand in tedesco, attivare il tedesco non è un progresso, è delegare la voce dell’azienda a un sistema che ottimizza per probabilità. Ci sono casi in cui non cambia niente e casi in cui cambia tutto, e la linea è abbastanza netta.
Non cambia niente quando la conversazione è puramente transazionale e senza margine: stato di un ordine, orari, disponibilità, un dato che c’è o non c’è. Lì la risposta esatta e piatta è la risposta giusta, e la lingua è logistica. Cambia tutto appena c’è trattativa, scusa, retention, vendita o cattiva notizia: in quei quattro momenti il brand è il messaggio, e una risposta neutra perde. Il criterio pratico, quindi, non è «quali lingue attiviamo» ma «che tipo di conversazione lasciamo condurre all’agente in una lingua che non supervisioniamo».
E il complemento obbligatorio di quella linea è l’uscita: nelle lingue che non supervisioni, la soglia per passare a una persona deve essere più bassa che nella principale. Non perché l’agente sbagli di più, ma perché quando sbaglia non se ne accorge nessuno. Come si progetta quel limite — cosa fa l’agente quando non è sicuro, e come si passa a un umano senza che il cliente se ne accorga — è in cosa fa l’agente quando non sa.
Niente di tutto questo si risolve con un modello migliore, ed è la parte difficile da accettare. I modelli continueranno a migliorare in precisione multilingua, probabilmente in fretta. Ma il tono del tuo brand in tedesco non è un’informazione che il modello possa dedurre da un testo spagnolo: è una decisione che qualcuno nella tua azienda deve prendere e scrivere. Se non è scritta, il modello la prende al posto tuo, e la prende bene — nel senso di correttamente, e in nessun altro senso.
La frase per la prossima volta che qualcuno proporrà di attivare altre tre lingue martedì: parlare la lingua non è lo stesso che suonare come te. La prima cosa il modello la fa gratis. La seconda va scritta, in ogni lingua, e verificata ogni settimana.