A mensagem entra em alemão às oito da manhã e o agente responde em alemão em onze segundos. Gramática impecável, dado certo, zero erros. E mesmo assim o cliente reencaminha a resposta ao comercial com uma linha por cima: «isto não foi escrito por uma pessoa». Não se queixou do conteúdo. Queixou-se de que a empresa com quem trabalha há três anos soa de repente a manual de instruções. Ninguém abre um ticket por causa disso, por isso o problema não aparece em painel nenhum.
A tese numa linha: o modelo traduz bem e transcria mal. Ligar um idioma no teu agente é uma definição; manter a voz da marca dentro desse idioma, não. Por omissão, o teu agente fala cinco idiomas como um manual traduzido — correto, plano e alheio — e no apoio ao cliente isso paga-se em confiança, precisamente nos mercados onde tens menos presença e menos margem de erro.
Agente de IA multilingue e voz da marca: o modelo traduz bem e transcria mal
O que surpreende é que a parte difícil se resolveu sozinha. Há três anos, apoio em cinco idiomas significava cinco bases de conhecimento, cinco revisões e cinco pessoas. Hoje o modelo deteta o idioma do cliente e responde nele sem que ninguém mantenha nada à parte. Essa facilidade é real, e é por causa dela que a decisão de abrir um idioma se toma numa reunião de vinte minutos onde o marketing não está.
O que não se resolveu sozinho foi a qualidade, e está medido. Investigadores da Oracle AI publicaram no arXiv, na revisão de outubro de 2025, um estudo sobre consistência multilingue em aplicações empresariais com um resultado incómodo: mesmo com sistemas RAG avançados observaram quedas até 29% de precisão em idiomas não ingleses face ao inglês. O diagnóstico conta mais do que o número: o modelo raciocina internamente em inglês mesmo quando lhe falas noutro idioma, por isso o enviesamento não está na tradução de saída, está antes dela. A técnica de alinhamento que propõem recupera até 23,9% dessa precisão — o que confirma que a falha é estrutural, não um defeito pontual de configuração.
Âmbito desse número, dito com clareza: é um benchmark de laboratório sobre 500 documentos de temática empresarial traduzidos por humanos para seis idiomas não ingleses (entre eles espanhol, francês e português), feito por uma equipa de um fornecedor de infraestrutura que vende soluções de IA. Dimensiona o fenómeno ao nível do modelo, não mede o teu agente e não é um resultado nosso. E é um dado universal, não de mercado: não muda consoante a tua empresa esteja em Portugal ou em Itália.
A precisão é, além disso, a metade visível do problema. Uma resposta imprecisa gera uma segunda mensagem e aparece nas métricas. Uma resposta certa e sem alma não gera nada: o cliente lê-a, encolhe os ombros e baixa um ponto de confiança sem te dizer. É o mesmo mecanismo que faz com que um chatbot educado e correto acabe por irritar os clientes, só que aqui o desencontro não é de expectativa. É de sotaque.
Quanto custa um idioma mal posto mede-se desde muito antes da IA. A CSA Research, no seu relatório «Can’t Read, Won’t Buy – B2C» sobre preferências linguísticas dos consumidores — amostra de 8.709 consumidores em 29 mercados, publicado em julho de 2020 —, perguntou que problemas as pessoas encontram num site traduzido para a sua língua. A resposta mais citada não foi a falta de tradução: foi a qualidade do conteúdo, ou seja, a tradução estar má ou fora do alvo (34%), seguida de não haver ajuda localizada (33%) e de a tradução estar incompleta (26%). E quase metade — 48% — abandona o site assim que esbarra no problema, em vez de pedir ajuda. Âmbito: inquérito global a 29 mercados, de 2020, sobre sites e aplicações, não sobre agentes de IA. Não mede chatbots; estabelece a linha de base do que acontece a um cliente quando o idioma está tecnicamente presente e culturalmente ausente.
As três coisas que se partem ao mudar de idioma
A avaria não é aleatória. Quando uma resposta muda de idioma partem-se três coisas concretas, e as três partem-se sempre na mesma direção: para o neutro. Quando o modelo hesita, escolhe a versão mais formal, mais literal e mais genérica do que poderia dizer. Em tradução é a aposta segura; em marca é a aposta perdedora.
| O que se parte | Como se nota | Porque é que o modelo o faz mal por omissão |
|---|---|---|
| Nível de formalidade | O teu site alemão trata por tu e o agente responde com «Sie»; ou em Portugal responde num registo brasileiro que soa a outro país | A formalidade não está no texto de origem, é uma decisão de marca. Sem instrução explícita, o modelo escolhe o registo mais formal, o que menos arrisca ofender |
| Humor, rodeio e ritmo | A frase com fio sai correta e desarmada: mesmo significado, zero gesto | O humor é a primeira coisa que se perde a traduzir porque assenta em referências partilhadas. O modelo não o retira de propósito: escolhe a formulação mais provável, e a mais provável nunca é a mais afiada |
| Referências legais e de produto | O agente menciona um prazo de devolução, uma figura fiscal ou um nome de plano que não existe nesse país | É a avaria cara. O modelo transfere o conteúdo do idioma de origem porque é o que tem, e não tem como saber que um dado é territorial se não lho disseres |
A terceira merece parágrafo próprio, porque é a única que pode acabar em reclamação a sério. Um agente de apoio que promete a um cliente italiano um prazo de devolução que só se aplica em Espanha não está a cometer um erro de tom: está a fazer uma afirmação comercial falsa em nome da tua empresa. A regra operacional que o evita é aborrecida e funciona: todo o dado que muda consoante o país — prazos, preços, figuras legais, nomes de produto, meios de pagamento — é marcado como territorial na base de conhecimento, e o agente não pode resolvê-lo por analogia. Como se estrutura essa base para que o agente saiba o que sabe e o que não sabe está em como treinar um agente com a tua própria informação.
O glossário de marca escreve-se por idioma, não traduzido
O erro de processo mais repetido: escrever o documento de tom de voz na língua de origem e mandá-lo traduzir para as outras cinco. Parece o lógico e é exatamente o contrário do que é preciso. Um glossário traduzido diz ao modelo como soa a marca em espanhol e deixa-lhe a decisão de qual é o equivalente em alemão. Essa decisão é precisamente a que estavas a tentar não delegar.
Um glossário por idioma é outra coisa: escrito diretamente em cada língua por alguém que a fala nesse mercado, com as decisões tomadas em vez de deduzidas. Que pronome se usa. Que três palavras nunca se dizem. Como se abre e como se fecha uma mensagem. Como se diz não sem soar a formulário. Que termos ficam em inglês porque nesse setor ficam em inglês. Não é um documento longo: uma página por idioma chega, e essa página é a parte das instruções de um agente de IA que mais rende por caractere escrito.
O controlo barato que quase ninguém põe
Aqui está a assimetria que explica o abandono. Ninguém põe um agente em produção no idioma principal sem rever respostas. E quase ninguém revê os outros idiomas, porque quem poderia julgá-las não está na equipa que montou o agente. O resultado é que cinco idiomas secundários funcionam sem supervisão desde o primeiro dia, e o primeiro sinal de que algo corre mal chega em forma de cliente que deixa de responder.
O controlo que fecha isto é ridiculamente pequeno em comparação com o projeto: uma amostra semanal de respostas reais por idioma, revista por alguém nativo desse mercado, contra o glossário desse idioma. Cinco ou dez respostas, não cem. Meia hora por idioma, não um dia inteiro. E uma pessoa que responda por isso, não um canal partilhado.
- Tira uma amostra aleatória da semana por idioma, não as que geraram queixa. Essas revês na mesma; o tom parte-se nas que ninguém reportou.
- Que a reveja alguém nativo desse mercado, não alguém que fala o idioma. A diferença conta: um português que fala bom alemão deteta erros, não deteta registo.
- Julga contra o glossário escrito desse idioma, não contra o gosto de quem revê. Sem glossário, a revisão produz uma opinião diferente todas as semanas.
- Anota o padrão, não a resposta. Uma resposta má corrige-se à mão e não muda nada; um padrão — «em italiano abre sempre com um pedido de desculpa» — corrige-se na instrução e corrige-se para todas.
- Confirma no mês seguinte que o padrão não voltou. Os ajustes de tom degradam-se sozinhos quando o modelo muda ou a base de conhecimento cresce.
Esse ciclo — amostrar, pontuar contra um critério escrito, detetar a regressão e corrigi-la — não é uma tarefa de lançamento: é uma função que corre. Quando não cabe na equipa, é exatamente o que montamos e operamos em avaliar a qualidade dos teus agentes de IA, e com idiomas a única diferença é que o critério se escreve cinco vezes em vez de uma.
Quando não ligar o segundo idioma
A consequência incómoda de tudo isto: se não tens ninguém que possa julgar como soa a tua marca em italiano, ligar o italiano não é um avanço, é delegar a voz da empresa num sistema que otimiza por probabilidade. Há casos em que tanto faz e casos em que não, e a linha é bastante nítida.
Tanto faz quando a conversa é puramente transacional e sem margem: estado de uma encomenda, horários, disponibilidade, um dado que existe ou não existe. Aí a resposta certa e plana é a resposta certa, e o idioma é logística. Não tanto faz assim que há negociação, pedido de desculpa, retenção, venda ou má notícia: nesses quatro momentos a marca é a mensagem, e uma resposta neutra perde. O critério prático, portanto, não é «que idiomas ligamos» mas «que tipo de conversa deixamos o agente conduzir num idioma que não supervisionamos».
E o complemento obrigatório dessa linha é a saída: nos idiomas que não supervisionas, o limiar para passar a uma pessoa tem de ser mais baixo do que no principal. Não porque o agente falhe mais, mas porque quando falha ninguém dá por isso. Como se desenha esse limite — o que faz o agente quando não tem a certeza, e como se passa a um humano sem que o cliente note — está em o que faz o agente quando não sabe.
Nada disto se resolve com um modelo melhor, e essa é a parte que custa aceitar. Os modelos vão continuar a melhorar em precisão multilingue, provavelmente depressa. Mas o tom da tua marca em alemão não é informação que o modelo possa deduzir de um texto espanhol: é uma decisão que alguém da tua empresa tem de tomar e escrever. Se não estiver escrita, o modelo toma-a por ti, e toma-a bem — no sentido de corretamente, e em nenhum outro sentido.
A frase para a próxima vez que alguém propuser ligar mais três idiomas na terça-feira: falar o idioma não é o mesmo que soar a ti. A primeira coisa o modelo faz de graça. A segunda tem de ser escrita, em cada idioma, e verificada todas as semanas.