Zum Inhalt springen
Implementa.
KI-AgentenChatGPT im Unternehmen··9 Min.

Mehrsprachiger KI-Agent: die Markenstimme fällt als Erstes, sobald du die zweite Sprache einschaltest

Einen mehrsprachigen KI-Agenten aufzusetzen ist ein Häkchen; dass die Markenstimme dieses Häkchen überlebt, nicht. Forscher von Oracle AI haben Genauigkeitseinbrüche von bis zu 29 % in nicht englischen Sprachen gegenüber Englisch gemessen, selbst mit RAG (arXiv, Oktober 2025). Die These: Das Modell übersetzt gut und transkreiert schlecht, also klingt dein Agent standardmäßig wie ein übersetztes Handbuch — korrekt, flach und fremd. Die drei Dinge, die beim Sprachwechsel brechen, warum das Marken-Glossar pro Sprache geschrieben wird, und die billige Kontrolle, die fast niemand einbaut.

Senior AI Operations Implementer

AI Operations Pod

Die Nachricht kommt um acht Uhr morgens auf Deutsch, und der Agent antwortet in elf Sekunden auf Deutsch. Makellose Grammatik, richtige Angabe, null Fehler. Und der Kunde leitet die Antwort trotzdem an seinen Ansprechpartner weiter, mit einer Zeile darüber: „das hat kein Mensch geschrieben". Er hat sich nicht über den Inhalt beschwert. Er hat sich beschwert, dass das Unternehmen, mit dem er seit drei Jahren arbeitet, plötzlich wie eine Bedienungsanleitung klingt. Dafür macht niemand ein Ticket auf, also taucht das Problem in keinem Dashboard auf.

Die These in einer Zeile: Das Modell übersetzt gut und transkreiert schlecht. Eine Sprache im Agenten einzuschalten ist eine Einstellung; die Markenstimme innerhalb dieser Sprache zu halten, nicht. Standardmäßig spricht dein Agent fünf Sprachen wie ein übersetztes Handbuch — korrekt, flach und fremd — und im Kundenservice zahlt sich das in Vertrauen ab, genau in den Märkten, in denen du am wenigsten präsent bist und am wenigsten Fehlermarge hast.

Mehrsprachiger KI-Agent und Markenstimme: das Modell übersetzt gut und transkreiert schlecht

Überraschend ist das, weil sich der schwere Teil von selbst erledigt hat. Vor drei Jahren hieß Support in fünf Sprachen: fünf Wissensdatenbanken, fünf Korrekturrunden, fünf Personen. Heute erkennt das Modell die Sprache des Kunden und antwortet darin, ohne dass jemand nebenher etwas pflegt. Diese Leichtigkeit ist echt, und sie ist der Grund, warum die Entscheidung für eine neue Sprache in einem zwanzigminütigen Meeting fällt, in dem das Marketing nicht sitzt.

Was sich nicht von selbst erledigt hat, ist die Qualität, und sie ist gemessen. Forscher von Oracle AI haben auf arXiv, in der Fassung von Oktober 2025, eine Studie zur mehrsprachigen Konsistenz in Unternehmensanwendungen veröffentlicht, mit einem unbequemen Ergebnis: Selbst mit fortgeschrittenen RAG-Systemen beobachteten sie Genauigkeitseinbrüche von bis zu 29 % in nicht englischen Sprachen gegenüber Englisch. Die Diagnose zählt mehr als die Zahl: Das Modell denkt intern auf Englisch, auch wenn du es in einer anderen Sprache ansprichst — der Bias sitzt also nicht in der Ausgabeübersetzung, sondern davor. Ihre eigene Alignment-Technik holt bis zu 23,9 % dieser Genauigkeit zurück, was bestätigt, dass die Lücke strukturell ist und kein punktueller Konfigurationsfehler.

Der Geltungsbereich dieser Zahl, klar gesagt: ein Labor-Benchmark über 500 Dokumente mit Business-Themen, von Menschen in sechs nicht englische Sprachen übersetzt (darunter Spanisch, Französisch und Portugiesisch), erstellt von einem Team eines Infrastrukturanbieters, der KI-Lösungen verkauft. Er bemisst das Phänomen auf Modellebene, misst nicht deinen Agenten und ist kein Ergebnis von uns. Und es ist ein universelles Datum, kein Marktdatum: Es ändert sich nicht, je nachdem ob dein Unternehmen in Deutschland oder in Italien sitzt.

Genauigkeit ist außerdem die sichtbare Hälfte des Problems. Eine ungenaue Antwort erzeugt eine zweite Nachricht und taucht in den Kennzahlen auf. Eine genaue, seelenlose Antwort erzeugt gar nichts: Der Kunde liest sie, zuckt mit den Schultern und senkt sein Vertrauen um einen Punkt, ohne es dir zu sagen. Es ist derselbe Mechanismus, durch den ein höflicher, korrekter Chatbot die Kunden am Ende verärgert — nur dass das Missverhältnis hier nicht bei der Erwartung liegt. Es liegt beim Akzent.

Was eine schlecht aufgesetzte Sprache kostet, wird schon lange vor der KI gemessen. CSA Research hat in seinem Bericht „Can’t Read, Won’t Buy – B2C" über Sprachpräferenzen von Verbrauchern — Stichprobe von 8.709 Verbrauchern in 29 Märkten, veröffentlicht im Juli 2020 — gefragt, auf welche Probleme Menschen auf einer in ihre Sprache übersetzten Website stoßen. Die meistgenannte Antwort war nicht die fehlende Übersetzung: Es war die Qualität des Inhalts, also eine schlechte oder am Ziel vorbeigehende Übersetzung (34 %), gefolgt von fehlender lokalisierter Hilfe (33 %) und unvollständiger Übersetzung (26 %). Und fast die Hälfte — 48 % — verlässt die Seite, sobald sie auf das Problem stößt, statt um Hilfe zu bitten. Geltungsbereich: globale Umfrage in 29 Märkten, von 2020, über Websites und Apps, nicht über KI-Agenten. Sie misst keine Chatbots; sie setzt die Grundlinie dafür, was mit einem Kunden passiert, wenn die Sprache technisch da und kulturell abwesend ist.

Die drei Dinge, die beim Sprachwechsel brechen

Der Fehler ist nicht zufällig. Wenn eine Antwort die Sprache wechselt, brechen drei konkrete Dinge, und alle drei brechen immer in dieselbe Richtung: ins Neutrale. Wenn das Modell zögert, wählt es die förmlichste, wörtlichste und allgemeinste Version dessen, was es sagen könnte. In der Übersetzung ist das die sichere Wette, in der Marke die verlorene.

Was brichtWie es auffälltWarum das Modell es standardmäßig falsch macht
Grad der FörmlichkeitDeine deutsche Website duzt, und der Agent antwortet mit „Sie"; oder in Portugal antwortet er in einem brasilianischen Register, das nach einem anderen Land klingtFörmlichkeit steht nicht im Ausgangstext, sie ist eine Markenentscheidung. Ohne ausdrückliche Anweisung nimmt das Modell das förmlichste Register, weil es am wenigsten Gefahr läuft zu brüskieren
Humor, Umweg und RhythmusDer Satz mit Kante kommt korrekt und entschärft heraus: gleiche Bedeutung, null GesteHumor geht in der Übersetzung als Erstes verloren, weil er auf geteilten Referenzen beruht. Das Modell streicht ihn nicht absichtlich: Es wählt die wahrscheinlichste Formulierung, und die wahrscheinlichste ist nie die schärfste
Rechtliche und ProduktangabenDer Agent nennt eine Rückgabefrist, einen Steuerbegriff oder einen Tarifnamen, den es in diesem Land nicht gibtDas ist der teure Fehler. Das Modell überträgt den Inhalt aus der Ausgangssprache, weil das ist, was es hat, und es kann nicht wissen, dass eine Angabe territorial ist, wenn du es ihm nicht sagst

Der dritte verdient einen eigenen Absatz, weil er als Einziger in einer echten Reklamation enden kann. Ein Support-Agent, der einem italienischen Kunden eine Rückgabefrist zusagt, die nur in Spanien gilt, macht keinen Tonfehler: Er macht im Namen deines Unternehmens eine falsche kommerzielle Zusage. Die operative Regel, die das verhindert, ist langweilig und sie funktioniert: Jede Angabe, die sich je nach Land ändert — Fristen, Preise, Rechtsbegriffe, Produktnamen, Zahlungswege — wird in der Wissensdatenbank als territorial markiert, und der Agent darf sie nicht per Analogie auflösen. Wie diese Basis strukturiert wird, damit der Agent weiß, was er weiß und was nicht, steht in einen Agenten mit deinen eigenen Informationen trainieren.

Das Marken-Glossar wird pro Sprache geschrieben, nicht übersetzt

Der meistwiederholte Prozessfehler: das Tone-of-Voice-Dokument in der Ausgangssprache schreiben und in die anderen fünf übersetzen lassen. Es wirkt logisch und ist genau das Gegenteil dessen, was gebraucht wird. Ein übersetztes Glossar sagt dem Modell, wie die Marke auf Spanisch klingt, und überlässt ihm die Entscheidung, was das deutsche Äquivalent ist. Genau diese Entscheidung wolltest du nicht delegieren.

Ein Glossar pro Sprache ist etwas anderes: direkt in jeder Sprache geschrieben, von jemandem, der sie in diesem Markt spricht, mit getroffenen statt abgeleiteten Entscheidungen. Welches Pronomen benutzt wird. Welche drei Wörter nie fallen. Wie eine Nachricht öffnet und wie sie schließt. Wie man Nein sagt, ohne nach Formular zu klingen. Welche Begriffe auf Englisch bleiben, weil sie in dieser Branche auf Englisch bleiben. Es ist kein langes Dokument: Eine Seite pro Sprache reicht, und diese Seite ist der Teil der Anweisungen eines KI-Agenten, der pro geschriebenem Zeichen am meisten bringt.

Die billige Kontrolle, die fast niemand einbaut

Hier ist die Asymmetrie, die die Vernachlässigung erklärt. Niemand bringt einen Agenten in der Hauptsprache produktiv, ohne Antworten zu prüfen. Und fast niemand prüft die anderen Sprachen, weil die Person, die sie beurteilen könnte, nicht im Team sitzt, das den Agenten gebaut hat. Das Ergebnis: fünf Zweitsprachen laufen ab Tag eins unbeaufsichtigt, und das erste Signal, dass etwas schiefläuft, kommt als Kunde, der nicht mehr antwortet.

Die Kontrolle, die das schließt, ist neben dem Projekt lächerlich klein: eine wöchentliche Stichprobe echter Antworten pro Sprache, geprüft von jemandem aus diesem Markt, gegen das Glossar dieser Sprache. Fünf oder zehn Antworten, nicht hundert. Eine halbe Stunde pro Sprache, nicht ein Arbeitstag. Und eine Person, die dafür geradesteht, kein geteilter Kanal.

  1. Zieh eine zufällige Wochenstichprobe pro Sprache, nicht die mit Beschwerde. Die prüfst du ohnehin; der Ton bricht in denen, die niemand gemeldet hat.
  2. Lass von jemandem prüfen, der aus diesem Markt kommt, nicht von jemandem, der die Sprache spricht. Der Unterschied zählt: Ein Spanier mit gutem Deutsch erkennt Fehler, kein Register.
  3. Urteile gegen das geschriebene Glossar dieser Sprache, nicht gegen den Geschmack des Prüfers. Ohne Glossar produziert die Prüfung jede Woche eine andere Meinung.
  4. Notiere das Muster, nicht die Antwort. Eine schlechte Antwort wird von Hand korrigiert und ändert nichts; ein Muster — „auf Italienisch eröffnet er immer mit einer Entschuldigung" — wird in der Anweisung korrigiert und damit für alle.
  5. Prüf im Folgemonat, dass das Muster nicht zurückkam. Ton-Korrekturen verfallen von selbst, wenn das Modell wechselt oder die Wissensdatenbank wächst.

Diese Schleife — Stichprobe ziehen, gegen ein geschriebenes Kriterium bewerten, die Regression finden und beheben — ist keine Launch-Aufgabe: Sie ist eine laufende Funktion. Wenn sie nicht ins Team passt, ist sie genau das, was wir in die Qualität deiner KI-Agenten bewerten bauen und betreiben, und mit Sprachen ist der einzige Unterschied, dass das Kriterium fünfmal statt einmal geschrieben wird.

Wann du die zweite Sprache nicht einschalten solltest

Die unbequeme Folge aus allem: Wenn niemand beurteilen kann, wie deine Marke auf Italienisch klingt, ist Italienisch einzuschalten kein Fortschritt, sondern die Stimme des Unternehmens an ein System zu delegieren, das auf Wahrscheinlichkeit optimiert. Es gibt Fälle, in denen das egal ist, und Fälle, in denen nicht — und die Linie ist ziemlich scharf.

Egal ist es, wenn das Gespräch rein transaktional ist und keinen Spielraum hat: Bestellstatus, Öffnungszeiten, Verfügbarkeit, eine Angabe, die es gibt oder nicht. Dort ist die korrekte flache Antwort die korrekte Antwort, und Sprache ist Logistik. Nicht egal ist es, sobald verhandelt, sich entschuldigt, gehalten, verkauft oder schlechte Nachricht überbracht wird: In diesen vier Momenten ist die Marke die Botschaft, und eine neutrale Antwort verliert. Das praktische Kriterium lautet deshalb nicht „welche Sprachen schalten wir ein", sondern „welche Art von Gespräch lassen wir den Agenten in einer Sprache führen, die wir nicht überwachen".

Und die Pflichtergänzung zu dieser Linie ist der Ausgang: In den Sprachen, die du nicht überwachst, muss die Schwelle für die Übergabe an einen Menschen niedriger sein als in der Hauptsprache. Nicht weil der Agent öfter scheitert, sondern weil es niemand mitbekommt, wenn er scheitert. Wie diese Grenze entworfen wird — was der Agent tut, wenn er unsicher ist, und wie an einen Menschen übergeben wird, ohne dass der Kunde es merkt — steht in was der Agent tut, wenn er es nicht weiß.

Nichts davon löst ein besseres Modell, und das ist der Teil, der schwerfällt. Modelle werden bei mehrsprachiger Genauigkeit weiter besser, vermutlich schnell. Aber der Ton deiner Marke auf Deutsch ist keine Information, die das Modell aus einem spanischen Text ableiten kann: Es ist eine Entscheidung, die jemand in deinem Unternehmen treffen und aufschreiben muss. Steht sie nicht geschrieben, trifft das Modell sie für dich — und es trifft sie gut, im Sinne von korrekt, und in keinem anderen Sinn.

Der Satz für das nächste Mal, wenn jemand vorschlägt, am Dienstag drei weitere Sprachen einzuschalten: Die Sprache zu sprechen ist nicht dasselbe, wie nach dir zu klingen. Das Erste macht das Modell umsonst. Das Zweite muss geschrieben werden, in jeder Sprache, und jede Woche überprüft.

Weiterlesen

Mehr Artikel zu KI-Agenten

Lassen wir's laufen?

Wenn dich das angesprochen hat, 30-Minuten-Gespräch ohne Verpflichtung. Wir sagen dir, was passt, was nicht und den ungefähren Preis.

Fallstudien ansehen
Mehrsprachiger KI-Agent: die Markenstimme fällt als Erstes, sobald du die zweite Sprache einschaltest · Implementa