Ein Pilot, der Kundenanfragen klassifiziert, wird im Januar validiert. Er funktioniert: echte Fälle, menschliche Prüfung, Freigabe durch das Gremium, ab in die Produktion. Im Juni beginnen die Beschwerden: Anfragen landen in der falschen Abteilung, Antworten gehen am Thema vorbei. Das Team tut das Naheliegende und prüft Prompt, Modell und Konfiguration. Alles ist genau wie im Januar. „Niemand hat etwas geändert“, lautet der Schluss, und das Gespräch rutscht in Richtung „KI ist eben nicht verlässlich“.
Die These in einer Zeile: Wenn ein Agent schlechter wird, ohne dass jemand den Code angefasst hat, haben sich seine Eingaben geändert, und der Test vom Januar hat nur bewiesen, dass er für die Leute, die Formulare und den Kalender vom Januar funktioniert. „Niemand hat etwas geändert“ ist keine Verteidigung des Systems, sondern die Diagnose.
Warum ein KI-Agent mit der Zeit schlechter wird, wenn der Code derselbe ist
Weil ein Agent kein Programm ist, das immer dasselbe tut: Er ist eine Funktion dessen, was er bekommt, und das ändert sich. Eine Validierung misst das Verhalten an einer bestimmten Stichprobe von Eingaben. Verschiebt sich die Realität gegenüber dieser Stichprobe, wandert die Zahl aus dem Test nicht mit. Das ist derselbe Grund, warum eine Trefferquote in der Produktion nicht reicht: Genauigkeit ist keine Eigenschaft des Modells, sondern des Systems samt seiner Daten, und Daten bewegen sich.
Vier Wege, auf denen sich Eingaben ohne Vorwarnung ändern
- Der Kalender. Kampagnen, Quartalsabschluss, Hochsaison, Urlaubsmonat. Der Agent, der mit dem Verkehr eines ruhigen Monats validiert wurde, trifft in einem anderen Monat auf eine andere Art von Anfragen: dringender, mehrdeutiger.
- Neue Leute, die anders schreiben. Ein neuer Kanal, ein Kunde aus einem anderen Land, ein Segment, das früher nicht auftauchte. Längere Nachrichten, eine zweite Sprache dazwischen, andere Abkürzungen. In der Teststichprobe kamen sie nicht vor.
- Ein vorgelagertes System ändert sich. Ein Formular bekommt ein optionales Feld, ein CRM ändert ein Datumsformat, ein Anbieter benennt eine Spalte um. Dem Agenten sagt es niemand, weil niemand weiß, dass diese Abhängigkeit existiert.
- Das Geschäft ändert sich, der Prompt nicht. Neues Produkt, neue Preise, eine andere Rückgaberegel. Die Anweisungen beschreiben weiter das Unternehmen vom Januar.
Eingabe-Drift und Modell-Drift behebt man nicht gleich
Halte sie auseinander, denn die erste Frage jeder Diagnose lautet, welche von beiden du hast. Modell-Drift kommt vom Anbieter: Er aktualisiert oder streicht eine Version, und derselbe Prompt verhält sich anders. Man begrenzt sie mit einer festgenagelten Version und einer Testbatterie, die bei jeder Änderung läuft, so wie in unserem Leitfaden zum Modellwechsel, ohne deine Automatisierungen zu zerlegen.
Eingabe-Drift passiert, selbst wenn du alles festnagelst. Du kannst Modell, Prompt und Infrastruktur ein Jahr lang einfrieren: Ändert sich die Welt, die ihn füttert, wird der Agent trotzdem schlechter. Deshalb ist die übliche Reaktion, ein anderes Modell auszuprobieren, meist ein Fehler, wie wir in Ein Modellwechsel repariert deinen Prozess nicht darlegen: Du verschiebst das Problem und zahlst obendrein eine Migration.
Eine Ein-Minuten-Frage trennt beide Fälle: Hat sich das System geändert oder das, was hineinkommt? Sind Modell, Prompt und Integrationen wie zuvor und die Leistung sinkt, fang bei den Eingaben an.
Wie du Eingabe-Drift erkennst, bevor dein Kunde es tut
Ein Signal, das über Beschwerden kommt, kommt spät: Dann hast du schon Wochen voller Fehler hinter dir. Die vier Prüfungen, die ihr zuvorkommen, sind günstig, müssen aber existieren, bevor du sie brauchst:
- Bewahre den Schnappschuss der Validierung auf. Die Stichprobe von Eingaben, mit der der Agent abgenommen wurde, ist deine Referenz. Hast du sie nicht aufgehoben, gibt es nichts zu vergleichen.
- Vergleiche jede Woche, was hereinkommt, mit diesem Schnappschuss. Dafür braucht es keine ausgefeilte Statistik: Länge der Nachrichten, Sprache, Verteilung nach Kategorie, leere Felder, Anteil der Fälle, die der Agent noch nie gesehen hat. Ein abrupter Sprung bei einem davon ist der Alarm.
- Beobachte die Ausnahmen nach Eingabetyp. Die Quote der Fälle, die der Agent an einen Menschen übergibt oder die ein Mensch korrigiert, steigt vor den Beschwerden, und nach Typ aufgeschlüsselt zeigt sie dir, wo sich die Realität bewegt.
- Lass die Evaluierungen mit aktuellen Fällen neu laufen. Eine starre Januar-Batterie erzählt dir nur, was du schon wusstest. Füge jeden Monat neue echte Fälle hinzu, von einem Menschen beschriftet, wie in Evaluierungen: so weißt du, ob deine KI wirklich funktioniert beschrieben.
Der erste Schritt existiert übrigens nur, wenn du eine Ausgangsbasis erhoben hast. Es ist dasselbe Prinzip wie beim Messen der Leistung deiner Automatisierungen: Die Zahl, die du vorher nicht erhoben hast, lässt sich nachher nicht mehr erheben.
Was tun, wenn sich die Eingabe schon verschoben hat
Es gibt drei Antworten, und die Wahl hängt davon ab, wie weit sich alles bewegt hat und was ein Fehler kostet:
- Die Referenz aktualisieren. Die neuen Fälle in die Validierung aufnehmen und Anweisungen und Beispiele nachjustieren. Das ist die Antwort, wenn die Änderung stabil ist und der Agent lernen kann, sie abzudecken.
- Den Umfang um einen eigenen Pfad erweitern. Ist eine neue, eigenständige Art von Eingabe aufgetaucht (andere Sprache, anderer Kanal), behandle sie als neuen Fall mit eigener Validierung, nicht als Variante des alten.
- Die Autonomie vorerst senken. Was der Agent nicht mehr erkennt, geht an einen Menschen, und der Agent wechselt vom Entscheiden zum Vorschlagen. Das ist der Mechanismus der Autonomiestufen eines Agenten: Eine Stufe tiefer ist umkehrbar; ihn abzuschalten nicht immer.
Nichts davon funktioniert ohne Verantwortlichen. Eingabe-Drift bemerkt niemand im Besonderen, weil es der Job von niemandem im Besonderen ist: nicht der Person, die den Agenten gebaut hat und längst an einem anderen Projekt sitzt, und nicht derer, die ihn nutzen. Es braucht eine benannte Person, einen Rhythmus (zunächst wöchentlich) und die Befugnis, den Agenten zu ändern, wenn die Daten es verlangen. Der Rest des Plans steht im Leitfaden zur Wartung von KI-Automatisierungen. Und wenn du es lieber weder aufbauen noch tragen willst: Genau das machen wir, wenn wir KI in der Produktion überwachen: Eingaben, Ausnahmen und Referenzfälle instrumentieren und handeln, wenn sie sich bewegen.
Woran du erkennst, dass es dir gerade passiert
- Niemand kann dir die Stichprobe von Eingaben zeigen, mit der der Agent abgenommen wurde.
- Zuletzt wurden der Validierung vor dem Start neue Fälle hinzugefügt.
- Ausnahmen werden insgesamt gezählt, nicht nach Eingabetyp.
- Fragst du, wer das alles beobachtet, lautet die Antwort „das Team“, nicht eine Person.
Treffen zwei der vier zu, hat sich dein Agent wahrscheinlich schon verschoben, und dir fehlt nur das Instrument, um es zu sehen.
Der Satz zum Mitnehmen: Ein Agent wird nicht schlechter, weil er altert, sondern weil sich die Welt weiterdreht und niemand mehr geprüft hat, ob beide noch dieselbe Sprache sprechen.