Zum Inhalt springen
Implementa.
Meinung··6 Min.

Warum 95 % KI-Genauigkeit in Produktion nicht reichen

KI-Genauigkeit in Produktion liest sich anders als in einer Demo: 95 % klingen nach Bestnote, bis du dich erinnerst, dass es eine schlechte Antwort von zwanzig ist —und die landet vor einem Kunden. Die These: die Schwelle ist keine universelle Zahl, sie wird von den Kosten des Fehlers gesetzt. Wann 95 % reichen, wann es ein Desaster ist, und was mit den 5 % zu tun ist, die immer bleiben.

Managing Partner

Implementa

In der Demo glänzt die Zahl: „95 % Genauigkeit". Applaus, nickende Köpfe, jemand merkt an, das sei „fast perfekt". Und so sieht es aus —bis das System in Produktion geht und diese 95 % das bedeuten, was sie wirklich heißen: eine schlechte Antwort von je zwanzig. Bei hundert Fällen am Tag sind das fünf Fehler täglich. Bei tausend fünfzig. Und anders als in der Demo, wo man die Treffer zeigt, verstecken sich die Fehler in Produktion nicht: sie landen vor einem Kunden, in einer gesendeten E-Mail, in einer Zahl, die jemand geglaubt hat.

Die These in einem Satz: KI-Genauigkeit in Produktion ist keine Zahl, die man Richtung 100 jagt, sondern eine Schwelle, die von den Kosten des Fehlers abhängt. 95 % können bei einer Aufgabe reichen und bei einer anderen ein Desaster sein, und die Zahl allein —ohne Kontext— sagt dir nicht, welche deine ist. Ob dein System bereit ist, entscheidet nicht, wie viel es richtig macht, sondern was passiert, wenn es falsch liegt, und wer es sieht.

Was KI-Genauigkeit in Produktion wirklich bedeutet

95 % Genauigkeit klingen nach Bestnote, weil wir sie wie eine Prüfungsnote lesen. Aber in Produktion ist es keine Note, sondern eine über das Volumen verteilte Fehlerrate. Die verbleibenden 5 % verdampfen nicht: sie häufen sich Fall für Fall, Tag für Tag, und wachsen mit dem Traffic. Das System, das im Test „fast nie" versagte, versagt jeden Tag, sobald es echt verarbeitet —schlicht, weil es mehr Fälle gibt, in denen man irren kann.

Es gibt eine zweite Falle im Wort „Genauigkeit" selbst: es ist ein Durchschnitt, und Durchschnitte verbergen. Ein globaler 95er kann heißen, dass du 99 % der leichten Fälle triffst und 60 % der schweren —genau die, die zählen. In der Demo zeigt man die leichten Fälle; in Produktion kommen die seltenen, mehrdeutigen, unvorhergesehenen. Eine Durchschnittszahl, ohne zu sehen, wo die Fehler fallen, ist Marketing, kein Maß dafür, ob das System hält.

Die Schwelle ist keine Zahl, sie sind die Kosten des Fehlers

Die nützliche Frage ist nicht „wie genau ist es?", sondern „was kostet jeder Fehler und wer trägt ihn?". Dieselben 95 % sind exzellent oder inakzeptabel, je nachdem, was beim Versagen passiert. Hier die kurze Karte:

Was das System tutKosten eines FehlersReichen 95 %?
Einen Entwurf vorschlagen, den ein Mensch vor dem Senden prüftNiedrig: vor dem Rausgehen korrigiertJa, locker
Klassifizieren und routen (Tickets, Dokumente, Leads)Mittel: umgeleitet oder geprüftMeist ja
Einem Kunden ohne menschliche Prüfung antwortenHoch: Reputations- oder RechtsschadenNein
Über Geld, Gesundheit oder Compliance entscheidenKritisch: irreversibel oder sanktionierbarBei Weitem nicht

Beachte: die Technik ist in allen vier Zeilen dieselbe; was sich ändert, ist das Netz darunter. Wenn der Fehler billig ist und jemand ihn fängt, bevor er rausgeht, sind 95 % eine gute Nachricht. Wenn der Fehler teuer ist und ungeprüft direkt rausgeht, sind dieselben 95 % eine Zeitbombe, deren Countdown das Volumen stellt. Die Schwelle erbt man also nicht vom Benchmark des Anbieters: sie wird Aufgabe für Aufgabe entschieden, mit Blick darauf, was am Tag des Irrtums passiert.

Die 5 % verschwinden nicht: sie werden gemanagt

100 % gibt es nicht, und sie zu jagen ist der teuerste Weg, nie fertig zu werden. Die ernsthafte Arbeit ist nicht, zwei weitere Nachkommastellen herauszupressen; sie ist, zu gestalten, was mit den 5 % passiert, die immer versagen werden. Ein Produktionssystem misst man nicht daran, wie gut es läuft, wenn es richtig liegt, sondern wie es sich verhält, wenn es falsch liegt. Das baut man aus vier Teilen:

  • Unsicherheit erkennen. Ein gutes System weiß, wann es unsicher ist, und sagt es, statt das Beherrschte und das Unbekannte mit derselben Zuversicht zu beantworten. Dieses Signal löst alles Weitere aus.
  • Mit menschlicher Prüfung eindämmen, wo der Fehler teuer ist. Nicht überall —das killt die Ersparnis— sondern genau bei den teuren Fällen. Das ist der Mensch in der Schleife dort platziert, wo es wirklich zählt: die gefährlichen 5 % filtern, die sicheren 95 % durchlassen.
  • Mit echten Fällen messen, nicht den leichten. Ein Evaluationssystem, das deine schweren Fälle laufen lässt —keine freundliche Stichprobe— ist das Einzige, das dir sagt, ob die 95 % echt oder Schaufenster sind.
  • Begrenzen: dass es „ich weiß es nicht" sagt. Ein System, das zugibt, etwas nicht beantworten zu können, ist mehr wert als eines, das mit Nachdruck erfindet. Der stille Fehler —der richtig aussieht und es nicht ist— ist der teuerste von allen.

Das ist übrigens der Unterschied zwischen einem Projekt, das die Produktion erreicht, und einem, das ein Ewig-Pilot bleibt. Piloten sterben, wenn jemand entdeckt, dass die 5 % nicht gemanagt waren, und niemand sich traut, sie ohne Netz freizugeben. Es ist einer der tieferen Gründe, warum KI-Automatisierungsprojekte scheitern: nicht aus Mangel an Genauigkeit, sondern aus Mangel an einem Plan für den Fehler.

Warum die Zahl des Anbieters ein wenig lügt

Wenn ein Anbieter dir „95 %" zeigt, ist es fast nie auf deinen Daten: es ist auf seinem Benchmark, von ihm gewählt, mit einer Fallverteilung, die deiner nicht ähneln muss. Deine echten 95 % können 88 % sein, sobald du ihm deine seltenen Fälle, deinen Jargon, deine Ausnahmen gibst. Nicht zwingend böser Wille; Genauigkeit ist keine Eigenschaft des Modells, sondern eine Eigenschaft des Paares Modell + deine Daten. Sie gut zu messen heißt, Evaluationen auf deinen eigenen Fällen laufen zu lassen, bevor du der Zahl traust —nicht nach der ersten Beschwerde.

Und eine Nuance, die Streit spart: verlange immer, die Genauigkeit auf den leichten von der auf den schweren Fällen zu trennen. Hat der Anbieter nur den globalen Durchschnitt, hat er nicht dorthin geschaut, wo es wehtut. Hat er sie aufgeschlüsselt und zeigt sie dir, hast du es mit jemandem zu tun, der weiß, was er verkauft.

Also, wann reichen 95 %?

Die ehrliche Antwort in zwei Sätzen. Es reicht, wenn der Fehler billig ist und ein Netz da ist: ein Mensch, der das Teure prüft, ein erneuter Versuch, ein „ich weiß es nicht", das Erfinden vermeidet. Es reicht nicht, wenn der Fehler teuer ist und ungefiltert direkt zum Kunden geht. Die Zahl allein sagt dir nicht, in welcher der beiden Welten du bist; das sagt dir das Design um die 5 %. Wenn dir also jemand einen Prozentsatz als Schlussargument verkauft, ist die richtige Frage nicht „sind es wirklich 95?", sondern „und was ist mit den anderen 5?".

Weiterlesen

Mehr Artikel zu Meinung

Meinung

Generative KI und geistiges Eigentum: was dein Anbieter nicht unterschreibt

Generative KI und geistiges Eigentum im Unternehmen hören auf, Kleingedrucktes zu sein, sobald dein Team mit dem Werkzeug eines anderen Texte, Bilder und Code erzeugt. Drei Fragen entscheiden, ob das, was du produzierst, dir gehört oder eine Klage mit offenem Datum ist: Wem gehört, was die Maschine erzeugt, womit sie trainiert wurde und was passiert, wenn sie etwas Geschütztes kopiert. Und genau die umgeht der Vertrag deines Anbieters. Kein Theater: was du vor der Unterschrift schriftlich verlangen solltest.

7 min de lectura

Meinung

LLM-Benchmarks: warum das Ranking dein Ergebnis nicht vorhersagt

Ein Modell nach LLM-Benchmarks fürs Unternehmen zu wählen heißt, am falschen Ort anzufangen. Die Nummer eins des Rankings gewinnt eine standardisierte Prüfung, die nichts mit deiner Arbeit zu tun hat: deine Daten, deine Aufgabe und dein Kontext entscheiden, wer in deinem Fall liefert, und das steht in keiner Tabelle. Kein Theater: warum das Ranking Marketing ist und der einzige Benchmark, der zählt, der ist, den du fährst.

6 min de lectura

GEOMeinung

GEO: wie du erkennst, wer es umsetzt und wer heiße Luft verkauft

Der GEO-Markt füllt sich mit Theater: Agenturen, die heiße Luft verkaufen, indem sie „SEO mit Prompts" neu etikettieren. Vier Signale, um zu erkennen, wer es wirklich umsetzt und wer nur das Deckblatt des Reports geändert hat. Plus die genauen Fragen, die den Pitch zerlegen.

6 min de lectura

Lassen wir's laufen?

Wenn dich das angesprochen hat, 30-Minuten-Gespräch ohne Verpflichtung. Wir sagen dir, was passt, was nicht und den ungefähren Preis.

Fallstudien ansehen
Warum 95 % KI-Genauigkeit in Produktion nicht reichen · Implementa