Zum Inhalt springen
Implementa.

SEO für ChatGPT (GEO) · Guide 38 von 38

KI-Sichtbarkeits-Benchmark: So vergleichst du dich Prompt für Prompt mit dem Wettbewerb

Du weißt, dass die KI dich erwähnt. Gut. Aber „sie erwähnt dich" bedeutet nichts, solange du keinen Rivalen danebenstellst: Nennt sie dich häufiger oder seltener als deinen Wettbewerb? Kommt dein Name zuerst oder seiner? Warum zitiert sie ihn mit Daten und dich nur im Vorbeigehen? Ohne diesen Vergleich ist deine Sichtbarkeit eine einsame Zahl, und eine einsame Zahl sagt nicht, ob du gewinnst oder verlierst. Ein Head-to-head-Benchmark löst das: derselbe Fragensatz, für dich und drei oder vier Wettbewerber ausgeführt, nebeneinander gelesen. Es ist keine Kennzahl —die kommt später—, es ist der Prozess, der sie erzeugt. Hier erfährst du, wie du ihn aufsetzt, wie du ihn liest, ohne dich selbst zu täuschen, und wie du aus der Tabelle einen Plan machst.

Du weißt, dass die KI dich erwähnt. Gut. Aber „sie erwähnt dich" ist ein verwaister Fakt, solange du keinen Rivalen danebenstellst. Die entscheidende Frage ist nicht „erscheine ich?", sondern „erscheine ich häufiger oder seltener als mein Wettbewerb, vor oder nach ihm, mit besserem oder schlechterem Kontext?". Eine einsame Zahl beantwortet das nicht. Ein Head-to-head-Benchmark schon: derselbe Fragensatz, für dich und drei oder vier Wettbewerber ausgeführt, nebeneinander gelesen. Hier erfährst du, wie du ihn aufsetzt, wie du ihn liest, ohne dich zu täuschen, und wie du aus der Tabelle einen Plan machst.

Deine KI-Sichtbarkeit bedeutet nichts ohne einen Rivalen daneben

Angenommen, du prüfst deine Präsenz und tauchst in 40 % der Antworten deiner Kategorie auf. Ist das gut? Du hast keine Ahnung, und wer dir sagt, dass es das ist, auch nicht. Erscheinen deine Wettbewerber in 70 %, bist du Letzter. Erscheinen sie in 15 %, dominierst du. Dieselben 40 % sind ein Sieg oder eine Niederlage, je nachdem, mit wem du sie vergleichst — deshalb bleibt ein Sichtbarkeits-Audit allein auf halbem Weg stehen: Es sagt dir, wo du stehst, nicht, wo du gegenüber denen stehst, die dir den Kunden streitig machen.

Die generative KI hat das schärfer gemacht als das klassische SEO. Bei Google sahst du zehn Links und konntest ohne Drama Sechster sein: Der Nutzer scrollte und fand dich. Eine ChatGPT-Antwort hat Platz für drei oder vier Marken, nicht zehn, und wenn dein Wettbewerber reinkommt und du nicht, gibt es keine zweite Seite zum Aufholen. KI-Sichtbarkeit ist mehr ein Nullsummenspiel, und in einem Nullsummenspiel zählt nur die relative Zahl. Deine Präsenz zu messen, ohne ihre zu messen, ist, als würdest du deine Runde stoppen, ohne die der anderen Fahrer zu kennen: Du kennst deine Zeit, nicht, ob du gewinnst.

Ein Benchmark ist kein Share of Voice: der Prozess gegen die Kennzahl

Es lohnt sich, zwei Dinge nicht zu verwechseln, die ähnlich klingen. Der Benchmark ist der Prozess: denselben Fragensatz für dich und deine Rivalen laufen lassen und notieren, wer erscheint, wo und wie. Der Share of Voice ist eine der Kennzahlen, die aus diesem Prozess herauskommen —der Prozentsatz der Antworten, in denen du auftauchst, gemessen am Gruppentotal—. Der Benchmark ist die Methode; der Share of Voice eine der Zahlen, die sie produziert. Das eine ist die Küche, das andere ein Gericht.

Die Unterscheidung ist nicht pedantisch, sie ändert, was du tust. Jagst du den Share of Voice als Kennzahl, starrst du am Ende auf einen Prozentsatz und jubelst oder leidest, je nachdem, ob er steigt oder fällt, ohne zu wissen, was ihn bewegt. Machst du den Benchmark als Prozess, siehst du die rohen Antworten: welche Frage dich draußen lässt, mit welchem Satz sie den Wettbewerber beschreiben, der dir fehlt, auf welche Quelle die KI sich stützt, um ihn zu zitieren. Diese qualitative Lesart —das „Warum"— ist das, was ein Prozentsatz verbirgt. Der Share of Voice sagt dir, dass du verlierst; der Benchmark sagt dir, wo sie dich schlagen. Dieser Leitfaden handelt vom Zweiten, weil er sich in Aufgaben verwandelt.

Benchmark (Prozess)Share of Voice (Kennzahl)
Was es istDenselben Prompt-Satz für dich und N Rivalen laufen lassenDer % deiner Erwähnungen am Gruppentotal
Was es dir gibtWer erscheint, in welcher Reihenfolge, mit welchem Kontext und welcher QuelleEine über die Zeit vergleichbare Zahl
Wofür es dientEntscheiden, was und wo zu korrigieren istDen Trend beobachten und an die Führung berichten
BeziehungEs ist die Methode, die die Kennzahl erzeugtEs ist eines der Ergebnisse der Methode

So setzt du den Benchmark auf: derselbe Prompt-Satz, du und 3-4 Wettbewerber

Ein ehrlicher Benchmark ruht auf einer einfachen Regel: alles gleich außer dem Spieler. Gleiche Fragen, gleiche Engines, gleiches Fenster, gleicher Tag. Änderst du den Satz zwischen einem Wettbewerber und dem anderen, vergleichst du nicht, du erfindest. Vier Schritte:

  1. Wähle die echten Rivalen (3-4). Nimm nicht die ganze Branche: Nimm den, den ein Käufer von dir in derselben Entscheidung abwägen würde. Beginne mit denen, die bereits auftauchen, wenn du nach deiner Kategorie fragst, und füge ein oder zwei hinzu, von denen du weißt, dass sie dir Kunden streitig machen, auch wenn sie noch nicht erscheinen. Taucht beim Laufenlassen ein unerwarteter Name auf, nimm ihn auf: Die KI sagt dir, wer in ihren Augen dein Wettbewerb ist, was nicht immer mit deinem übereinstimmt.
  2. Baue die markenfreie Batterie (10-15 Fragen). Wie in einem Audit tragen die Fragen keinen Namen —weder deinen noch den von jemandem—: Es sind die, die jemand stellt, der eine Lösung sucht, keine Marke. „Was ist die beste Software für X?", „welches Unternehmen empfiehlst du für Y?", „Alternativen zu [Kategorieführer]". So misst du, wer nach Verdienst reinkommt, nicht, wer auftaucht, sobald du ihn selbst nennst. Speichere sie: Es ist dein fester Satz, den du jeden Zyklus identisch wiederholst.
  3. Feuere denselben Satz in jeder Engine, im Inkognito-Modus. ChatGPT, Perplexity und Google AI lesen verschiedene Internets, also lass alle drei laufen. Inkognito-Fenster oder ausgeloggt, damit deine Historie die Antwort nicht kontaminiert. Ein Durchlauf pro Engine und Frage; gibt eine Engine sehr volatile Antworten, zwei Durchläufe und du behältst, was sich wiederholt.
  4. Erfasse in einer Tabelle: Marke, Position und Kontext. Notiere pro Frage und Engine, welche Marken erscheinen, in welcher Reihenfolge sie in der Antwort auftauchen, und —das macht fast niemand— mit welchem Satz die KI sie begleitet. „X, die vollständigste Option" ist nicht dasselbe wie „X, teurer". Die Position gibt dir das Ranking; der Satz gibt dir das Warum.

So liest du die Ergebnisse: wer erscheint, an welcher Position und warum

Die gefüllte Tabelle ist nicht das Ziel; sie ist der Rohstoff. Lies sie in drei Schichten, von der dümmsten zur nützlichsten:

  • Präsenz: wer erscheint? Die Grundschicht. Zähle, in wie vielen der N Fragen jede Marke auftaucht. Hier berechnest du, wenn du willst, den Share of Voice: deine Erscheinungen am Total. Es ist die Schlagzeile, aber die am wenigsten handlungsrelevante Zahl.
  • Position: in welcher Reihenfolge? Als Erster in der Antwort zu erscheinen ist nicht dasselbe wie als Letzter in einer Fünferliste. Die KI ordnet nach wahrgenommenem Vertrauen, also sagt dir die Durchschnittsposition jeder Marke über den Satz, wer die „Standardantwort" der Kategorie ist und wer Füllmaterial. In der Position aufzusteigen ist mehr wert, als eine Erwähnung weiter unten hinzuzufügen.
  • Kontext: mit welchem Gesicht? Die Schicht, die fast niemand betrachtet, und die, die am meisten entscheidet. Sammle die Sätze, mit denen die KI jeden vorstellt. Beschreibt sie deinen Wettbewerber mit einem konkreten Fakt („integriert mit 200 Tools", „am schnellsten einzuführen") und dich mit einem Generikum, da ist die Lücke: Es ist nicht so, dass sie dich nicht nennen, sondern dass sie nichts über dich zu sagen haben. Das ist reparierbar, und es wird außerhalb deiner Website repariert, in den Quellen, die die KI zitiert.

Kreuze die drei Schichten und die Diagnose erscheint. Ein Wettbewerber, der viel, weit oben und mit konkreten Fakten auftaucht, schlägt dich strukturell: Er hat Reputation in den Quellen, die das Modell gewichtet. Einer, der viel, aber weit unten und listenartig auftaucht, ist verwundbar: Präsenz ohne Autorität. Und wenn du wenig auftauchst, aber gut positioniert bist, wenn du auftauchst, hast du eine Basis zum Skalieren. Der Benchmark gibt dir keine Note, er gibt dir eine Karte, wo anzugreifen ist. Und diese Lesart ist genau der Ausgangspunkt von wie man KI-Sichtbarkeit misst mit klarem Kopf: erst die Karte, dann die Kennzahlen.

Von der Tabelle zum Plan: was du mit deinen Erkenntnissen machst

Ein Benchmark, der in einer hübschen Tabelle endet, ist eine Autopsie. Der Wert liegt in den drei oder vier Entscheidungen, die daraus hervorgehen. Übersetze jede Erkenntnis in eine Handlung:

  • „Der Wettbewerber taucht mit einem Fakt auf, den ich nicht veröffentlicht habe" → produziere diesen Fakt in zitierbarer Form. Wird er für „integriert mit X" zitiert und du integrierst auch, hast es aber in keiner Quelle erzählt, die die KI liest, ist die Aufgabe, diese Erwähnung zu gewinnen, nicht sie zu beklagen.
  • „Ich tauche auf, aber immer als Letzter" → das ist ein Autoritätsproblem, kein Präsenzproblem. Verstärke dein Gewicht in den Drittquellen —Bewertungen, Vergleiche, Foren—, in denen das Modell Vertrauen kalibriert. In der Position aufzusteigen ist Reputationsarbeit, kein Copy auf deiner Landing.
  • „Ich tauche in den Fragen, die am meisten verkaufen, nicht auf" → priorisiere diese. Nicht jede Frage im Satz ist gleich viel wert: Die kaufnächsten sind zuerst zu gewinnen, auch wenn du eine informationelle verlierst.
  • „Ein Wettbewerber, den ich nicht auf dem Radar hatte, dominiert" → untersuche warum. Welche Quellen zitieren ihn, mit welchem Satz, in welcher Engine. Der Benchmark hat dir gerade Wettbewerbsintelligenz geschenkt, die du nicht hattest.

All das lässt sich von Hand machen, und anfangs sollte es das: den Benchmark mit den eigenen Händen zu verstehen ist mehr wert als jedes Dashboard. Aber die Tabelle wird klein bei den üblichen Signalen: Das Volumen an Fragen, Engines und Sprachen frisst deinen Morgen; du brauchst automatische Historie, um zu sehen, ob sich die Lücke zu jedem Rivalen öffnet oder schließt; oder du willst kontinuierliche Überwachung statt einer Quartalsaufnahme. Da lässt dir das Delegieren der KI-Sichtbarkeitsüberwachung den Benchmark lebendig und verglichen, ohne von Hand zu transkribieren. Und wenn die Tabelle zum Handeln aufruft —die fehlende Erwähnung gewinnen, in der Position aufsteigen, in die Frage einsteigen, die verkauft—, macht die GEO-Optimierung die Arbeit an den Quellen, nicht eine weitere Folie. Wenn du hier beginnst, lebt die vollständige Cluster-Karte im Leitfaden zu SEO für ChatGPT.

Häufig gestellte Fragen

Es sind unterschiedliche Glieder derselben Kette. Der Benchmark ist der Prozess: Du lässt denselben Fragensatz für dich und deine Wettbewerber in ChatGPT, Perplexity und Google AI laufen und notierst, wer erscheint, an welcher Position und in welchem Kontext. Der Share of Voice ist eine der Kennzahlen, die du am Ende herausziehst —der Prozentsatz der Antworten, in denen du auftauchst, gemessen am Gruppentotal—. Du kannst den Benchmark machen und nur „wer erscheint und warum" behalten, ohne einen Prozentsatz zu berechnen; und du kannst keinen ehrlichen Share of Voice berechnen, ohne den Benchmark vorher gefahren zu haben. Das eine ist die Methode, das andere die Zahl. Dieser Leitfaden handelt von der Methode.

Drei oder vier, und ausgewählt, nicht jeder Name, der dir einfällt. Nimm die, die ein Käufer von dir wirklich in derselben Entscheidung abwägen würde: die, die auftauchen, wenn die KI deine Kategoriefrage beantwortet, plus ein oder zwei, von denen du weißt, dass sie dir Kunden streitig machen, auch wenn sie noch nicht erscheinen. Weniger als drei und du siehst kein Muster; mehr als fünf und die Tabelle wird unbeherrschbar und dein Fokus verwässert. Das Ziel ist keine Volkszählung der Branche, sondern zu verstehen, an wen du die Erwähnung verlierst und warum. Taucht beim Laufenlassen ein unerwarteter Name auf, nimm ihn auf: Die KI sagt dir, wer in ihren Augen dein Wettbewerb ist.

Alle vier bis acht Wochen, im Takt, in dem sich die Modelle ändern. Ein Ein-Tages-Benchmark ist eine Momentaufnahme: Er sagt dir, wo du heute gegenüber deinen Rivalen stehst, nicht, ob sich die Lücke öffnet oder schließt. Die Reihe zählt. Wiederhole denselben Fragensatz mit derselben Leseregel und speichere das Datum: So unterscheidest du eine echte Verbesserung von einem Modellschwanken. Wöchentlich zu wiederholen heißt, Zeit in Rauschen zu stecken; es als Jahresaufnahme zu belassen heißt, zu spät zu erfahren, dass ein Wettbewerber dich überholt hat. Der Mittelweg —monatlich oder zweimonatlich— ist der Punkt, an dem der Benchmark zum Thermometer wird, nicht zur Anekdote.

Ja, und es ist am besten, so anzufangen. Mit einer Batterie von 10-15 Kategoriefragen, einem Inkognito-Fenster und einer Tabelle hast du die Grundlage: Feuere jede Frage in ChatGPT, Perplexity und Google AI ab, notiere, welche Marken erscheinen und in welcher Reihenfolge, und vergleiche. Das kostenpflichtige Tool gibt dir keine andere Wahrheit; es erspart dir die manuelle Transkription, speichert die Historie und lässt dich skalieren —mehr Fragen, mehr Sprachen, mehr Wettbewerber— ohne den Morgen zu verbrennen. Fang von Hand an, um zu verstehen, was du misst; delegiere, wenn das Volumen deine Zeit frisst oder wenn du kontinuierliche Überwachung statt einer Quartalsaufnahme brauchst.

KI-Impact-Plan · kostenlos

Der Guide ist generisch. Dein Plan nicht.

Erzähl uns von deinem Unternehmen und du bekommst eine Diagnose mit Prioritäten, Zahlen und dem, was zuerst gebaut wird. Ohne Sales-Termin, ohne einen Euro zu zahlen.

KI-Sichtbarkeits-Benchmark: So vergleichst du dich Prompt für Prompt mit dem Wettbewerb · Implementa