Was ist Generative Engine Optimization (GEO)? So wirst du in KI-Antworten sichtbar

Illustration: ein Mann steht vor einer generierten KI-Antwort; darunter liegen drei Quellenkarten, von denen eine blau hervorgehoben und mit der Antwort verbunden ist.
Das Wichtigste in Kürze:

Generative Engine Optimization (GEO) ist die Arbeit an Inhalten mit dem Ziel, in den Antworten generativer KI-Systeme zitiert zu werden. Gemeint sind ChatGPT, Perplexity, Google Gemini und die AI Overviews in der Google-Suche.

  • Woher der Begriff kommt: aus dem Forschungspaper „GEO: Generative Engine Optimization“ von Aggarwal et al. (arXiv:2311.09735), eingereicht im November 2023 und angenommen zur KDD 2024. Er stammt nicht von Google und nicht aus der Beratungsbranche.
  • Was gemessen wurde: Das Paper berichtet eine um bis zu 40 % gesteigerte Sichtbarkeit in erzeugten Antworten. Gemessen wurde auf dem eigenen Benchmark GEO-bench mit 10.000 Anfragen, in einem selbst gebauten Aufbau mit gpt3.5-turbo und zusätzlich auf Perplexity.ai. Googles AI Overviews waren keine Testumgebung.
  • Was am besten wirkte: wörtliche Zitate, Quellenangaben und Statistiken. Keyword Stuffing brachte laut Paper „little to no improvement“ und lag auf Perplexity.ai 10 % unter der unveränderten Fassung.
  • Was Google dazu sagt: Die Search-Central-Dokumentation nennt GEO und AEO beim Namen und ordnet sie ein: „optimizing for generative AI search is optimizing for the search experience, and thus still SEO“.
  • Meine Lesart der beiden Quellen: Sie beschreiben zwei verschiedene Schritte. Das Retrieval entscheidet über die Kandidaten für eine Antwort und die Formulierung darüber, wer daraus zitiert wird. Selbst der Testaufbau des Papers zog seine Quellen aus der Google-Suche.
  • Was du konkret tust: belegen, wörtlich zitieren, beziffern, verständlich schreiben. Das sind die Methoden mit den besten Werten im Test. Kein eigenes Werkzeug nötig und kein Widerspruch zu Googles Doku.

Generative Engine Optimization (GEO) bezeichnet die Arbeit an Inhalten mit dem Ziel, in den Antworten generativer KI-Systeme vorzukommen. Gemeint sind Systeme wie ChatGPT, Perplexity, Google Gemini oder die AI Overviews in der Google-Suche. Sie beantworten eine Frage mit einem fertigen Text statt mit einer Trefferliste und darin werden einzelne Quellen zitiert, während viele andere gar nicht auftauchen.

So weit die gängige Definition. Die interessantere Frage ist, worauf sie sich stützt.

Ich habe mir dazu am 16. August 2026 die deutschen Suchergebnisse zu „generative engine optimization“ angesehen. Unter den ersten fünfzehn Treffern stehen acht Ratgeber von Agenturen und Toolanbietern. Dazwischen liegen die zwei Quellen, aus denen sich das Thema überhaupt speist: auf Position 6 das Forschungspaper, das den Begriff erfunden hat, sowie auf Position 9 Googles eigene Dokumentation, die ihm ziemlich direkt widerspricht.

Beide sind frei zugänglich und beide sind ohne die jeweils andere nur halb so aussagekräftig. Deshalb stehen sie in diesem Artikel nebeneinander.

Der Weg dorthin: zuerst die Definition und die Herkunft, dann die Belege samt ihren Grenzen, danach die Umsetzung. Wer nur die Handlungsempfehlungen braucht, springt über das Inhaltsverzeichnis direkt dorthin.

Was ist Generative Engine Optimization?

Key Takeaway: GEO ist ein Optimierungsrahmen aus einem Forschungspaper von sechs Autorinnen und Autoren, eingereicht im November 2023 und angenommen zur KDD 2024. Er kommt weder von Google noch aus der Beratungsbranche.

Die Quelle ist ein Paper mit der Preprint-Nummer arXiv:2311.09735 unter dem Titel „GEO: Generative Engine Optimization“. Autoren sind Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan und Ameet Deshpande. Version 1 wurde am 16. November 2023 eingereicht, Version 3 am 28. Juni 2024 überarbeitet. Der Vermerk auf der arXiv-Seite lautet „Accepted to KDD 2024″, also angenommen zur 30. ACM-SIGKDD-Konferenz, die vom 25. bis 29. August 2024 in Barcelona stattfand.

Das Paper führt zuerst einen Oberbegriff ein: Systeme wie BingChat, Googles damalige SGE und Perplexity.ai nennt es „generative engines“, weil sie Informationen suchen und eine Antwort daraus erzeugen. Der Schritt danach ist der eigentliche Beitrag: ein Rahmen für Websitebetreiber zur Beeinflussung ihrer Sichtbarkeit in solchen Antworten.

Die Begründung im Abstract ist bemerkenswert wenig technisch und es geht um die dritte Partei im Spiel: „it poses a huge challenge for the third stakeholder“, also um Websites und Content-Ersteller. Wer Inhalte produziert, hat in einer generierten Antwort keine Kontrolle mehr darüber, ob und wie er auftaucht. Genau dafür schlagen die Autoren einen Ausweg vor, den sie „the first general creator-centric framework“ nennen.

Wo AIO, AEO und LLMO in dieses Bild passen. GEO zielt auf generative Antworten und AEO auf direkte Antwort-Engines. LLMO meint das Verständnis der Sprachmodelle. AIO ist der Sammelbegriff darüber. Die Grenzen sind weich und in vielen Texten austauschbar. Ich habe AIO, GEO, AEO und LLMO in einem Überblick gegeneinandergestellt. Hier zählt nur ein Punkt: Von den vier Abkürzungen konnte ich für genau eine eine benannte Primärquelle mit offengelegter Methodik finden.

Das ist die Herkunft von GEO: kein Produkt und keine Google-Ankündigung, sondern ein akademischer Vorschlag mit einem Benchmark daneben.

Warum der Begriff gerade jetzt überall steht

Key Takeaway: Die Konjunktur des Begriffs hat zwei nachprüfbare Auslöser. Eine Antwortfläche fängt inzwischen Klicks ab und Google hat im Mai 2026 selbst dokumentiert, dass es diese Fläche als Teil der Suche behandelt.

Das Paper erschien im November 2023. Dass GEO inzwischen als eigene Disziplin angeboten wird, hat deshalb weniger mit dem Paper zu tun als mit der Oberfläche, auf der Suchergebnisse heute landen.

Eine generierte Antwort erledigt die Frage bereits auf der Ergebnisseite und macht den Klick auf die Quelle damit optional. Dieses Muster ist älter als die KI-Suche und läuft unter dem Namen Zero-Click-Suche. Durch generierte Antworten bekommt es eine neue Größenordnung: Wer die Antwort liefert und trotzdem ungenannt bleibt, verliert die Sichtbarkeit vollständig statt nur einen Rangplatz.

Der zweite Auslöser ist datierbar. Am 15. Mai 2026 berichtete Search Engine Land über eine neue Dokumentationsseite von Google zur Optimierung für generative KI-Funktionen. Damit war die Fläche offiziell. Eine dokumentierte Auswahl schafft einen Markt für Beratung dazu.

Zur selben Entwicklung gehört der Bericht, den Google inzwischen dafür anbietet und auf den die Doku für die Messung ausdrücklich verweist: den Generative-AI-Performance-Report in der Search Console. Eine Plattform baut keinen Bericht für eine Fläche, die sie für unwichtig hält.

Was diese beiden Auslöser nicht hergeben, ist eine belegte Wirkungsaussage: Die Wichtigkeit eines Themas sagt nichts über die Wirkung einer einzelnen Maßnahme. Genau an dieser Stelle ist die Versuchung groß, von der Marktbeobachtung direkt in die Maßnahmenliste zu springen. Die folgenden Abschnitte gehen stattdessen den Umweg über die Belege.

GEO und SEO: was sich unterscheidet und was nicht

Key Takeaway: Die beiden Begriffe unterscheiden sich in dem, was sie messen, nicht in dem, was sie verlangen. SEO misst Positionen in einer Trefferliste, GEO misst Anteile an einem erzeugten Text.

Die gängige Gegenüberstellung lautet: SEO bringt Rankings und GEO bringt Erwähnungen. Falsch ist das nicht, es verwischt nur die eigentliche Differenz und aussagekräftiger wird der Vergleich erst, wenn du die beiden Quellenlagen einmal nebeneinanderlegst.

 Klassisches SEOGEO nach dem Paper
ZielflächePosition in der TrefferlisteAnteil und Position innerhalb einer erzeugten Antwort
Was optimiert wirdSeite, Struktur, Verlinkung, Relevanz zur AnfrageFormulierung des Textes einer bereits abgerufenen Seite
MessgrößeRang, Klicks, ImpressionenPosition-Adjusted Word Count, Subjective Impression
Wer definiert die Regelndie Suchmaschine, dokumentiertbisher niemand verbindlich
Beleglagejahrzehntelange Praxis, Herstellerdokueine Studie mit offengelegter Methodik, zwei getestete Engines

Tabelle: Eigene Gegenüberstellung auf Basis des Papers „GEO: Generative Engine Optimization“ (Aggarwal et al., v3 vom 28.06.2024) und der Google-Search-Central-Dokumentation, Stand 10.07.2026.

Auf die zweite Zeile kommt es an. GEO im Sinne des Papers setzt an einer Seite an, die bereits abgerufen wurde. Das ist der Testaufbau selbst und keine Nebenbedingung, wie der übernächste Abschnitt im Detail zeigt: Für eine Seite außerhalb der Kandidatenmenge ändert auch die beste Formulierung nichts.

Deshalb stimmt die Formel „GEO ersetzt SEO“ nicht. Sie unterstellt, dass generative Systeme ihre Quellen anders finden als Suchmaschinen. Bei Google ist das laut AI Optimization Guide ausdrücklich nicht der Fall. Bei den anderen Anbietern fehlt eine vergleichbare Dokumentation und die Aussage bleibt dort deshalb weder belegt noch widerlegt.

Was das GEO-Paper tatsächlich getestet hat

Key Takeaway: Gemessen wurde in einem selbst gebauten Aufbau: fünf Quellen pro Anfrage aus der Google-Suche, Antwort erzeugt von gpt3.5-turbo. Dazu kam Perplexity.ai als zweite und real betriebene Engine. Google AI Overviews und Bing Chat waren nicht Teil der Messung.

Die 40 % sind schnell zitiert, der Testaufbau dahinter braucht ein paar Absätze mehr. Also der Reihe nach.

Der Benchmark. Die Autoren bauen sich mangels vorhandener Daten eine eigene Testmenge: „GEO-bench, a benchmark consisting of 10K queries from multiple sources“. Diese 10.000 Suchanfragen stammen aus neun verschiedenen Quellen. Abgedeckt sind laut Paper 25 Themenfelder von Kunst über Gesundheit bis Spiele. Dazu kommen unterschiedliche Schwierigkeitsgrade und Suchintentionen.

Die Engine. Hier wird es für die Einordnung wichtig, denn pro Anfrage holt der Aufbau die fünf besten Quellen: „only the top 5 sources are fetched from the Google search engine for every query“. Die Antwort erzeugt anschließend ein Sprachmodell: „The answer is then generated by the gpt3.5-turbo model“. Zum Dämpfen von Zufallseffekten ziehen die Autoren pro Anfrage fünf Antworten bei einer Temperatur von 0,7.

Die zweite Engine. Zusätzlich läuft derselbe Test auf einem echten Produkt: „we evaluate the same Generative Engine Optimization methods on Perplexity.ai, which is a commercially deployed generative engine“. In den Grenzen des Papers steht die entscheidende Zahl dazu: „we rigorously test our proposed methods on two generative engines, including a publicly available one“. Zwei Engines also. Googles AI Overviews tauchen im Paper als Beispiel für generative Systeme auf, nicht als Testumgebung.

Die Metriken. Zwei Kennzahlen bewerten den Erfolg: Position-Adjusted Word Count zählt die Wörter einer Antwort, die aus einer bestimmten Quelle stammen. Gewichtet wird nach Position, was oben steht zählt also mehr. Subjective Impression fasst mehrere subjektive Faktoren zu einem Wert zusammen und wird von einem Sprachmodell vergeben. Dazu zählen unter anderem Relevanz und Einfluss der zitierten Stelle sowie ihre Einzigartigkeit. Beides misst Sichtbarkeit innerhalb einer erzeugten Antwort und nicht Rankings oder Klicks.

Das Paper selbst zieht diese Grenze übrigens sauber: „owing to the black-box nature of search engine algorithms, we didn’t evaluate how GEO methods affect search rankings“.

Achtung: Die 40 % sind die Eigenmessung der Autoren, auf ihrem eigenen Benchmark, mit ihrer eigenen Metrik, in ihrem eigenen Aufbau plus Perplexity.ai. Es ist keine Messung an Googles AI Overviews, an Gemini oder an ChatGPT. Wer die Zahl ohne diese Grenze weitergibt, gibt etwas anderes weiter als das, was gemessen wurde.

Dazu kommt das Alter des Experiments, das mit gpt3.5-turbo lief und damit mit dem Stand von 2023. Die heutigen Modelle sind andere und die Retrieval-Schichten darüber ebenfalls. Das entwertet die Ergebnisse nicht. Es begrenzt sie auf eine sorgfältige Messung an einem System von damals.

Die neun Methoden und was sie gebracht haben

Key Takeaway: Zitate, Quellenangaben und Statistiken schnitten am besten ab. Keyword Stuffing fiel unter die unveränderte Ausgangsfassung. Die Rangfolge deckt sich mit dem, was gute Redaktion ohnehin verlangt.

Neun Varianten wurden getestet: „We propose 9 different Generative Engine Optimization methods to optimize website content for generative engines.“ Jede verändert denselben Ausgangstext auf eine andere Art. Die Ergebnisse stehen in Tabelle 1 des Papers, in absoluten Werten. Ich habe sie hier übernommen, weil die Absolutwerte die interessanteste Stelle des ganzen Papers sind und in der Verkürzung auf eine einzelne Prozentzahl verloren gehen.

MethodeWas am Text geändert wurdePosition-Adjusted Word CountSubjective Impression
Keine Optimierung (Baseline)Originaltext, unverändert19,319,3
Keyword Stuffingmehr Keywords aus der Suchanfrage einbauen17,720,2
Unique Wordsseltenere, ungewöhnlichere Wörter einsetzen20,520,4
AuthoritativeTonfall überzeugender und autoritativer fassen21,322,9
Easy-to-UnderstandSprache vereinfachen22,020,5
Technical TermsFachbegriffe ergänzen22,721,4
Cite SourcesQuellenangaben ergänzen24,621,9
Fluency OptimizationLesefluss und Formulierung verbessern24,721,9
Statistics Additionqualitative Aussagen durch Zahlen ersetzen25,223,7
Quotation Additionwörtliche Zitate aus passenden Quellen ergänzen27,224,7

Tabelle: Absolutwerte aus Tabelle 1 des Papers „GEO: Generative Engine Optimization“ (Aggarwal et al., GEO-bench-Testsplit, fünf Durchläufe gemittelt, Version v3 vom 28.06.2024). Höher ist besser. Beobachtung im Testaufbau der Autoren, kein allgemeiner Beleg.

Die Spitzengruppe fasst das Paper so zusammen: „our top-performing methods, Cite Sources, Quotation Addition, and Statistics Addition, achieved a relative improvement of 30-40% on the Position-Adjusted Word Count metric and 15-30% on the Subjective Impression metric“. Der Bestwert steht in der Tabellenunterschrift: „The best methods improve upon baseline by 41% and 28%“. Das ist die Zeile Quotation Addition.

Interessanter finde ich das untere Ende. Keyword Stuffing ist die vielleicht bekannteste Taktik aus der Frühzeit der Suchmaschinenoptimierung. In der Sichtbarkeitsmetrik sinkt sie hier unter den unveränderten Ausgangstext. Das Paper formuliert es zurückhaltend: „we find such methods offer little to no improvement on generative engine’s responses“. Auf Perplexity.ai wird es deutlicher: dort „performs 10% worse than the baseline“.

Und die zweite Engine bestätigt das Muster in kleineren Zahlen. Auf Perplexity.ai liegt Quotation Addition vorn, „with a 22% improvement over the baseline“. Cite Sources und Statistics Addition erreichen laut Paper „improvements of up to 9% and 37% on the two metrics“.

Ein Detail, das in der Verkürzung regelmäßig verloren geht: Die Wirkung hängt vom Thema ab. Das Abstract sagt „the efficacy of these strategies varies across domains“. Im Ergebnisteil wird das konkret: Themenfelder wie „Law & Government“ und Fragetypen wie „Opinion“ profitieren laut Paper besonders davon, wenn Zahlen im Text stehen. Die Autoren leiten daraus ab, dass es themenspezifische Optimierung braucht.

Was Google selbst zu GEO sagt

Key Takeaway: Googles Dokumentation nennt GEO und AEO beim Namen und ordnet sie als Teil von SEO ein. Begründet wird das damit, dass die KI-Funktionen auf denselben Ranking-Systemen aufsetzen wie die normale Suche.

Der AI Optimization Guide in der Search-Central-Doku hat inzwischen den Stand vom 10. Juli 2026. Als er erschien, habe ich ausführlich eingeordnet: warum GEO und AEO für Google einfach noch SEO sind. Der Kernsatz ist knapp:

„From Google Search’s perspective, optimizing for generative AI search is optimizing for the search experience, and thus still SEO.“

Die Begründung steht einen Absatz darüber. Die KI-Funktionen sitzen laut Google auf den bestehenden Systemen auf: „our generative AI features on Google Search are rooted in our core Search ranking and quality systems“. Zwei Techniken nennt die Doku beim Namen. Retrieval-augmented generation heißt dort auch Grounding und holt aktuelle Seiten aus dem Suchindex, um die Antwort darauf zu stützen. Wie dieses Verankern funktioniert, habe ich in einem eigenen Beitrag zu Grounding auseinandergenommen. Query Fan-out erzeugt zu einer Anfrage mehrere verwandte Anfragen gleichzeitig, um mehr Material zu bekommen. Das Beispiel in der Doku: aus „how to fix a lawn that’s full of weeds“ werden unter anderem „best herbicides for lawns“ und „remove weeds without chemicals“. Was das für die Funktionsweise der AI Overviews bedeutet, steht ebenfalls schon auf diesem Blog.

Deutlicher wird die Doku in einem eigenen Abschnitt mit der Überschrift „Mythbusting generative AI search: what you don’t need to do“. Dort steht, was du für Google Search ignorieren kannst:

  • llms.txt und ähnliche Dateien: „You don’t need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search“. Google Search nutze sie schlicht nicht. Was hinter dem Format steckt und wer es sonst liest, steht in meinem llms.txt-Leitfaden.
  • Content-Chunking: „There’s no requirement to break your content into tiny pieces for AI to better understand it.“
  • Umschreiben für KI: „You don’t need to write in a specific way just for generative AI search.“
  • Gekaufte Erwähnungen: „seeking inauthentic ‚mentions‘ across the web isn’t as helpful as it might seem“.
  • Strukturierte Daten als KI-Hebel: „Structured data isn’t required for generative AI search, and there’s no special schema.org markup you need to add.“ Für Rich Results bleibt sie laut derselben Stelle sinnvoll, was ich in meinem Beitrag zu strukturierten Daten und AI Overviews ausführe.

Und zu den Begriffen selbst wird die Doku ungewöhnlich direkt. Sie schreibt, dass viele der kursierenden Tricks „aren’t effective or supported by how Google Search actually works“. Dann schickt sie einen Hinweis hinterher: „If you’re considering third-party ‚AEO‘ or ‚GEO‘ advice or services, review our guidance on evaluating third-party SEO advice.“

Das ist eine Aussage über Google Search und sagt nichts über die Quellenauswahl von ChatGPT, Perplexity oder Claude. Diese Unterscheidung ist wichtig, weil beide Lager sie gern übergehen.

Retrieval und Generierung: warum beide Quellen recht haben

Key Takeaway: Das Paper misst den Generierungsschritt, Googles Doku beschreibt den Retrieval-Schritt. Wer nicht abgerufen wird, kann nicht zitiert werden. Das ist meine Lesart der beiden Quellen, keine Aussage aus einer von beiden.

Eine generative Antwort entsteht in zwei Schritten: Zuerst sucht das System Quellen und danach formuliert ein Sprachmodell daraus eine Antwort, wobei es entscheidet, welche Passagen es übernimmt und welche Quelle es namentlich nennt.

Googles Doku redet über den ersten Schritt. Retrieval-augmented generation und Query Fan-out sind Beschreibungen davon, wie Seiten in die Kandidatenmenge kommen. Das Paper redet über den zweiten. Alle neun Methoden verändern den Text einer Seite, die bereits abgerufen wurde.

Der Beleg für diese Trennung steckt im Testaufbau des Papers selbst. Die Quellen kommen dort aus der Google-Suche und zwar fünf pro Anfrage. Wer in diesen fünf nicht vorkommt, nimmt an der ganzen Messung nicht teil. Anders gesagt: Das Experiment setzt klassisches Ranking voraus, statt es zu ersetzen.

Damit lösen sich die beiden Positionen auf. „Bis zu 40 % mehr Sichtbarkeit“ heißt nicht „40 % mehr Sichtbarkeit als ohne SEO“. Es heißt: unter den Seiten, die ohnehin abgerufen wurden, verschiebt sich die Zitierung. Und Googles „it’s still SEO“ heißt nicht, dass Formulierung egal wäre. Es heißt, dass Google dafür kein zweites Regelwerk anerkennt.

Praktisch folgt daraus eine Reihenfolge: Erst in die Kandidatenmenge kommen, dann um den Platz in der Antwort arbeiten. Wer die zweite Stufe angeht, ohne die erste zu haben, optimiert einen Text, den kein System abruft. Auseinandergenommen habe ich das an anderer Stelle: wie sich die Quellenauswahl zwischen AI Overviews und AI Mode unterscheidet.

GEO umsetzen: die vier Schritte, die belegt sind

Key Takeaway: Was im Paper gewirkt hat, ist redaktionelle Arbeit: belegen, zitieren, beziffern, verständlich schreiben. Nichts davon braucht ein eigenes Tool und nichts davon widerspricht Googles Doku.

Schau dir die Rangfolge in der Tabelle oben noch einmal an. Ganz oben stehen wörtliche Zitate, Zahlen und Quellenangaben, darunter Lesefluss und Verständlichkeit und ganz unten die Taktik, die den Text mit Keywords vollstopft.

Das ist keine KI-Disziplin. Das ist die Beschreibung eines gut belegten Fachtextes.

Checkliste: Vier Dinge, die im Paper messbar gewirkt haben und die du ohne neues Werkzeug umsetzt.
  • Beziffern statt behaupten. Wo eine qualitative Aussage steht („deutlich schneller“), gehört eine Zahl mit Quelle hin.
  • Wörtlich zitieren. Die stärkste Einzelmethode im Test war das Ergänzen echter Zitate aus passenden Quellen.
  • Quellen sichtbar machen. Nicht nur nennen, sondern genau an der Stelle verlinken, an der die Aussage steht.
  • Lesbar bleiben. Fluency und Verständlichkeit lagen im Test deutlich über der Baseline, ohne dass am Inhalt etwas verändert wurde.

In welcher Reihenfolge du das angehst. Die folgende Staffelung ist meine Faustregel und keine Vorgabe aus einer der beiden Quellen. Sie folgt der Trennung aus dem vorigen Abschnitt: erst abgerufen werden, dann zitiert werden.

  1. Indexierbarkeit und Ranking prüfen. Seiten, die nicht in den Top-Ergebnissen zur Frage stehen, tauchen in keiner Kandidatenmenge auf. Das ist klassische Arbeit und sie kommt zuerst.
  2. Die Frage im Text tatsächlich beantworten. Eine Antwort, die im Text steht, kann übernommen werden. Eine, die angedeutet wird, nicht.
  3. Belege einbauen. Zahlen, Zitate und verlinkte Quellen an der Stelle, an der die Aussage fällt. Das sind die drei Methoden mit den besten Werten im Test.
  4. Lesbarkeit nachziehen. Fluency und Verständlichkeit lagen im Test über der Baseline, ohne dass sich am Inhalt etwas ändert. Das ist der billigste Schritt von allen.

Was ich daraus für meine eigene Arbeit ableite, ist ebenfalls eine Faustregel. Ich behandle die vier Punkte als Qualitätsregeln für jeden Fachartikel und nicht als KI-Maßnahme. Der Grund ist einfach. Sie stehen ohnehin auf meiner Redaktionsliste und kosten nichts extra. Sie funktionieren außerdem dann noch, wenn die nächste Engine wieder anders auswählt.

Umgekehrt gilt: Alles, was Googles Doku ausdrücklich als unnötig bezeichnet, kostet Zeit ohne belegten Gegenwert. Für Google Search jedenfalls. Wenn du eine llms.txt pflegst, weil ein anderes System sie liest, ist das eine eigene Entscheidung mit eigener Begründung. Ob dein Text am Ende mehr ist als eine hübschere Fassung des Üblichen, klärt mein Commodity-Selbsttest.

Wie du misst, ob du in KI-Antworten vorkommst

Key Takeaway: Für Google Search gibt es eine offizielle Datenquelle, den Generative-AI-Performance-Report in der Search Console. Für die anderen Engines ist mir keine vergleichbare bekannt.

Die Messfrage ist bei GEO unangenehmer als bei klassischem SEO. Eine Position in einer Trefferliste kannst du nachschlagen und ob dein Text dagegen in einer erzeugten Antwort auftaucht, hängt an der einzelnen Anfrage und am Zeitpunkt und am Modell.

Googles Doku benennt genau eine Quelle: „To measure how your content is performing in generative AI features on Google Search and Discover, use the Generative AI performance report in Search Console.“ Wie dieser Bericht aufgebaut ist und was er zeigt, steht in meiner Analyse der Generative-AI-Berichte in der Search Console.

Drei Dinge sind beim Lesen dieser Zahlen hilfreich:

  • Impressionen und Klicks laufen auseinander. Eine Erwähnung in einer Antwort erzeugt eine Impression. Über den Klick entscheidet danach ein Leser, dem die Antwort bereits vorliegt.
  • Sichtbarkeit verteilt sich pro Thema statt pro Domain. Dieselbe Website kann bei einem Thema regelmäßig zitiert werden und beim nächsten gar nicht. Warum das so ist, habe ich unter KI-Sichtbarkeit pro Thema statt pro Domain beschrieben.
  • Einzelne Stichproben taugen nicht als Messung. Dieselbe Anfrage liefert je nach Durchlauf andere Quellen und schon die Autoren des Papers zogen deshalb fünf Antworten pro Anfrage.

Für ChatGPT, Perplexity, Claude und Gemini fehlt eine offizielle Berichtsfläche für Websitebetreiber und übrig bleiben am Ende nur eigene Stichproben und die Zahlen von Drittanbietern. Beides sind Schätzungen und beides sollte man auch so nennen.

Was GEO-Tools leisten können und was nicht

Key Takeaway: Ein Tool kann beobachten, ob eine Marke in Antworten auftaucht. Einen Ranking-Faktor kann es nicht auslesen, weil kein Anbieter Zugang zu diesen Systemen hat.

Inzwischen gibt es eine Reihe von Werkzeugen, die eine KI-Sichtbarkeit ausweisen. Zwischen dem Können und dem Behaupten verläuft bei diesen Werkzeugen eine ziemlich klare Trennlinie.

Beobachten kann ein Tool. Es stellt Fragen an die Engines und protokolliert die Antworten und zählt darin die Erwähnungen einer Domain. Das ist eine echte Messung mit den Einschränkungen aus dem vorigen Abschnitt: eine Stichprobe zu einem Zeitpunkt und mit einer selbst getroffenen Fragenauswahl.

Auslesen kann es nicht. Googles Doku ist an dieser Stelle unmissverständlich: „No third-party tool has access to our internal ranking or AI systems.“ Ein ausgewiesener „GEO-Score“ ist damit ein Modell des Anbieters und keine Auskunft aus dem System.

Daraus folgt eine brauchbare Kaufprüfung in zwei Fragen. Erstens: welche Fragen stellt das Tool und wie oft und gegen welche Engines? Zweitens: wie kommt der ausgewiesene Score zustande? Auf die erste Frage gibt es eine überprüfbare Antwort und auf die zweite hörst du entweder eine offengelegte Formel oder eine Erklärung dafür, warum es sie nicht gibt.

Häufig gestellte Fragen (FAQ)

Was ist Generative Engine Optimization in einem Satz?

Generative Engine Optimization ist die Arbeit an Inhalten mit dem Ziel, in den Antworten generativer KI-Systeme wie ChatGPT, Perplexity oder den AI Overviews vorzukommen. Der Begriff stammt aus dem Paper „GEO: Generative Engine Optimization“ von Aggarwal et al., das 2023 als Preprint erschien und zur KDD 2024 angenommen wurde.

Ist GEO dasselbe wie SEO?

Aus Sicht von Google Search ja. Die Doku schreibt: „optimizing for generative AI search is optimizing for the search experience, and thus still SEO“. Das Paper hinter dem Begriff beschreibt etwas Engeres. Es geht dort um Textänderungen, die verschieben, wie eine bereits abgerufene Quelle in einer erzeugten Antwort zitiert wird. Beide Aussagen sind vereinbar, wenn du Retrieval und Generierung als zwei Schritte liest.

Wer hat den Begriff Generative Engine Optimization erfunden?

Ein sechsköpfiges Autorenteam um Pranjal Aggarwal in dem Paper „GEO: Generative Engine Optimization“, das als Preprint unter arXiv:2311.09735 vorliegt. Version 1 stammt vom 16. November 2023 und Version 3 vom 28. Juni 2024, angenommen wurde es zur KDD 2024.

Bringen die getesteten Methoden auch bei Google AI Overviews etwas?

Das Paper beantwortet die Frage nicht, weil es AI Overviews nicht getestet hat. Gemessen wurde in einem eigenen Aufbau mit gpt3.5-turbo und zusätzlich auf Perplexity.ai. Für Google Search verweist Googles Doku auf die üblichen SEO-Grundlagen statt auf KI-spezifische Maßnahmen. Was von den Methoden übrig bleibt, sind allgemeine Qualitätsregeln: belegen und beziffern.

Wie lange dauert es, bis GEO wirkt?

Dazu liegt mir keine belastbare Quelle vor. Das Paper misst den Effekt einer Textänderung in einem Laboraufbau und macht keine Aussage über Zeiträume in echten Systemen. Was sich sagen lässt: Ein Text muss zuerst neu abgerufen und verarbeitet werden, bevor eine Änderung in einer Antwort sichtbar werden kann. Jede konkrete Wochenangabe, die dir begegnet, ist eine Erfahrungsschätzung.

Brauche ich eine llms.txt für die KI-Suche?

Für Google Search nicht. Die Doku ist an der Stelle eindeutig: „You don’t need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search“. Google Search nutzt diese Dateien nach eigener Aussage nicht, sie schaden aber auch nicht. Für andere Systeme kann die Datei sinnvoll sein, das ist dann eine eigene Entscheidung.

Warum funktioniert Keyword Stuffing in generativen Antworten nicht?

Das Paper erklärt die Ursache nicht, es misst nur das Ergebnis: „we find such methods offer little to no improvement on generative engine’s responses“. Auf Perplexity.ai lag die Variante 10 % unter der unveränderten Fassung. Die Autoren ziehen daraus den Schluss, dass Techniken aus der klassischen Suchmaschinenoptimierung sich nicht automatisch auf generative Systeme übertragen.

Wie messe ich, ob ich in KI-Antworten vorkomme?

Für Google Search gibt es den Generative-AI-Performance-Report in der Search Console, auf den Googles Doku ausdrücklich verweist. Eine vergleichbare offizielle Datenquelle der anderen Engines ist mir nicht bekannt. Drittanbieter-Tools schätzen. Googles Doku hält dazu fest: „No third-party tool has access to our internal ranking or AI systems.“

Fazit: GEO ist der letzte Meter, nicht der Weg

Key Takeaway: Der Begriff hat eine belastbare Quelle mit einer klaren Methodik und einer klaren Grenze. Was dort gemessen wurde, setzt klassisches Ranking voraus. Googles Doku sagt dasselbe aus der anderen Richtung.

Zwei Quellen, ein Begriff, zwei Blickwinkel. Das Paper zeigt, dass die Formulierung eines Textes verschiebt, wie eine generative Antwort ihn zitiert. Googles Doku zeigt, dass die Auswahl dieser Quellen weiterhin an derselben Stelle passiert wie bisher. Zusammengenommen ergeben die beiden Befunde ein ziemlich unaufgeregtes Bild von einer Abkürzung, die inzwischen als eigene Disziplin verkauft wird.

Was dabei auffällt: Von den neun getesteten Methoden ist keine ein Trick. Zitieren, belegen, beziffern und verständlich schreiben. Das ist die Arbeit, die ein Fachartikel ohnehin verlangt, nur dass sie in einer generierten Antwort schneller sichtbar wird als in einer klassischen Trefferliste.

Tipp: Wenn dir jemand ein GEO-Paket verkauft, frag nach der Quelle für die versprochene Wirkung. Die eine Messung mit offengelegter Methodik, die ich kenne, lief auf zwei Engines, von denen keine Google war. Alles darüber hinaus ist Erfahrung oder Vermutung. Beides darf man so nennen.

Stand: August 2026. Alle Angaben ohne Gewähr: Trotz sorgfältiger Recherche wird keine Gewähr für Aktualität und Vollständigkeit übernommen. Die wiedergegebenen Studienergebnisse beruhen auf den von den Autoren des Papers „GEO: Generative Engine Optimization“ veröffentlichten Angaben, für deren Richtigkeit keine Gewähr übernommen wird. Angaben zu Google Search geben den dokumentierten Stand wieder und können sich ändern. Die Auswertung der Suchergebnisseite vom 16. August 2026 ist ein eigener Abzug über die SERP-Schnittstelle von DataForSEO (Google, Deutschland, Deutsch) und damit eine Momentaufnahme. Alle genannten Marken und Produktnamen sind Eigentum ihrer jeweiligen Inhaber. Dieser Beitrag ersetzt keine individuelle Beratungsleistung.

Christian Ott - Gründer von www.seo-kreativ.de

Christian Ott - SEO kreativ denken & Wissen teilen

Als Gründer von SEO-Kreativ lebe ich meine 2014 entdeckte Leidenschaft für SEO. Mein Weg vom Hobby-Blogger zum SEO-Experten und Product Developer hat dabei meinen Ansatz geprägt: Ich teile Wissen verständlich, praxisnah und ohne Fachchinesisch.