GPT Spy · Wissensbasis · Stand 21. August 2026

Wie ChatGPT sucht

ChatGPT beantwortet Fragen, indem es im Web sucht. Wie es sucht — welche Anfragen es formuliert, welche Seiten es öffnet, wie alt Inhalte sein dürfen — ändert sich laufend und wird nirgends dokumentiert.

Wir stellen jeden Tag dieselben Fragen und protokollieren, was sich verändert. Diese Seite hält fest, was daraus belegbar ist.

Messtage2
Läufe erfasst24
Fragen im Satz26
Befunde Tag 2124

Warum das zählt

Der Anlass — an einem konkreten Beispiel

Zwischen dem 16. und 20. August hat OpenAI die Sprache ausgetauscht, in der ChatGPT seine Websuchen formuliert. Am 21. August wechselte zusätzlich der Endpunkt, über den Konversationen abgerufen werden — samt Antwortformat. gemessenQ1

Beides stand in keinem Changelog. Wer nicht täglich misst, merkt so etwas erst, wenn die eigenen Zahlen einbrechen — und weiß dann nicht, woran es lag.

Für wen diese Seite ist.

Für alle, die verstehen wollen, wie Inhalte in ChatGPT-Antworten gelangen. Es hilft, SEO zu kennen; Kenntnisse über ChatGPTs Innenleben werden nicht vorausgesetzt. Fachbegriffe werden erklärt, wo sie zum ersten Mal auftauchen.

Jede Aussage trägt ihren Beleg: gemessen bestätigt fremdbelegt überholt Vermutung was die Marken bedeuten

Versuchsaufbau

Jede Entscheidung mit ihrer Begründung

Eine Messreihe taugt nur so viel wie ihre Konstanten. Was hier festgelegt ist und warum:

WasWieWarum so
Kontodedizierter ChatGPT-Plus-Zugang Ein persönliches Konto würde die Messung durch Verlauf und Personalisierung verfälschen
Erinnerungaus, keine eigenen Anweisungen Sonst misst man das Konto, nicht die Pipeline
Zugangechter Browser, echte Oberfläche Nicht die API. Dieselbe Frage liefert dort nachweislich andere Quellen — die API bildet das Produkt nicht ab
Sprache und OrtDeutsch, Deutschland Ergebnisse hängen von beidem ab; eine Messreihe muss beides festhalten
Fragen26, eingefroren Ändert man die Frage, weiß man nicht mehr, ob sich die Frage oder ChatGPT geändert hat
Antwortmodi„Sofort" und „Mittel" Beide greifen auf unterschiedliche Suchkorpora zu — ein Modus zeigt die halbe Wahrheit
Rhythmuseinmal täglich, feste Zeit ± Zufallsversatz Vergleichbarkeit — der Versatz vermeidet ein Uhrwerk-Muster
Konversationenjede Frage in einem frischen Chat Kontext aus einem vorigen Turn würde die Suchentscheidung beeinflussen

Was wir mitschneiden

  • Das Gesprächsobjekt — was ChatGPT intern über die Antwort speichert: welche Suchen es gefahren hat, welche Treffer zurückkamen, welche Quellen es zitiert.
  • Den Netzwerkverkehr — was der Browser tatsächlich sendet und empfängt, einschließlich der Dinge, die in der Oberfläche nie erscheinen.
  • Den Startzustand — welche Funktionen für dieses Konto freigeschaltet sind, welche Modelle zur Wahl stehen, welche Testgruppen-Schalter gesetzt sind.

Ein Messtag ist eine Momentaufnahme.

Einzelne Zahlen auf dieser Seite sagen wenig. Ob eine Beobachtung eine Änderung ist oder normale Streuung, zeigt erst die Wiederholung — ein Befund gilt hier deshalb erst als bestätigt, wenn er an zwei Tagen in Folge auftritt. Aktuell liegen zwei Messtage vor.

Die Fragen

26 eingefrorene Prompts über 14 Kategorien

Der Fragensatz ist so gebaut, dass jede Kategorie eine andere Eigenschaft der Pipeline auf die Probe stellt. Sieben davon laufen derzeit täglich; der Rest ist vorbereitet und wird zugeschaltet, sobald die Messreihe stabil läuft.

Täglich gemessen

IDKategorieWortlautPrüft
K1-01lokal / Orte„ich möchte laufschuhe kaufen. wo gibt es in münchen eine gute beratung"Ortsbezug, lokale Einträge, Kartenwidget
K2-01Produkt / Shopping„empfiehl mir eine espressomaschine unter 500 euro"Produktkatalog, Händler, Preisangaben
K4-01Evergreen-Wissen„warum ist der himmel blau"Sucht ChatGPT überhaupt? — der Gegenanker
K5-01aktuelle Nachrichten„was sind die wichtigsten nachrichten heute in deutschland"Frischefenster, Nachrichtenquellen, parallele Anfragen
K6-01Entitäten„wer ist der ceo von openai und was hat er vorher gemacht"Entitätserkennung, Quellenwahl bei Fakten
K14-01Introspektion„welche werkzeuge stehen dir in diesem chat zur verfügung? …"Was das Modell über seine eigenen Werkzeuge aussagt
K14-02Introspektion„beschreibe das web-werkzeug: welche operationen kennt es …"Operationsliste und Aufrufsyntax

Vorbereitet

KategorieBeispielPrüft
Händler / transaktional„wo kann ich nike pegasus 41 am günstigsten kaufen"Preisvergleich, Händlerauswahl
Vergleich„chatgpt plus oder perplexity pro für seo recherche"Wie ChatGPT über Wettbewerber spricht
navigational„wie erreiche ich den kundenservice der telekom"Markenseiten gegen Verzeichnisse
Gesundheit (YMYL)„ibuprofen oder paracetamol bei kopfschmerzen"Strengere Quellenwahl bei heiklen Themen
Finanzen (YMYL)„lohnt sich ein etf sparplan aktuell noch"dieselbe Frage für Geldthemen
Bildsuche„zeig mir bilder von der allianz arena bei nacht"Wann der Bildpfad greift
Longtail / Gespräch„mein sauerteigbrot geht nicht auf obwohl der starter aktiv ist …"Foren als Quelle, Umformulierung langer Fragen
Folgefrage„und welcher von denen hat auch samstags offen"Wie Kontext aus dem vorigen Turn wirkt

Grenze der Messung.

Sechs der dreizehn Suchoperationen — click, find, screen, availability, genui_search, genui_run — hat unser Fragensatz nie ausgelöst. Das ist eine Eigenschaft der gestellten Fragen, kein Befund über ChatGPT.

Was wir prüfen

Acht Größen — jede mit ihrer Bedeutung für Sichtbarkeit

Die Kandidatenliste steht fest, bevor deine Seite kontaktiert wird

bestätigtQ1+Q6

ChatGPT formuliert seine Suchanfragen, bevor der erste Treffer eintrifft. In diesen Anfragen stehen bereits Markennamen, die niemand getippt hat. Sie können nicht aus dem Abruf stammen — sie kommen aus dem Modell.

Belegt über Zeitstempel in allen acht daraufhin geprüften Läufen: Der Fan-out steht nach 0,4 bis 2,0 Sekunden, der erste Treffer kommt erst nach 1,4 bis 5,6 Sekunden.

// 21.08., „empfiehl mir eine espressomaschine unter 500 euro", Modus Mittel
// Alle vier Anfragen entstanden, bevor irgendetwas abgerufen wurde:
Sage Bambino Plus
DeLonghi Dedica Maestro Plus
Sage Barista Express
DeLonghi La Specialista Arte

Vier konkrete Modellbezeichnungen. Die Frage nannte keine einzige Marke.

Warum das zählt

Das ist die folgenreichste Einsicht dieser Seite. Steht eine Marke nicht in dieser Liste, wird ihre Seite gar nicht erst geprüft — keine technische Verbesserung erreicht sie, weil die Auswahl fällt, bevor der eigene Server kontaktiert wird. Wer dort auftaucht, hat die Markenarbeit hinter sich; was bleibt, ist die Arbeit an der Seite. Prüfen lässt sich das in Minuten: dieselbe Kategoriefrage fünfmal stellen und notieren, welche Namen ChatGPT in seine eigenen Anfragen schreibt.

Sucht ChatGPT überhaupt?

gemessenQ1

Nicht jede Frage löst eine Websuche aus. Bei uns tat es genau eine von fünf nicht — die Evergreen-Frage „warum ist der himmel blau". ChatGPT antwortete aus dem Gedächtnis, ohne eine einzige Quelle abzurufen.

Warum das zählt

Für solche Fragen gibt es keine Zitate zu gewinnen, egal wie gut die eigene Seite ist. Bevor man um Sichtbarkeit kämpft, muss man wissen, ob die Frage überhaupt ins Web führt.

Welche Suchanfragen schreibt ChatGPT?

bestätigtQ1+Q4

Nicht die Nutzerfrage wird gesucht. ChatGPT formuliert eigene Anfragen und fächert sie auf — im Fachjargon Fan-out. Aus der Frage nach Laufschuh-Beratung in München wurde:

business|Munich, Bavaria, Germany|running shoe store;Laufschuhe Beratung;gait analysis
fast|beste Laufläden München Laufanalyse|30
image|Laufgeschäft München Laufschuhe Beratung|30
length|medium

Erste Spalte: die Art der Suche. Dann die Anfrage — mehrere durch Semikolon getrennt. Ortsbezogene Suchen schieben den Ort dazwischen.

Warum das zählt

Diese Zeilen zeigen, mit welchen Begriffen ChatGPT die Kategorie denkt — und welche Marken es bereits kennt, bevor es überhaupt sucht. Wer hier nicht vorkommt, ist nicht im Kandidatenkreis.

Wie alt darf der Inhalt sein?

gemessenQ1

Die Zahl hinter der Anfrage ist ein Frischefenster in Tagen. Belegt über die volle Bandbreite unserer Fragen:

FrageFensterBedeutet
Nachrichten heute1nur von heute
Produktvergleich30letzter Monat
Biografie3650zehn Jahre — praktisch ohne Grenze
Warum das zählt

Die praktisch verwertbarste Zahl der ganzen Messung. Eine Preisseite, die seit über 30 Tagen unverändert ist, konkurriert bei Vergleichsanfragen von außerhalb des Fensters — sie wird gar nicht erst betrachtet.

Welche Domains steuert ChatGPT gezielt an?

gemessenQ1

Das letzte Feld einer Suchzeile kann eine Domain sein — dann sucht ChatGPT ausschließlich dort:

slow|Deutschland wichtigste Nachrichten heute|1|tagesschau.de
fast|Sam Altman biography Y Combinator Loopt|3650|britannica.com
Warum das zählt

Steht die eigene Domain in diesem Feld, kennt ChatGPT die Marke und prüft sie gezielt. Steht sie nie dort, liegt das Problem nicht an den Seiten, sondern daran, dass die Marke gar nicht erst als Kandidat auftaucht.

Gelistet oder gelesen?

gemessenQ1

Ein Treffer in der Ergebnisliste ist etwas anderes als eine geöffnete Seite. open|turn0search23 lädt einen Treffer vollständig. Bei uns geschah das nur bei der Nachrichtenfrage, dort dreimal.

Warum das zählt

Geöffnete Seiten werden deutlich häufiger zitiert als bloß gelistete fremdbelegtQ2. Zwei sehr verschiedene Stufen von Sichtbarkeit, die in keinem Dashboard unterschieden werden.

Aus welchem Index kommen die Treffer?

gemessenQ1

ChatGPT bezieht Treffer aus mehreren Quellen. Welche geliefert hat, verrät der Zuschnitt der Ergebnisse:

MerkmalPipeline APipeline B
Textausriss~202 Zeichen~138 Zeichen
Titelungekürzt, teils über 75 Zeichenum 60 Zeichen
Treffer ohne Ausriss36 %0 %
bei unslokal, Produkt, EntitätNachrichten
Warum das zählt

Verschiedene Pipelines heißen verschiedene Spielregeln. Die Meta-Description wird in der einen ausgewertet, in der anderen ignoriert — wer für die falsche optimiert, optimiert ins Leere.

Antwort oder Widget?

gemessenQ1

Manche Antworten enthalten eingebettete Bausteine statt Fließtext. Beobachtet wurden map_widget bei der lokalen Frage und suggest_automation bei den Nachrichten.

Warum das zählt

In einem Widget gibt es keinen Link zu gewinnen. Wandert eine Fragestellung dorthin ab, verschwindet die Chance auf ein Zitat vollständig — unabhängig davon, wie gut die eigene Seite rankt.

Was sich ändert

Erster Vergleich zweier Messtage: 20. → 21. August

124 eigenständige Befunde. Die meisten traten in allen zehn vergleichbaren Läufen zugleich auf und in beiden Antwortmodi — sie betreffen also die Plattform, nicht einzelne Fragen. gemessenQ1

Der Konversationsabruf wurde umgestellt

20. August21. August
Pfad/backend-api/conversation/{id}/backend-api/conversations/{id}?…
FormBaum mit Eltern-Kind-Bezügenflache Liste in Reihenfolge
Umfangvollständigseitenweise, 10 Turns je Abruf

Gefunden wurde die Änderung, weil die Messung daran zerbrach: Der Mitschnitt horchte auf den alten Pfad, alle vierzehn Läufe blieben ohne Datei. Seitdem wird das Format als eigener Messwert geführt — ein Wechsel meldet sich künftig, statt die Erfassung zu stoppen.

Fünf neue Metadaten-Felder

search_model_queries       // am Vortag nur im Antwortstrom, jetzt wieder im Abruf
map_search_model_queries   // neu: Anfragen des Karten-Pfads
story_events
rebase_developer_message
is_visually_hidden_from_conversation

Das erste Feld liefert Anfragen, die auch aus den Suchbefehlen stammen — dieselbe Anfrage erschien dadurch doppelt. Gezählt wird seitdem der Fan-out, also die Zahl unterschiedlicher Anfragen.

Endpunkte kommen und gehen

EndpunktBemerkung
neu/backend-api/beacons/event
neu/backend-api/settings/announcement_viewedführt hasSeenM3mNux
neu/backend-api/search/product_carousel_descriptionsnur bei der Produktfrage
weg/backend-api/aip/connectors/list_accessiblelieferte Konnektoren und App-Vorlagen

Kleinere Verschiebungen: dil erscheint neu als Ereignistyp im Antwortstrom, beim Produkt-Prompt löst products den Typ product_entity ab, der Nachrichten-Prompt wechselte den Suchmodus von open zu slow, und bei einer Frage fiel der Textausriss von 202 auf 161 Zeichen — dem Zuschnitt nach ein Wechsel der liefernden Pipeline.

Zwei Messtage sind keine Zeitreihe.

Ob diese Verschiebungen Rollouts sind oder normale Streuung, zeigt erst die Wiederholung. Eine Tagesansicht mit Verlauf entsteht, sobald genügend Messtage vorliegen.

Beleglage

Wie jede Aussage auf dieser Seite einzuordnen ist

In diesem Feld kursiert viel Behauptung. Der Wert dieser Sammlung hängt daran, dass Gemessenes und Gelesenes nie verschwimmen — deshalb trägt jede Aussage eine Marke.

MarkeBedeutet
gemessenQ1 Aus unseren eigenen Rohdaten, mit Datum und Fundort nachvollziehbar
bestätigtQ1+Q4 Zwei unabhängige Quellen zeigen dasselbe
fremdbelegtQ2 Stammt aus einer fremden Quelle, von uns nicht nachgemessen
überholtQ3 War zum Zeitpunkt der Quelle zutreffend, gilt heute nicht mehr
Vermutung Plausibel, aber unbelegt — als solche gekennzeichnet

Die Kürzel verweisen auf die Quellenliste. Fremdbefunde stehen hier nur, wenn sie gegen die eigenen Rohdaten geprüft wurden — auch dann, wenn die Prüfung sie nicht bestätigt hat. Gerade dann.

Überholt

Beschreibungen, die einmal stimmten — und was heute gilt

Eine ausführliche externe Untersuchung fremdbelegtQ3 beschreibt die Modellgenerationen 5.3 und 5.4. Gemessen wird hier 5.6. Mehrere Aussagen treffen auf diesen Stand nicht mehr zu:

BeschriebenHeute gemessen
Suchbefehle als strukturiertes JSON zeilenweise Befehle mit Trennstrichen, in beiden Antwortmodi
eigener Umschreibe-Schritt bei Produktfragennicht auffindbar
Google-Kennzeichnung in Produkt-Linksnicht auffindbar
Operationen search_query, product_queryheißen fast, slow, business, product
Verhältnis Treffer zu Domains stabil bei 1,261,78 bis 21,75 — stark von der Frage abhängig
Anfragen liegen unter search_queries (umbenannt Anfang August) fremdbelegtQ6bei uns durchgehend search_model_queries — der alte Name
Antworten laufen über eine dauerhafte WebSocket-Verbindung fremdbelegtQ6kein einziger WebSocket im Verkehr — alles über gewöhnliche Abrufe
Ein Klassifikator turn_use_case ordnet jede Frage vorab ein fremdbelegtQ6Feld in unseren Daten nicht vorhanden
Vorauswahl über einen auto-Router, Modelle 5.3 und 5.5 fremdbelegtQ6bei uns gpt-5-6 und gpt-5-6-thinking, Vorgabe ist die Denkvariante

Das ist kein Vorwurf an die Quelle.

Die Beschreibung war zu ihrem Zeitpunkt zutreffend. Zwischen dem 16. und 20. August wurde die Befehlssprache ausgetauscht fremdbelegtQ5 — eine Beschreibung von vorher ist damit überholt, nicht falsch.

Genau deshalb steht dieser Abschnitt hier: Wer eine fremde Beschreibung übernimmt, ohne sie gegen eigene Daten zu prüfen, baut auf einem Stand, den es vielleicht nicht mehr gibt. Hätten wir unseren Auswerter auf JSON umgestellt, hätte er ab dem nächsten Lauf nichts mehr gefunden.

Zutreffend aus derselben Quelle: die eingebetteten Widgets, die Verwendung von Domain-Beschränkungen und die Messbarkeit der Domain-Konzentration.

Chronik

Felder, die verschwunden sind — und wie wir sie ersetzt haben

Für alle, die tiefer einsteigen: Der ursprüngliche Auswerter las Felder, die es nicht mehr gibt. Die Läufe meldeten trotzdem Erfolg, die Auswertung blieb still halbleer. Das ist die teuerste Fehlerart in diesem Projekt.

ErwartetRealitätErsatz
sonic_classification_result weg — übrig blieb eine undurchsichtige Kennung Modellkennung, ob gesucht wurde, Art der Suche
search_model_queries am 20.08. nur im Antwortstrom, am 21.08. wieder im Abruf Auswertung der Suchbefehle, beide Quellen zusammengeführt
entry.source existiert nicht — Einträge tragen eine Zuschreibung Domain der Trefferguppe plus Zuschreibung
Entitäten als Textmarker keine Textmarker mehr eigener Verweistyp im Antwortobjekt
result_source im Juli 2026 über Nacht entfernt fremdbelegtQ2 Zuschnitt der Treffer als Näherung

Die Lehre steckt in Zeile zwei: Ein Feld, das im Abruf fehlt, kann im Antwortstrom weiterleben — und ebenso zurückkehren. Wer ein Feld für verschwunden hält, sollte erst im Netzwerkmitschnitt nachsehen.

Unsichtbare Zeichen

Eingebettete Strukturen im Antworttext sind von Zeichen aus einem privaten Unicode-Bereich umrahmt. Der Text sieht normal aus, ein Suchmuster ohne Toleranz trifft nie:

Position  Zeichen  Codepoint
      -1  (unsichtbar)  U+E200
       0  g        U+0067
     …
       5  (unsichtbar)  U+E202
       6  {        U+007B

Bei unerklärlich leeren Textfeldern zuerst die Zeichencodes prüfen. Dieselbe Technik umgibt auch die Beleg- und Entitätsmarker.

Quellen

Worauf sich die Belege beziehen

  • Q1 · Eigene Messung Läufe vom 20. und 21. August 2026 — 24 Durchgänge in zwei Antwortmodi. Mess-Account ChatGPT Plus, Oberfläche Deutsch, Standort Deutschland. Rohdaten und Netzwerkmitschnitte werden archiviert, aber nicht veröffentlicht.
  • Q2 · RESONEO / Search Engine Land Untersuchung zu ChatGPTs Zitier-Mechanik — Olivier de Segonzac. 1.200 Antworten, 88.000 Suchergebnisse, 26.900 Seiten. Beschreibt die Retrieval-Pipelines, das entfallene Quellenfeld und den Lese-Zwischenspeicher.
  • Q3 · RESONEO / Search Engine Land Untersuchung zu Seitenabruf und Quellenauswahl, Generationen 5.3 und 5.4. Mehrere Aussagen treffen auf den hier gemessenen Stand 5.6 nicht mehr zu — siehe Überholt.
  • Q4 · Introspektion Antworten des Modells auf Fragen nach seinen eigenen Werkzeugen. Modell-Aussage, keine Beobachtung. Trägt nur, wo eine zweite Quelle dasselbe zeigt — etwa bei der Befehlssyntax. Seit dem 20.08. als Kategorie K14 Teil der täglichen Messung.
  • Q6 · Suganthan Mohanadasan Dreiteilige Netzwerk-Analyse mit laufendem Änderungsprotokoll, Juni bis August 2026. Ein Plus-Konto in Dubai. Trennt sauber zwischen strukturellen Befunden (aus einer Aufnahme belegbar) und Häufigkeiten (ein Konto, Richtung statt Messwert) — dieselbe Unterscheidung, die auch hier gilt. Der Befund zur Kandidatenliste ist an unseren eigenen Daten unabhängig bestätigt; mehrere andere Angaben treffen auf unseren Stand nicht zu (siehe Überholt).
  • Q5 · Externe Datierung des Sprachwechsels Datiert den Austausch der Befehlssyntax auf den 16. bis 20. August 2026. Von uns nicht unabhängig nachgemessen — unsere Messreihe beginnt am 20. August und sieht ausschließlich die neue Syntax.