GPTSpy · Wissensbasis · Stand 21. August 2026

Wie ChatGPT sucht und die Antworten generiert

ChatGPT beantwortet Fragen, indem es oft — aber nicht immer im Web sucht. Wie es sucht — welche Anfragen es formuliert, welche Seiten es öffnet, wie alt Inhalte sein dürfen — ändert sich laufend. Wir versuchen das hier zu dokumentieren.

Wir stellen jeden Tag dieselben Fragen und protokollieren, was sich verändert. Diese Seite hält fest, was daraus belegbar ist.

Messbeginn20.08.2026
Fragen im Satz26
Läufe je Tag33

Warum das zählt

Der Anlass — an einem konkreten Beispiel

Zwischen dem 16. und 20. August hat OpenAI die Sprache ausgetauscht, in der ChatGPT seine Websuchen formuliert. Am 21. August wechselte zusätzlich der Endpunkt, über den Konversationen abgerufen werden — samt Antwortformat. gemessenQ1

Beides stand in keinem Changelog. Wer nicht täglich misst, merkt so etwas erst, wenn die eigenen Zahlen einbrechen — und weiß dann nicht, woran es lag.

Für wen diese Seite ist.

Für alle, die verstehen wollen, wie Inhalte in ChatGPT-Antworten gelangen. Es hilft, SEO zu kennen; Kenntnisse über ChatGPTs Innenleben werden nicht vorausgesetzt. Fachbegriffe werden erklärt, wo sie zum ersten Mal auftauchen.

Jede Aussage trägt ihren Beleg: gemessen bestätigt fremdbelegt überholt Vermutung was die Marken bedeuten

Versuchsaufbau

Jede Entscheidung mit ihrer Begründung

Eine Messreihe taugt nur so viel wie ihre Konstanten. Was hier festgelegt ist und warum:

WasWieWarum so
Kontodedizierter ChatGPT-Plus-Zugang Ein persönliches Konto würde die Messung durch Verlauf und Personalisierung verfälschen
Erinnerungaus, keine eigenen Anweisungen Sonst misst man das Konto, nicht die Pipeline
Zugangechter Browser, echte Oberfläche Nicht die API. Dieselbe Frage liefert dort nachweislich andere Quellen — die API bildet das Produkt nicht ab
Sprache und OrtDeutsch, Deutschland Ergebnisse hängen von beidem ab; eine Messreihe muss beides festhalten
Fragen26, eingefroren Ändert man die Frage, weiß man nicht mehr, ob sich die Frage oder ChatGPT geändert hat
Antwortmodi„Sofort" und „Mittel" Beide greifen auf unterschiedliche Suchkorpora zu — ein Modus zeigt die halbe Wahrheit
Rhythmuseinmal täglich, feste Zeit ± Zufallsversatz Vergleichbarkeit — der Versatz vermeidet ein Uhrwerk-Muster
Konversationenjede Frage in einem neuen Chat Kontext aus einem vorigen Turn würde die Suchentscheidung beeinflussen

Was wir mitschneiden

  • Das Gesprächsobjekt — was ChatGPT intern über die Antwort speichert: welche Suchen es gefahren hat, welche Treffer zurückkamen, welche Quellen es zitiert.
  • Den Netzwerkverkehr — was der Browser tatsächlich sendet und empfängt, einschließlich der Dinge, die in der Oberfläche nie erscheinen.
  • Den Startzustand — welche Funktionen für dieses Konto freigeschaltet sind, welche Modelle zur Wahl stehen, welche Testgruppen-Schalter gesetzt sind.

Ein Messtag ist eine Momentaufnahme.

Einzelne Zahlen auf dieser Seite sagen wenig. Ob eine Beobachtung eine Änderung ist oder normale Streuung, zeigt erst die Wiederholung — ein Befund gilt hier deshalb erst als bestätigt, wenn er an zwei Tagen in Folge auftritt. Aktuell liegen zwei Messtage vor.

Die Fragen

26 eingefrorene Prompts über 14 Kategorien

Der Fragensatz ist so gebaut, dass jede Kategorie eine andere Eigenschaft der Pipeline auf die Probe stellt. Seit dem 21. August 2026 werden alle 26 Fragen täglich gemessen. Sieben davon bilden den Kernsatz und laufen zusätzlich ein zweites Mal mit eingeschaltetem Nachdenken — der Vergleich beider Antwortmodi trennt Veränderungen an der Pipeline von Unterschieden, die nur am Modus liegen.

Der Wortlaut ist eingefroren. Er wird nie nachgebessert, auch nicht wenn eine Frage unglücklich formuliert erscheint: Sobald sich der Text ändert, sind die Messungen davor und danach nicht mehr vergleichbar. Änderungen erscheinen nur als neue Fassung des gesamten Satzes, die alte bleibt erhalten.

Kernsatz — täglich in beiden Antwortmodi

7 Fragen. Sie laufen jeden Tag zweimal: einmal mit sofortiger Antwort, einmal mit eingeschaltetem Nachdenken. Nur so lässt sich sagen, ob eine Veränderung an der Pipeline liegt oder am Antwortmodus.

IDKategorieWortlautPrüft
K1-01lokal / Orte„ich möchte laufschuhe kaufen. wo gibt es in münchen eine gute beratung"Ortsbezug, lokale Einträge, Kartenwidget
K2-01Produkt / Shopping„empfiehl mir eine espressomaschine unter 500 euro"Produktkatalog, Händler, Preisangaben
K4-01Evergreen-Wissen„warum ist der himmel blau"Sucht ChatGPT überhaupt? — der Gegenanker
K5-01aktuelle Nachrichten„was sind die wichtigsten nachrichten heute in deutschland"Wie eng der Zeitraum gesetzt wird, Nachrichtenquellen, parallele Anfragen
K6-01Entitäten„wer ist der ceo von openai und was hat er vorher gemacht"Entitätserkennung, Quellenwahl bei Fakten
K14-01Introspektion„welche werkzeuge stehen dir in diesem chat zur verfügung? liste die namespaces mit ihren operationen und parametern auf."Was das Modell über seine eigenen Werkzeuge aussagt
K14-02Introspektion„beschreibe das web-werkzeug: welche operationen kennt es und welche parameter erwartet jede davon?"Operationsliste und Aufrufsyntax des Suchwerkzeugs

Täglich im Standardmodus

19 Fragen. Sie decken die übrigen Kategorien ab und werden einmal täglich gemessen. Der Modus-Vergleich bleibt dem Kernsatz vorbehalten, damit die Zahl der Abfragen pro Tag beherrschbar bleibt.

IDKategorieWortlautPrüft
K1-02lokal / Orte„welcher italiener in münchen schwabing hat heute mittag geöffnet"Öffnungszeiten: fragt ChatGPT nach dem Zustand von jetzt, nicht nur nach der Adresse
K2-02Produkt / Shopping„welche laufschuhe sind gut bei überpronation"Grenzfall: Beratungsfrage oder Kaufabsicht — wovon hängt der Shopping-Pfad ab
K2-03Produkt / Shopping„was ist der beste kinderwagen für die stadt"Produktempfehlung ohne Marke im Prompt: was ChatGPT von sich aus vorschlägt
K3-01Händler / transaktional„wo kann ich nike pegasus 41 am günstigsten kaufen"Preisvergleich und Händlerauswahl — welche Shops überhaupt auftauchen
K3-02Händler / transaktional„dyson v15 angebot heute"Angebote mit Zeitbezug: wie eng der Zeitraum für Preisdaten gesetzt wird
K4-02Evergreen-Wissen„wie funktioniert eine wärmepumpe einfach erklärt"Erklärfrage ohne Aktualitätsbezug: der zweite Anker gegen unnötige Suche
K5-02aktuelle Nachrichten„wie steht der dax heute und warum"Finanzdaten mit Tagesbezug: welche Quellen für Kurse herangezogen werden
K6-02Entitäten„was macht die firma sistrix und wer steckt dahinter"Firmen als Entität: Eigendarstellung oder unabhängige Quellen
K7-01Vergleich„chatgpt plus oder perplexity pro für seo recherche"Wie ChatGPT über Wettbewerber spricht
K7-02Vergleich„iphone 17 oder samsung galaxy s26 — was ist besser"Produktvergleich: Tabellendarstellung und Quellenmischung
K8-01navigational„wie erreiche ich den kundenservice der telekom"Markenseiten gegen Verzeichnisse — landet der Nutzer beim Anbieter oder bei Dritten
K9-01Gesundheit (YMYL)„ibuprofen oder paracetamol bei kopfschmerzen"Strengere Quellenwahl bei heiklen Themen
K9-02Gesundheit (YMYL)„ab wann ist blutdruck gefährlich hoch"Grenzwertfrage zur Gesundheit: Warnhinweise und Moderationsschwellen
K10-01Finanzen (YMYL)„lohnt sich ein etf sparplan aktuell noch"Dieselbe Frage für Geldthemen
K11-01Bildsuche„zeig mir bilder von der allianz arena bei nacht"Wann der Bildpfad greift
K11-02Bildsuche„wie sieht ein zeckenbiss mit wanderröte aus"Bildsuche bei einem Gesundheitsthema: greifen dort andere Regeln
K12-01Longtail / Gespräch„mein sauerteigbrot geht nicht auf obwohl der starter aktiv ist, was mache ich falsch"Foren als Quelle, Umformulierung langer Fragen
K12-02Longtail / Gespräch„unser hund bellt jedes mal wenn der postbote kommt, wie gewöhnen wir ihm das ab"Alltagsfrage ohne Suchmaschinen-Entsprechung: sucht ChatGPT trotzdem
K13-01Folgefrage„und welcher von denen hat auch samstags offen"Wie Kontext aus dem vorigen Turn wirkt

Grenze der Messung.

Sechs der dreizehn Suchoperationen — click, find, screen, availability, genui_search, genui_run — hatte der Fragensatz bis zum 21. August 2026 nie ausgelöst. Das war eine Eigenschaft der gestellten Fragen, kein Befund über ChatGPT: gemessen wurden bis dahin nur sieben der 26 Fragen. Ob die übrigen neunzehn diese Operationen erreichen, zeigen die nächsten Messtage.

Was wir prüfen

Acht Größen — jede mit ihrer Bedeutung für Sichtbarkeit

Die Kandidatenliste steht fest, bevor deine Seite kontaktiert wird

bestätigtQ1+Q6

ChatGPT formuliert seine Suchanfragen, bevor der erste Treffer eintrifft. In diesen Anfragen stehen bereits Markennamen, die niemand getippt hat. Sie können nicht aus dem Abruf stammen — sie kommen aus dem Modell.

Belegt über Zeitstempel in allen acht daraufhin geprüften Läufen: Der Fan-out steht nach 0,4 bis 2,0 Sekunden, der erste Treffer kommt erst nach 1,4 bis 5,6 Sekunden.

// 21.08., „empfiehl mir eine espressomaschine unter 500 euro", Modus Mittel
// Alle vier Anfragen entstanden, bevor irgendetwas abgerufen wurde:
Sage Bambino Plus
DeLonghi Dedica Maestro Plus
Sage Barista Express
DeLonghi La Specialista Arte

Vier konkrete Modellbezeichnungen. Die Frage nannte keine einzige Marke.

Warum das zählt

Das ist die folgenreichste Einsicht dieser Seite. Steht eine Marke nicht in dieser Liste, wird ihre Seite gar nicht erst geprüft — keine technische Verbesserung erreicht sie, weil die Auswahl fällt, bevor der eigene Server kontaktiert wird. Wer dort auftaucht, hat die Markenarbeit hinter sich; was bleibt, ist die Arbeit an der Seite. Prüfen lässt sich das in Minuten: dieselbe Kategoriefrage fünfmal stellen und notieren, welche Namen ChatGPT in seine eigenen Anfragen schreibt.

Sucht ChatGPT überhaupt?

gemessenQ1

Nicht jede Frage löst eine Websuche aus. Bei uns tat es genau eine von fünf nicht — die Evergreen-Frage „warum ist der himmel blau". ChatGPT antwortete aus dem Gedächtnis, ohne eine einzige Quelle abzurufen.

Warum das zählt

Für solche Fragen gibt es keine Zitate zu gewinnen, egal wie gut die eigene Seite ist. Bevor man um Sichtbarkeit kämpft, muss man wissen, ob die Frage überhaupt ins Web führt.

Welche Suchanfragen schreibt ChatGPT?

bestätigtQ1+Q4

Nicht die Nutzerfrage wird gesucht. ChatGPT formuliert eigene Anfragen und fächert sie auf — im Fachjargon Fan-out. Aus der Frage nach Laufschuh-Beratung in München wurde:

business|Munich, Bavaria, Germany|running shoe store;Laufschuhe Beratung;gait analysis
fast|beste Laufläden München Laufanalyse|30
image|Laufgeschäft München Laufschuhe Beratung|30
length|medium

Erste Spalte: die Art der Suche. Dann die Anfrage — mehrere durch Semikolon getrennt. Ortsbezogene Suchen schieben den Ort dazwischen.

Warum das zählt

Diese Zeilen zeigen, mit welchen Begriffen ChatGPT die Kategorie denkt — und welche Marken es bereits kennt, bevor es überhaupt sucht. Wer hier nicht vorkommt, ist nicht im Kandidatenkreis.

Wie alt darf der Inhalt sein?

gemessenQ1

Die Zahl hinter der Anfrage ist ein Zeitraum in Tagen — sie sagt, wie alt ein Treffer höchstens sein darf. Belegt über die volle Bandbreite unserer Fragen:

FrageTageBedeutet
Nachrichten heute1nur von heute
Produktvergleich30letzter Monat
Biografie3650zehn Jahre — praktisch ohne Grenze
Warum das zählt

Die praktisch verwertbarste Zahl der ganzen Messung. Eine Preisseite, die seit über 30 Tagen unverändert ist, konkurriert bei Vergleichsanfragen von außerhalb des Fensters — sie wird gar nicht erst betrachtet.

Welche Domains steuert ChatGPT gezielt an?

gemessenQ1

Das letzte Feld einer Suchzeile kann eine Domain sein — dann sucht ChatGPT ausschließlich dort:

slow|Deutschland wichtigste Nachrichten heute|1|tagesschau.de
fast|Sam Altman biography Y Combinator Loopt|3650|britannica.com
Warum das zählt

Steht die eigene Domain in diesem Feld, kennt ChatGPT die Marke und prüft sie gezielt. Steht sie nie dort, liegt das Problem nicht an den Seiten, sondern daran, dass die Marke gar nicht erst als Kandidat auftaucht.

Gelistet oder gelesen?

gemessenQ1

Ein Treffer in der Ergebnisliste ist etwas anderes als eine geöffnete Seite. open|turn0search23 lädt einen Treffer vollständig. Bei uns geschah das nur bei der Nachrichtenfrage, dort dreimal.

Warum das zählt

Geöffnete Seiten werden deutlich häufiger zitiert als bloß gelistete fremdbelegtQ2. Zwei sehr verschiedene Stufen von Sichtbarkeit, die in keinem Dashboard unterschieden werden.

Aus welchem Index kommen die Treffer?

gemessenQ1

ChatGPT bezieht Treffer aus mehreren Quellen. Welche geliefert hat, verrät der Zuschnitt der Ergebnisse:

MerkmalPipeline APipeline B
Textausriss~202 Zeichen~138 Zeichen
Titelungekürzt, teils über 75 Zeichenum 60 Zeichen
Treffer ohne Ausriss36 %0 %
bei unslokal, Produkt, EntitätNachrichten
Warum das zählt

Verschiedene Pipelines heißen verschiedene Spielregeln. Die Meta-Description wird in der einen ausgewertet, in der anderen ignoriert — wer für die falsche optimiert, optimiert ins Leere.

Antwort oder Widget?

gemessenQ1

Manche Antworten enthalten eingebettete Bausteine statt Fließtext. Beobachtet wurden map_widget bei der lokalen Frage und suggest_automation bei den Nachrichten.

Warum das zählt

In einem Widget gibt es keinen Link zu gewinnen. Wandert eine Fragestellung dorthin ab, verschwindet die Chance auf ein Zitat vollständig — unabhängig davon, wie gut die eigene Seite rankt.

Beleglage

Wie jede Aussage auf dieser Seite einzuordnen ist

In diesem Feld kursiert viel Behauptung. Der Wert dieser Sammlung hängt daran, dass Gemessenes und Gelesenes nie verschwimmen — deshalb trägt jede Aussage eine Marke.

MarkeBedeutet
gemessenQ1 Aus unseren eigenen Rohdaten, mit Datum und Fundort nachvollziehbar
bestätigtQ1+Q4 Zwei unabhängige Quellen zeigen dasselbe
fremdbelegtQ2 Stammt aus einer fremden Quelle, von uns nicht nachgemessen
überholtQ3 War zum Zeitpunkt der Quelle zutreffend, gilt heute nicht mehr
Vermutung Plausibel, aber unbelegt — als solche gekennzeichnet

Die Kürzel benennen die Quelle. Fremdbefunde stehen hier nur, wenn sie gegen die eigenen Rohdaten geprüft wurden — auch dann, wenn die Prüfung sie nicht bestätigt hat. Gerade dann. Die vollständige Einordnung jeder fremden Untersuchung, mit Datum, Modellstand und Abgleich Aussage für Aussage, steht im Quellenregister.

Fallstricke

Was beim Messen leicht danebengeht

Unsichtbare Zeichen

Eingebettete Strukturen im Antworttext sind von Zeichen aus einem privaten Unicode-Bereich umrahmt. Der Text sieht normal aus, ein Suchmuster ohne Toleranz trifft nie:

Position  Zeichen  Codepoint
      -1  (unsichtbar)  U+E200
       0  g        U+0067
     …
       5  (unsichtbar)  U+E202
       6  {        U+007B

Bei unerklärlich leeren Textfeldern zuerst die Zeichencodes prüfen. Dieselbe Technik umgibt auch die Beleg- und Entitätsmarker.

Ein Feld ist selten wirklich weg

Ein Feld, das im Abruf fehlt, kann im Antwortstrom weiterleben — und ebenso zurückkehren. Wer ein Feld für verschwunden hält, sollte erst im Netzwerkmitschnitt nachsehen. Welche Felder wann verschwunden oder zurückgekehrt sind, steht auf der jeweiligen Objektseite (Status „verschwunden seit") und im Changelog — nicht mehr als eigenes Kapitel hier.

Wo alles andere steht

Diese Seite erklärt die Methode. Die Ergebnisse leben woanders.

Was sich Tag für Tag ändert — neue Felder, Endpunkte, Suchmodi, ein Modellwechsel — steht laufend und datiert im Changelog, die vollständigen Feld-Unterschiede eines Tages auf der Tagesansicht. Eine Änderung gilt dort erst als bestätigt, wenn sie zwei Messtage hält.

Was einzelne Objekte bedeuten — jeder Endpunkt, jedes Feld, jeder Suchmodus, jede Kennzahl — steht als eigene Seite im Register, mit Struktur, Wirkung auf die Sichtbarkeit und Änderungshistorie.

Was andere über ChatGPT geschrieben haben und ob es unseren Daten standhält, steht im Quellenregister — jede fremde Untersuchung mit Datum, Modellstand und einem Abgleich Aussage für Aussage: bestätigt, überholt oder nicht prüfbar. Das ersetzt die früheren Kapitel „Überholt" und „Quellen" dieser Seite. Ein Fremdbefund altert, und wo er altert, zeigt der Abgleich es am einzelnen Punkt statt in einem Sammelkapitel.