Warum das zählt
Der Anlass — an einem konkreten Beispiel
Zwischen dem 16. und 20. August hat OpenAI die Sprache ausgetauscht, in der ChatGPT seine Websuchen formuliert. Am 21. August wechselte zusätzlich der Endpunkt, über den Konversationen abgerufen werden — samt Antwortformat. gemessen│Q1
Beides stand in keinem Changelog. Wer nicht täglich misst, merkt so etwas erst, wenn die eigenen Zahlen einbrechen — und weiß dann nicht, woran es lag.
Für wen diese Seite ist.
Für alle, die verstehen wollen, wie Inhalte in ChatGPT-Antworten gelangen. Es hilft, SEO zu kennen; Kenntnisse über ChatGPTs Innenleben werden nicht vorausgesetzt. Fachbegriffe werden erklärt, wo sie zum ersten Mal auftauchen.
Versuchsaufbau
Jede Entscheidung mit ihrer Begründung
Eine Messreihe taugt nur so viel wie ihre Konstanten. Was hier festgelegt ist und warum:
| Was | Wie | Warum so |
|---|---|---|
| Konto | dedizierter ChatGPT-Plus-Zugang | Ein persönliches Konto würde die Messung durch Verlauf und Personalisierung verfälschen |
| Erinnerung | aus, keine eigenen Anweisungen | Sonst misst man das Konto, nicht die Pipeline |
| Zugang | echter Browser, echte Oberfläche | Nicht die API. Dieselbe Frage liefert dort nachweislich andere Quellen — die API bildet das Produkt nicht ab |
| Sprache und Ort | Deutsch, Deutschland | Ergebnisse hängen von beidem ab; eine Messreihe muss beides festhalten |
| Fragen | 26, eingefroren | Ändert man die Frage, weiß man nicht mehr, ob sich die Frage oder ChatGPT geändert hat |
| Antwortmodi | „Sofort" und „Mittel" | Beide greifen auf unterschiedliche Suchkorpora zu — ein Modus zeigt die halbe Wahrheit |
| Rhythmus | einmal täglich, feste Zeit ± Zufallsversatz | Vergleichbarkeit — der Versatz vermeidet ein Uhrwerk-Muster |
| Konversationen | jede Frage in einem frischen Chat | Kontext aus einem vorigen Turn würde die Suchentscheidung beeinflussen |
Was wir mitschneiden
- Das Gesprächsobjekt — was ChatGPT intern über die Antwort speichert: welche Suchen es gefahren hat, welche Treffer zurückkamen, welche Quellen es zitiert.
- Den Netzwerkverkehr — was der Browser tatsächlich sendet und empfängt, einschließlich der Dinge, die in der Oberfläche nie erscheinen.
- Den Startzustand — welche Funktionen für dieses Konto freigeschaltet sind, welche Modelle zur Wahl stehen, welche Testgruppen-Schalter gesetzt sind.
Ein Messtag ist eine Momentaufnahme.
Einzelne Zahlen auf dieser Seite sagen wenig. Ob eine Beobachtung eine Änderung ist oder normale Streuung, zeigt erst die Wiederholung — ein Befund gilt hier deshalb erst als bestätigt, wenn er an zwei Tagen in Folge auftritt. Aktuell liegen zwei Messtage vor.
Die Fragen
26 eingefrorene Prompts über 14 Kategorien
Der Fragensatz ist so gebaut, dass jede Kategorie eine andere Eigenschaft der Pipeline auf die Probe stellt. Sieben davon laufen derzeit täglich; der Rest ist vorbereitet und wird zugeschaltet, sobald die Messreihe stabil läuft.
Täglich gemessen
| ID | Kategorie | Wortlaut | Prüft |
|---|---|---|---|
| K1-01 | lokal / Orte | „ich möchte laufschuhe kaufen. wo gibt es in münchen eine gute beratung" | Ortsbezug, lokale Einträge, Kartenwidget |
| K2-01 | Produkt / Shopping | „empfiehl mir eine espressomaschine unter 500 euro" | Produktkatalog, Händler, Preisangaben |
| K4-01 | Evergreen-Wissen | „warum ist der himmel blau" | Sucht ChatGPT überhaupt? — der Gegenanker |
| K5-01 | aktuelle Nachrichten | „was sind die wichtigsten nachrichten heute in deutschland" | Frischefenster, Nachrichtenquellen, parallele Anfragen |
| K6-01 | Entitäten | „wer ist der ceo von openai und was hat er vorher gemacht" | Entitätserkennung, Quellenwahl bei Fakten |
| K14-01 | Introspektion | „welche werkzeuge stehen dir in diesem chat zur verfügung? …" | Was das Modell über seine eigenen Werkzeuge aussagt |
| K14-02 | Introspektion | „beschreibe das web-werkzeug: welche operationen kennt es …" | Operationsliste und Aufrufsyntax |
Vorbereitet
| Kategorie | Beispiel | Prüft |
|---|---|---|
| Händler / transaktional | „wo kann ich nike pegasus 41 am günstigsten kaufen" | Preisvergleich, Händlerauswahl |
| Vergleich | „chatgpt plus oder perplexity pro für seo recherche" | Wie ChatGPT über Wettbewerber spricht |
| navigational | „wie erreiche ich den kundenservice der telekom" | Markenseiten gegen Verzeichnisse |
| Gesundheit (YMYL) | „ibuprofen oder paracetamol bei kopfschmerzen" | Strengere Quellenwahl bei heiklen Themen |
| Finanzen (YMYL) | „lohnt sich ein etf sparplan aktuell noch" | dieselbe Frage für Geldthemen |
| Bildsuche | „zeig mir bilder von der allianz arena bei nacht" | Wann der Bildpfad greift |
| Longtail / Gespräch | „mein sauerteigbrot geht nicht auf obwohl der starter aktiv ist …" | Foren als Quelle, Umformulierung langer Fragen |
| Folgefrage | „und welcher von denen hat auch samstags offen" | Wie Kontext aus dem vorigen Turn wirkt |
Grenze der Messung.
Sechs der dreizehn Suchoperationen — click, find,
screen, availability, genui_search,
genui_run — hat unser Fragensatz nie ausgelöst. Das ist eine Eigenschaft
der gestellten Fragen, kein Befund über ChatGPT.
Was wir prüfen
Acht Größen — jede mit ihrer Bedeutung für Sichtbarkeit
Die Kandidatenliste steht fest, bevor deine Seite kontaktiert wird
bestätigt│Q1+Q6ChatGPT formuliert seine Suchanfragen, bevor der erste Treffer eintrifft. In diesen Anfragen stehen bereits Markennamen, die niemand getippt hat. Sie können nicht aus dem Abruf stammen — sie kommen aus dem Modell.
Belegt über Zeitstempel in allen acht daraufhin geprüften Läufen: Der Fan-out steht nach 0,4 bis 2,0 Sekunden, der erste Treffer kommt erst nach 1,4 bis 5,6 Sekunden.
// 21.08., „empfiehl mir eine espressomaschine unter 500 euro", Modus Mittel // Alle vier Anfragen entstanden, bevor irgendetwas abgerufen wurde: Sage Bambino Plus DeLonghi Dedica Maestro Plus Sage Barista Express DeLonghi La Specialista Arte
Vier konkrete Modellbezeichnungen. Die Frage nannte keine einzige Marke.
Das ist die folgenreichste Einsicht dieser Seite. Steht eine Marke nicht in dieser Liste, wird ihre Seite gar nicht erst geprüft — keine technische Verbesserung erreicht sie, weil die Auswahl fällt, bevor der eigene Server kontaktiert wird. Wer dort auftaucht, hat die Markenarbeit hinter sich; was bleibt, ist die Arbeit an der Seite. Prüfen lässt sich das in Minuten: dieselbe Kategoriefrage fünfmal stellen und notieren, welche Namen ChatGPT in seine eigenen Anfragen schreibt.
Sucht ChatGPT überhaupt?
gemessen│Q1Nicht jede Frage löst eine Websuche aus. Bei uns tat es genau eine von fünf nicht — die Evergreen-Frage „warum ist der himmel blau". ChatGPT antwortete aus dem Gedächtnis, ohne eine einzige Quelle abzurufen.
Für solche Fragen gibt es keine Zitate zu gewinnen, egal wie gut die eigene Seite ist. Bevor man um Sichtbarkeit kämpft, muss man wissen, ob die Frage überhaupt ins Web führt.
Welche Suchanfragen schreibt ChatGPT?
bestätigt│Q1+Q4Nicht die Nutzerfrage wird gesucht. ChatGPT formuliert eigene Anfragen und fächert sie auf — im Fachjargon Fan-out. Aus der Frage nach Laufschuh-Beratung in München wurde:
business|Munich, Bavaria, Germany|running shoe store;Laufschuhe Beratung;gait analysis fast|beste Laufläden München Laufanalyse|30 image|Laufgeschäft München Laufschuhe Beratung|30 length|medium
Erste Spalte: die Art der Suche. Dann die Anfrage — mehrere durch Semikolon getrennt. Ortsbezogene Suchen schieben den Ort dazwischen.
Diese Zeilen zeigen, mit welchen Begriffen ChatGPT die Kategorie denkt — und welche Marken es bereits kennt, bevor es überhaupt sucht. Wer hier nicht vorkommt, ist nicht im Kandidatenkreis.
Wie alt darf der Inhalt sein?
gemessen│Q1Die Zahl hinter der Anfrage ist ein Frischefenster in Tagen. Belegt über die volle Bandbreite unserer Fragen:
| Frage | Fenster | Bedeutet |
|---|---|---|
| Nachrichten heute | 1 | nur von heute |
| Produktvergleich | 30 | letzter Monat |
| Biografie | 3650 | zehn Jahre — praktisch ohne Grenze |
Die praktisch verwertbarste Zahl der ganzen Messung. Eine Preisseite, die seit über 30 Tagen unverändert ist, konkurriert bei Vergleichsanfragen von außerhalb des Fensters — sie wird gar nicht erst betrachtet.
Welche Domains steuert ChatGPT gezielt an?
gemessen│Q1Das letzte Feld einer Suchzeile kann eine Domain sein — dann sucht ChatGPT ausschließlich dort:
slow|Deutschland wichtigste Nachrichten heute|1|tagesschau.de fast|Sam Altman biography Y Combinator Loopt|3650|britannica.com
Steht die eigene Domain in diesem Feld, kennt ChatGPT die Marke und prüft sie gezielt. Steht sie nie dort, liegt das Problem nicht an den Seiten, sondern daran, dass die Marke gar nicht erst als Kandidat auftaucht.
Gelistet oder gelesen?
gemessen│Q1
Ein Treffer in der Ergebnisliste ist etwas anderes als eine geöffnete Seite.
open|turn0search23 lädt einen Treffer vollständig. Bei uns geschah das
nur bei der Nachrichtenfrage, dort dreimal.
Geöffnete Seiten werden deutlich häufiger zitiert als bloß gelistete fremdbelegt│Q2. Zwei sehr verschiedene Stufen von Sichtbarkeit, die in keinem Dashboard unterschieden werden.
Aus welchem Index kommen die Treffer?
gemessen│Q1ChatGPT bezieht Treffer aus mehreren Quellen. Welche geliefert hat, verrät der Zuschnitt der Ergebnisse:
| Merkmal | Pipeline A | Pipeline B |
|---|---|---|
| Textausriss | ~202 Zeichen | ~138 Zeichen |
| Titel | ungekürzt, teils über 75 Zeichen | um 60 Zeichen |
| Treffer ohne Ausriss | 36 % | 0 % |
| bei uns | lokal, Produkt, Entität | Nachrichten |
Verschiedene Pipelines heißen verschiedene Spielregeln. Die Meta-Description wird in der einen ausgewertet, in der anderen ignoriert — wer für die falsche optimiert, optimiert ins Leere.
Antwort oder Widget?
gemessen│Q1
Manche Antworten enthalten eingebettete Bausteine statt Fließtext. Beobachtet wurden
map_widget bei der lokalen Frage und suggest_automation bei
den Nachrichten.
In einem Widget gibt es keinen Link zu gewinnen. Wandert eine Fragestellung dorthin ab, verschwindet die Chance auf ein Zitat vollständig — unabhängig davon, wie gut die eigene Seite rankt.
Was sich ändert
Erster Vergleich zweier Messtage: 20. → 21. August
124 eigenständige Befunde. Die meisten traten in allen zehn vergleichbaren Läufen zugleich auf und in beiden Antwortmodi — sie betreffen also die Plattform, nicht einzelne Fragen. gemessen│Q1
Der Konversationsabruf wurde umgestellt
| 20. August | 21. August | |
|---|---|---|
| Pfad | /backend-api/conversation/{id} | /backend-api/conversations/{id}?… |
| Form | Baum mit Eltern-Kind-Bezügen | flache Liste in Reihenfolge |
| Umfang | vollständig | seitenweise, 10 Turns je Abruf |
Gefunden wurde die Änderung, weil die Messung daran zerbrach: Der Mitschnitt horchte auf den alten Pfad, alle vierzehn Läufe blieben ohne Datei. Seitdem wird das Format als eigener Messwert geführt — ein Wechsel meldet sich künftig, statt die Erfassung zu stoppen.
Fünf neue Metadaten-Felder
search_model_queries // am Vortag nur im Antwortstrom, jetzt wieder im Abruf map_search_model_queries // neu: Anfragen des Karten-Pfads story_events rebase_developer_message is_visually_hidden_from_conversation
Das erste Feld liefert Anfragen, die auch aus den Suchbefehlen stammen — dieselbe Anfrage erschien dadurch doppelt. Gezählt wird seitdem der Fan-out, also die Zahl unterschiedlicher Anfragen.
Endpunkte kommen und gehen
| Endpunkt | Bemerkung | |
|---|---|---|
| neu | /backend-api/beacons/event | — |
| neu | /backend-api/settings/announcement_viewed | führt hasSeenM3mNux |
| neu | /backend-api/search/product_carousel_descriptions | nur bei der Produktfrage |
| weg | /backend-api/aip/connectors/list_accessible | lieferte Konnektoren und App-Vorlagen |
Kleinere Verschiebungen: dil erscheint neu als Ereignistyp im
Antwortstrom, beim Produkt-Prompt löst products den Typ
product_entity ab, der Nachrichten-Prompt wechselte den Suchmodus von
open zu slow, und bei einer Frage fiel der Textausriss von
202 auf 161 Zeichen — dem Zuschnitt nach ein Wechsel der liefernden Pipeline.
Zwei Messtage sind keine Zeitreihe.
Ob diese Verschiebungen Rollouts sind oder normale Streuung, zeigt erst die Wiederholung. Eine Tagesansicht mit Verlauf entsteht, sobald genügend Messtage vorliegen.
Beleglage
Wie jede Aussage auf dieser Seite einzuordnen ist
In diesem Feld kursiert viel Behauptung. Der Wert dieser Sammlung hängt daran, dass Gemessenes und Gelesenes nie verschwimmen — deshalb trägt jede Aussage eine Marke.
| Marke | Bedeutet |
|---|---|
| gemessen│Q1 | Aus unseren eigenen Rohdaten, mit Datum und Fundort nachvollziehbar |
| bestätigt│Q1+Q4 | Zwei unabhängige Quellen zeigen dasselbe |
| fremdbelegt│Q2 | Stammt aus einer fremden Quelle, von uns nicht nachgemessen |
| überholt│Q3 | War zum Zeitpunkt der Quelle zutreffend, gilt heute nicht mehr |
| Vermutung | Plausibel, aber unbelegt — als solche gekennzeichnet |
Die Kürzel verweisen auf die Quellenliste. Fremdbefunde stehen hier nur, wenn sie gegen die eigenen Rohdaten geprüft wurden — auch dann, wenn die Prüfung sie nicht bestätigt hat. Gerade dann.
Überholt
Beschreibungen, die einmal stimmten — und was heute gilt
Eine ausführliche externe Untersuchung fremdbelegt│Q3 beschreibt die Modellgenerationen 5.3 und 5.4. Gemessen wird hier 5.6. Mehrere Aussagen treffen auf diesen Stand nicht mehr zu:
| Beschrieben | Heute gemessen |
|---|---|
| Suchbefehle als strukturiertes JSON | zeilenweise Befehle mit Trennstrichen, in beiden Antwortmodi |
| eigener Umschreibe-Schritt bei Produktfragen | nicht auffindbar |
| Google-Kennzeichnung in Produkt-Links | nicht auffindbar |
Operationen search_query, product_query | heißen fast, slow, business, product |
| Verhältnis Treffer zu Domains stabil bei 1,26 | 1,78 bis 21,75 — stark von der Frage abhängig |
Anfragen liegen unter search_queries (umbenannt Anfang August) fremdbelegt│Q6 | bei uns durchgehend search_model_queries — der alte Name |
| Antworten laufen über eine dauerhafte WebSocket-Verbindung fremdbelegt│Q6 | kein einziger WebSocket im Verkehr — alles über gewöhnliche Abrufe |
Ein Klassifikator turn_use_case ordnet jede Frage vorab ein fremdbelegt│Q6 | Feld in unseren Daten nicht vorhanden |
Vorauswahl über einen auto-Router, Modelle 5.3 und 5.5 fremdbelegt│Q6 | bei uns gpt-5-6 und gpt-5-6-thinking, Vorgabe ist die Denkvariante |
Das ist kein Vorwurf an die Quelle.
Die Beschreibung war zu ihrem Zeitpunkt zutreffend. Zwischen dem 16. und 20. August wurde die Befehlssprache ausgetauscht fremdbelegt│Q5 — eine Beschreibung von vorher ist damit überholt, nicht falsch.
Genau deshalb steht dieser Abschnitt hier: Wer eine fremde Beschreibung übernimmt, ohne sie gegen eigene Daten zu prüfen, baut auf einem Stand, den es vielleicht nicht mehr gibt. Hätten wir unseren Auswerter auf JSON umgestellt, hätte er ab dem nächsten Lauf nichts mehr gefunden.
Zutreffend aus derselben Quelle: die eingebetteten Widgets, die Verwendung von Domain-Beschränkungen und die Messbarkeit der Domain-Konzentration.
Chronik
Felder, die verschwunden sind — und wie wir sie ersetzt haben
Für alle, die tiefer einsteigen: Der ursprüngliche Auswerter las Felder, die es nicht mehr gibt. Die Läufe meldeten trotzdem Erfolg, die Auswertung blieb still halbleer. Das ist die teuerste Fehlerart in diesem Projekt.
| Erwartet | Realität | Ersatz |
|---|---|---|
| sonic_classification_result | weg — übrig blieb eine undurchsichtige Kennung | Modellkennung, ob gesucht wurde, Art der Suche |
| search_model_queries | am 20.08. nur im Antwortstrom, am 21.08. wieder im Abruf | Auswertung der Suchbefehle, beide Quellen zusammengeführt |
| entry.source | existiert nicht — Einträge tragen eine Zuschreibung | Domain der Trefferguppe plus Zuschreibung |
| Entitäten als Textmarker | keine Textmarker mehr | eigener Verweistyp im Antwortobjekt |
| result_source | im Juli 2026 über Nacht entfernt fremdbelegt│Q2 | Zuschnitt der Treffer als Näherung |
Die Lehre steckt in Zeile zwei: Ein Feld, das im Abruf fehlt, kann im Antwortstrom weiterleben — und ebenso zurückkehren. Wer ein Feld für verschwunden hält, sollte erst im Netzwerkmitschnitt nachsehen.
Unsichtbare Zeichen
Eingebettete Strukturen im Antworttext sind von Zeichen aus einem privaten Unicode-Bereich umrahmt. Der Text sieht normal aus, ein Suchmuster ohne Toleranz trifft nie:
Position Zeichen Codepoint
-1 (unsichtbar) U+E200
0 g U+0067
…
5 (unsichtbar) U+E202
6 { U+007B
Bei unerklärlich leeren Textfeldern zuerst die Zeichencodes prüfen. Dieselbe Technik umgibt auch die Beleg- und Entitätsmarker.
Quellen
Worauf sich die Belege beziehen
- Q1 · Eigene Messung Läufe vom 20. und 21. August 2026 — 24 Durchgänge in zwei Antwortmodi.
- Q2 · RESONEO / Search Engine Land Untersuchung zu ChatGPTs Zitier-Mechanik — Olivier de Segonzac.
- Q3 · RESONEO / Search Engine Land Untersuchung zu Seitenabruf und Quellenauswahl, Generationen 5.3 und 5.4.
- Q4 · Introspektion Antworten des Modells auf Fragen nach seinen eigenen Werkzeugen.
- Q6 · Suganthan Mohanadasan Dreiteilige Netzwerk-Analyse mit laufendem Änderungsprotokoll, Juni bis August 2026.
- Q5 · Externe Datierung des Sprachwechsels Datiert den Austausch der Befehlssyntax auf den 16. bis 20. August 2026.