WissensbasisQuellenOlivier de Segonzac (RESONEO)

Inside ChatGPT's retrieval stack: index, cache and live pages

Autor Olivier de Segonzac (RESONEO) Datum 2026-08-17 Modellstand GPT-5.x, Free- und Paid-Accounts, Frankreich, Extension v5.1 Zur Quelle →

Kernaussagen

Segonzac beschreibt die Retrieval-Schicht hinter web.run als drei Stufen: einen eigenen Index (Labrador) mit query-unabhängigen Ausrissen von etwa 200 Zeichen, die an der H1 beginnen und die Meta-Description ignorieren; einen Reading-Cache, der Seiten als Markdown mit 30 Minuten Frische hält und dabei Cache-Control, noindex und JSON-LD ignoriert; und Live-Öffnungen. Geöffnete Seiten werden zu 74 % zitiert, nur gefundene zu 7 %. Free- und Paid-Accounts laufen im Thinking-Modus durch verschiedene Pipelines.

Warum die Quelle für das Projekt zählt

Es ist die detaillierteste Beschreibung dessen, was vom Dokument bei ChatGPT ankommt, und damit die Grundlage für jede Empfehlung an Website-Betreiber. Die Teile, die der Client nicht sieht (Cache, Größenlimit), können wir nicht prüfen; die Teile, die er sieht (Ausriss-Länge, Titel), prüfen wir täglich.

Abgleich mit eigenen Daten

Die 200-Zeichen-Signatur des Index ist an unseren Daten stabil belegt und der Grund, warum search.result_signature die Pipeline erkennen kann, obwohl result_source fehlt. Die Kohorten-Aussage zu Paid-Thinking passt nicht zu unserem Plus-Account, bei dem Thinking-Läufe überwiegend die Index-Signatur zeigen. Das ist entweder ein Unterschied zwischen Frankreich und Deutschland, zwischen Kohorten, oder eine Änderung nach dem 17.08.; ohne zweiten Account nicht entscheidbar.

AussageStatusBeleg
Drei Schichten: Labrador-Index, Reading-Cache (Markdown, 30 min), Live-Opennicht prüfbarAus dem Client nicht sichtbar; wir sehen nur die Treffer-Formatierung und open-Aufrufe.
Index-Snippets ~200 Zeichen, query-unabhängig, an der H1, Meta-Description ignoriertbestätigtSnippet-Median 202 Zeichen bei Lokal-, Produkt-, Entitäts- und Vergleichsfragen an drei Messtagen (search.result_signature).
Geöffnete Seiten zu 74 % zitiert, nur gefundene zu 7 %nicht prüfbarIm Standardmodus kein open beobachtet; Thinking-Stichprobe zu klein.
Free-Thinking 74,7 % Labrador, Paid-Thinking 75,3 % Google-ScrapeüberholtPlus-Account Thinking bei uns: K1-01, K2-01, K6-01 thinking Median 202 (Index), nur K5-01 thinking am 21.08. 158 (Scrape). Entweder Kohorte oder Änderung nach dem 17.08.
Seiten über 4 MB werden verworfen, JSON-LD gestrippt, noindex ignoriertnicht prüfbarServerseitig, nicht messbar.

Verwandt

segonzac-2026-05-14 segonzac-2026-02-01