WissensbasisQuellenMetehan Yesilyurt

Reverse-Engineering the OpenAI's GPT-5 Tokenizer: What 200,000 Tokens Reveal About AEO/GEO

Autor Metehan Yesilyurt Datum 2026-02-13 Modellstand o200k-Vokabular (GPT-5-Tokenizer), statische Analyse — unabhängig vom Modellverhalten Zur Quelle →

Kernaussagen

Yeşilyurt zerlegt das 200.000-Einträge-Vokabular des GPT-5-Tokenizers: Manche Marken existieren als ein einziges Token, andere zerfallen; URLs zerfallen immer; Fließtext ist tokenökonomisch am günstigsten, Tabellen am teuersten; über tausend Token-Slots sind für Tools reserviert. Seine These: Was billig zu tokenisieren ist, ist für das Modell leichter zu verarbeiten und zu reproduzieren.

Warum die Quelle für das Projekt zählt

Als Mechanik-Hypothese hinter zwei eigenen Befunden: Erstens formuliert ChatGPT Fan-out-Queries auch auf deutsche Fragen teils englisch (Anteil englischer Fan-outs) — englischer Text tokenisiert im o200k-Vokabular effizienter, das wäre ein Motiv. Zweitens macht die Einzel-Token-These plausibel, warum bekannte Marken in selbstformulierten Queries so mühelos auftauchen. Beides bleibt Vermutung (conjecture), gehört aber als einzige Mechanik-Erklärung dieser Art ins Register.

Abgleich mit eigenen Daten

Nichts davon ist im Client-Mitschnitt beobachtbar — der Tokenizer arbeitet vor allem, was wir sehen. Die Claims sind darum sämtlich unverifiable, aber extern nachprüfbar (tiktoken) und stehen nicht im Widerspruch zu unseren Daten.

AussageStatusBeleg
Marken wie Google, Amazon, Reddit sind Einzel-Token; OpenAI und ChatGPT zerfallen in mehrerenicht prüfbarTokenizer-Eigenschaft, mit tiktoken unabhängig nachprüfbar — in unserem Messaufbau (HAR-Mitschnitte) aber nicht beobachtbar. Kein Widerspruch zu unseren Daten.
URLs sind nie atomare Tokens, sie zerfallen immer in Fragmentenicht prüfbarGleiche Lage: statische Vokabular-Eigenschaft, außerhalb unseres Messfensters.
Format-Effizienz: Prosa ~5,9 Zeichen je Token, Markdown 4,8, JSON 4,0, Tabellen 2,7nicht prüfbarClientseitig nicht prüfbar; unsere Snippets (202 Zeichen Index, 131–158 Scrape) sagen nichts über Token-Kosten der Quellseite.
Rund 1.075 reservierte Tool-Slots im Vokabular deuten auf geplante Tool-Erweiterungennicht prüfbarVokabular-Beobachtung; unsere Mitschnitte zeigen nur die tatsächlich aktiven Tools.

Verwandt

yesilyurt-rrf wells-2026-02-12