Wissensbasis›Quellen›Metehan Yesilyurt
Yeşilyurt zerlegt das 200.000-Einträge-Vokabular des GPT-5-Tokenizers: Manche Marken existieren als ein einziges Token, andere zerfallen; URLs zerfallen immer; Fließtext ist tokenökonomisch am günstigsten, Tabellen am teuersten; über tausend Token-Slots sind für Tools reserviert. Seine These: Was billig zu tokenisieren ist, ist für das Modell leichter zu verarbeiten und zu reproduzieren.
Als Mechanik-Hypothese hinter zwei eigenen Befunden: Erstens formuliert ChatGPT Fan-out-Queries auch auf deutsche Fragen teils englisch (Anteil englischer Fan-outs) — englischer Text tokenisiert im o200k-Vokabular effizienter, das wäre ein Motiv. Zweitens macht die Einzel-Token-These plausibel, warum bekannte Marken in selbstformulierten Queries so mühelos auftauchen. Beides bleibt Vermutung (conjecture), gehört aber als einzige Mechanik-Erklärung dieser Art ins Register.
Nichts davon ist im Client-Mitschnitt beobachtbar — der Tokenizer arbeitet vor allem, was wir sehen. Die Claims sind darum sämtlich unverifiable, aber extern nachprüfbar (tiktoken) und stehen nicht im Widerspruch zu unseren Daten.
| Aussage | Status | Beleg |
|---|---|---|
| Marken wie Google, Amazon, Reddit sind Einzel-Token; OpenAI und ChatGPT zerfallen in mehrere | nicht prüfbar | Tokenizer-Eigenschaft, mit tiktoken unabhängig nachprüfbar — in unserem Messaufbau (HAR-Mitschnitte) aber nicht beobachtbar. Kein Widerspruch zu unseren Daten. |
| URLs sind nie atomare Tokens, sie zerfallen immer in Fragmente | nicht prüfbar | Gleiche Lage: statische Vokabular-Eigenschaft, außerhalb unseres Messfensters. |
| Format-Effizienz: Prosa ~5,9 Zeichen je Token, Markdown 4,8, JSON 4,0, Tabellen 2,7 | nicht prüfbar | Clientseitig nicht prüfbar; unsere Snippets (202 Zeichen Index, 131–158 Scrape) sagen nichts über Token-Kosten der Quellseite. |
| Rund 1.075 reservierte Tool-Slots im Vokabular deuten auf geplante Tool-Erweiterungen | nicht prüfbar | Vokabular-Beobachtung; unsere Mitschnitte zeigen nur die tatsächlich aktiven Tools. |