Tutorial
Was ist ein 1M Token Kontextfenster? GPT, Claude und Gemini im Vergleich 2026
„1M Token“ ist kein Synonym für den klügeren Chat. Es ist das Budget, das ein Modell in einer Anfrage sehen kann. Ein größeres Budget fasst ein Repo, ein Handbuch oder eine lange Aufnahme. Max Output, Preisstufen und echter Recall wachsen nicht automatisch mit dem Aufkleber.
2026 steht auf fast jeder Flaggschiff-Modellkarte 1M Token. Marketing sagt „das ganze Buch einlesen“ oder „das ganze Repo reinziehen“. Im Review bleiben andere Zahlen hängen: was der Call kostet, ob die Antwort abschneidet, und ob das Modell die mittleren 400K noch kennt. Dieser Text behandelt 1M Token als Ingenieurgrenze — Kapazität des Kontextfensters, kein Zeugnis für Verständnis. Danach können Sie schätzen, wie viele Token Ihr Material braucht, GPT, Claude und Gemini nach Fenster, Output und Aufpreis vergleichen, und entscheiden, welches JSON ins Fenster gehört und welches zuerst im Browser geprüft wird.
Was 1M Token bedeutet: erst die Einheit
Ein Token ist die kleinste Einheit, mit der das Modell Text liest, schreibt und abrechnet. Es ist kein Zeichen und kein Wort. Ein gängiges englisches Wort ist oft etwas mehr als ein Token; Chinesisch, Code, JSON-Keys, Base64 und Einrückung rechnen anders. Dieselbe OpenAPI-Datei zählt je Anbieter und Tokenizer-Version anders. „1M Token“ ist zuerst wie viele Slots dieses Modell in dieser Anfrage zulässt — nicht „eine Million chinesische Schriftzeichen“ und nicht „eine Million englische Wörter“.
| Fenstergröße | Grobe Intuition (Größenordnung, kein Versprechen) |
|---|---|
| 1 Token | Etwa 0.7–1 englisches Wort; oft 1–2 chinesische Schriftzeichen; Code und JSON fragmentieren stärker |
| 8K–32K | Ein langer Artikel, eine API-Notiz, ein kurzes Gespräch |
| 128K–200K | Ein großer Teil eines Buchs, oder ein mittelgroßes Repo plus ein paar Agent-Turns |
| 1M (etwa 1.00–1.05 Millionen) | Ein dickes Handbuch + ein Multi-File-Repo + lange Historie; neuere Claude-Tokenizer packen oft weniger Rohtext in dasselbe 1M |
Das Kontextfenster ist ein gemeinsames Budget für Input + Output + Reasoning-/Thinking-Token (falls separat gezählt). System-Prompts, Tool-Schemas, Retrieval-Snippets, Chat-Historie und die gerade entstehende Antwort schöpfen aus demselben Brunnen. Ein 1M-Fenster heißt nicht, dass Sie ein 1M-Token-Repo laden und danach einen 128K-Report ausgeben können — Output zählt gegen das Fenster, und jeder Anbieter setzt zusätzlich ein eigenes Max Output.
Behandeln Sie 1M wie Festplattenkapazität: die Slots existieren; die Seite in der Mitte ist nicht gleich zuverlässig lesbar. Eine Nadel im Heuhaufen zu finden ist nicht dasselbe wie Multi-Hop-Reasoning, Dateivergleich oder ein fehlendes Feld in langem JSON zu bemerken. Erst fragen: „was muss gleichzeitig sichtbar sein“, dann: „welche stabile Form muss rauskommen“.
Wozu ein langes Kontextfenster wirklich taugt
Der Sprung von 128K auf 1M ändert, ob Sie zuerst noch zerlegen müssen. Material, das früher Retrieval oder eine Zusammenfassung brauchte, kann jetzt als ein Pack hinein. Die Jobs, die sich wirklich lohnen, sehen meist so aus:
- Ein ganzes Repo oder der größte Teil: eine Call-Chain über Dateien verfolgen, zwei Implementierungen vergleichen, Interface und Fixtures in einer Anfrage sehen.
- Lange Dokumente und Verträge: Policy-Handbücher, Audit-Arbeitspapiere, PDFs mit mehreren Anhängen. Die Frage braucht beide Enden des Texts, nicht einen Keyword-Treffer.
- Große multimodale Packs: APIs der Gemini-Klasse können Text, Bilder, Audio, Video und PDFs in einem Fenster zählen. Stunden Audio oder ein langes Video müssen nicht zuerst geschnitten werden.
- Lange Agent-Traces: Tool-Defs, viele Tool-Results und gescheiterte Retries bleiben im Fenster, damit der nächste Hop die volle Beobachtung sieht. Zur Schleife selbst siehe
- Vergleichen und extrahieren: zwei OpenAPI-Versionen, zwei Export-JSONs und ein Schema in dieselbe Anfrage für eine Diff-taugliche Lesung, dann strukturierte Deltas per Structured Output.
Diese Jobs teilen eine Eigenschaft: die Antwort hängt daran, mehrere Artefakte gleichzeitig zu sehen. Ist die Aufgabe „einen Satz in hunderttausend Seiten finden“, ist Retrieval meist billiger und stabiler. Ein 1M-Fenster reduziert schlechte Chunk-Grenzen; es ersetzt keine Informationsarchitektur.
Ein überschätztes Muster: ganze Site-Logs, einen rohen Datenbank-Dump oder unbereinigte Produktions-JSON in den Prompt kleben. Das Fenster ist groß; Leak-Risiko und Rechnung auch. Nur Material, das die Maschine verlassen darf, gehört ins Fenster. Secrets lokal streichen, kaputtes JSON reparieren, dann über „in einem Schuss füttern“ reden.
Nennfenster ≠ wirksames Fenster: Input, Output, Preis
Das 1M auf der Produktseite ist eine Annahmegrenze: darüber wird die Anfrage abgelehnt oder abgeschnitten. Es heißt nicht „Qualität bei 1M gleicht Qualität bei 8K“. In RULER-artigen Evals liegt die wirksame Länge oft bei etwa der Hälfte des Nennwerts; in Produktion rutscht Cross-File-Arbeit oft nach 200K–500K, und Anweisungen in der Mitte des Prompts fallen weg. Das beworbene Fenster ist eine harte Decke. Ihr eigenes Regressionsset ist das wirksame Fenster.
Die zweite übersehene Zahl ist Max Output. GPT-5.6 Sol / Terra und Claude-Flaggschiffe erlauben etwa 128K in einer Sync-Anfrage. Gemini 3.1 Pro dokumentiert 65,536, und der Default maxOutputTokens liegt oft niedriger — vergessen Sie, ihn hochzusetzen, und die Antwort wird still abgeschnitten. „Handbuch lesen, dann eine gleich lange Spezifikation schreiben“ passt ins Fenster und sprengt trotzdem die Output-Decke. Das Budget unten behandelt Output und Puffer als Erstklasse, nicht als Rest:
{
"window": 1050000,
"budget": {
"system": 2400,
"tools": 1800,
"repoPack": 420000,
"docs": 180000,
"history": 80000,
"reservedOutput": 128000,
"headroom": 238800
},
"rule": "never fill to the sticker; reserve output plus 20 percent headroom"
}
Die dritte Zahl ist Geld. OpenAI schreibt für GPT-5.6 Sol / Terra: überschreitet der Input etwa 272K Token, wird die ganze Anfrage mit 2× Input und 1.5× Output abgerechnet. Gemini Long Context hat oft eine weitere Aufpreisstufe (Docs ziehen die Linie meist über 128K oder 200K — aktuelle Preisliste prüfen). Claude Sonnet 5 Docs setzen 1M als Default-Fenster zum Standardtarif, ohne eigenen „Long Context einschalten“-Schalter — ein feinerer Tokenizer macht aus demselben Text aber mehr Token, der effektive Preis steigt trotzdem. Prompt-Cache hilft bei wiederholten Prefixes; er hilft nicht bei einem Pack, das sich bei jedem Call ändert.
Vergleich 2026: GPT, Claude, Gemini
Die Tabelle folgt öffentlichen Modellkarten vom September 2026 für die Flaggschiff-Stufen. Sie stopft nicht jeden Snapshot in eine Zelle. Zahlen bewegen sich; die Live-Docs gewinnen. Die Achsen, die eine Wahl wirklich teilen, sind Fenster, Output, Aufpreis und Modalität.
| Achse | GPT-5.6 Sol / Terra | Claude Sonnet 5 / Opus 5 | Gemini 3.1 Pro |
|---|---|---|---|
| Kontextfenster | 1,050,000 | 1,000,000 (Haiku 4.5 bleibt bei 200K) | 1,048,576 |
| Max Output | 128,000 | 128,000 (höhere Batch-Stufe existiert) | 65,536 (Defaults oft niedriger) |
| Long-Context-Abrechnung | Input >272K: ganze Anfrage 2× Input / 1.5× Output | Docs: 1M ist Default, keine eigene Aufpreisstufe; neuer Tokenizer feiner | Häufig Aufpreis über 128K oder 200K — offizielle Liste prüfen |
| Input-Modalitäten | Text, Bild | Text, Bild (PDF über Plattformfunktionen) | Text, Bild, Audio, Video, PDF |
| Fallstricke derselben Serie | Luna liegt bei etwa 400K — den Alias nicht als dieselbe Kapazität behandeln | Dasselbe 1M fasst nach dem Tokenizer-Wechsel weniger Rohtext; neu zählen | Breiteste Multimodalität; kürzere Output-Decke — Generierung zuerst budgetieren |
| Passt am besten | Lange Reports, Responses-Toolchains, Jobs mit 128K Output | Reasoning über lange Dokumente, Agent-Schleifen, erst lesen dann antworten | Repo + Audio/Video/PDF in einem Schuss; kurze oder schemaförmige Antworten |
Lesen Sie die Modellkarten, nicht nur Tabellen Dritter. OpenAI nennt auf GPT-5.6 Sol das Fenster 1,050,000, 128K Output und die 272K-Aufpreislinie. Anthropic setzt im Claude Sonnet 5 Überblick 1M / 128K als Default. Google nennt auf Gemini 3.1 Pro Preview 1,048,576 Input und 65,536 Output. Preise und Snapshot-Namen ändern sich; Integrationscode sollte usage-Felder lesen, nicht die Konstanten vom letzten Jahr.
Wählen Sie am Engpass. Müssen Sie fast 100K Token einer Migrationsnotiz oder eines langen JSON-Arrays ausgeben, zählt die Output-Decke mehr als das Fenster — GPT- und Claude-Flaggschiffe sind breiter. Muss eine Anfrage eine Meeting-Aufnahme hören und gleichzeitig ein Design-Deck und ein Repo sehen, sind Geminis Modalitäten ein echter Unterschied, kein Adjektiv. Wenn Sie in 1M Multi-Hop-Edits machen und Anweisungen in der Prompt-Mitte nicht verlieren dürfen, trauen Sie dem Aufkleber nicht — messen Sie wirksamen Recall mit Ihrem eigenen Set „drei Nadeln, zwei Widersprüche“, nicht mit einer einzigen Heuhaufen-Demo.
Alle drei unterstützen Tool Calling und Structured Output; die Hüllfelder unterscheiden sich, und JSON prüfen Sie trotzdem lokal. Gemini trennt „nur JSON“ und „Felder laut Schema“ — siehe Gemini-API-JSON-Anleitung — dieser Artikel wiederholt das SDK nicht.
Wann das Fenster füllen, wann Retrieval
Ein 1M-Fenster schafft RAG nicht ab. Es schiebt die Chunk-Grenze nach hinten. Vier Regeln reichen:
- Die Antwort muss A und B zusammen sehen (zwei Specs, Caller und Callee, Schema und Instanz) → ein Fenster bevorzugen. Nicht jede Seite extra zusammenfassen.
- Die Antwort ist „eine kleine Spanne in einem riesigen Korpus finden“ → zuerst Retrieval, dann Treffer plus Metadaten senden. Zahlen Sie keinen 272K-Aufpreis, nur um eine Suchpipeline zu sparen.
- Das Pack ändert sich bei jeder Anfrage (neuer Diff, neuer Export) → langer Kontext ist teuer. Cachebare Prefixes (System-Prompt, Tool-Liste, stabiles Handbuch) vom volatilen Pack trennen.
- Das Material darf den Browser nicht verlassen (Secrets, Produktions-Userfelder) → ein größeres Fenster ist kein Upload-Grund. Lokal bereinigen, prüfen, eine Stichprobe ziehen — dann entscheiden, ob ein Cloud-Modell es sieht.
Agent-Schleifen fressen ein Fenster schnell: jedes Tool-Result bleibt. Alte Beobachtungen vor maxSteps zusammenfassen; 1M ist kein unendliches Log. Wie die Schleife läuft: Was ist ein AI Agent.
Auch wenn Sie „das ganze Pack“ wählen: packen Sie. Verbrennen Sie 1M nicht an node_modules und minifizierte Bundles. Ein explizites Context Pack ist auditierbar; „Repo reinschieben“ ist es nicht:
{
"pack": "context",
"files": [
{ "path": "openapi.json", "tokens": 12000, "role": "contract" },
{ "path": "schema.ticket.json", "tokens": 400, "role": "outputShape" },
{ "path": "fixture.valid.json", "tokens": 800, "role": "example" }
],
"omit": ["node_modules", "*.lock", "generated/**", "minified bundles"]
}
Das outputShape im Pack muss das Schema sein, das Sie wirklich parsen — nicht die Keys, die das Modell erfindet. Form festnageln: AI Structured Output.
JSON im langen Kontext: zuerst lokal prüfen
Ein langes Fenster vergrößert den Schadensradius schlechter Inputs. Ein abgeschnittener Export, ein Tool-Beleg mit explodierenden Extra-Feldern, zwei Schemas mit gleichem Namen und verschiedener Bedeutung — nach 400K Token finden Sie das nicht mehr per Auge. Das Modell schreibt vom kaputten JSON weiter, und Sie zahlen trotzdem. Vor dem Upload drei Schritte festziehen:
- Parse: jede Datei, die ins Fenster soll, ist echtes JSON / JSON5, kein Log, das „wie JSON aussieht“, und kein abgeschnittener Export.
- Schema: gegen den Vertrag prüfen, den das Modell halten soll. Bei mehreren Dateien zuerst klären, ob sie noch eine gemeinsame Quelle teilen.
- Diff: alte/neue Fixtures, Modell-arguments gegen Downstream-Body oder zwei OpenAPI-Versionen lokal vergleichen, bevor Sie das Modell nach „warum“ oder „wie ändern“ fragen.
Das geht im Browser, ohne zuerst hochzuladen: JSON-Formatierer für Parse und Struktur; JSON-Schema-Validator für Felder und Enums; JSON Diff für zwei Artefakte, die sich ein Fenster teilen. Dateien, die die Prüfung nicht bestehen, gehören nicht ins Pack.
Langes JSON vom Modell kann weiter syntaktisch kaputt sein oder in der Form driften — siehe KI-JSON-Fehlerleitfaden. Tool-arguments und die Endantwort sind zwei Verträge. Ein gemeinsames Fensterbudget heißt nicht, dass Sie sie geprüft haben.
Häufige Fragen FAQ
Sind 1M Token eine Million chinesische Schriftzeichen?
Nein. Token sind Tokenizer-Fragmente. Chinesisch, Englisch, Code, JSON, Bilder und Audio rechnen anders; ein Tokenizer-Wechsel beim Anbieter ändert, wie viel Text ins selbe 1M passt. Zählen Sie Ihr Material mit der Tokenizer-API dieses Modells. Ersetzen Sie das nicht durch „Seiten × Daumenregel“.
Wenn jedes Fenster 1M ist, spielt der Anbieter dann noch eine Rolle?
Ja. Max Output, Long-Context-Aufpreise, Modalitäten und wirksamer Recall laufen auseinander. Die 272K-Preislinie von GPT-5.6, Geminis kürzere Output-Decke und Claudes feinerer Tokenizer machen aus „demselben 1M“ andere Rechnungen und andere Abschneidepunkte. Messen Sie am Regressionsset, nicht am Aufkleber allein.
Brauchen wir noch RAG, wenn wir ein 1M-Fenster haben?
Ja. 1M ist für das Pack, das zusammen sichtbar sein muss. Ist der Korpus weit größer als das Fenster, oder ist jedes Mal nur eine kleine Spanne relevant, ist Retrieval billiger, Rechte sind leichter zu steuern, Updates gehen einfacher. Viele Produktionssysteme holen Kandidaten per Retrieval und lesen sie dann in einem langen Fenster — nicht entweder oder.
Warum lässt das Modell Felder weg, obwohl ich das ganze JSON-Repo reingeklebt habe?
Das Fenster macht Dinge sichtbar. Es bringt das Modell nicht dazu, einen Vertrag zu sprechen. Fehlende Keys, Typ-Drift und Markdown-Zäune sind Formprobleme — Structured Output / Schema nutzen und lokal noch einmal prüfen. Wird Material in der Mitte verdünnt, fällt auch der wirksame Recall. Ins Fenster gehört nur gültiges, aus derselben Quelle stammendes, bereits gedifftes JSON.
Fazit und nächste Schritte
1M Token ist die Flaggschiff-Größenordnung 2026: eine Anfrage kann etwa eine Million Token gleichzeitig sehen. Das macht ein ganzes Repo, ein ganzes Handbuch oder ein multimodales Pack machbar. Es heißt nicht automatisch stärkeres Reasoning, längeren Output oder einen niedrigeren Stückpreis. GPT, Claude und Gemini unterscheiden sich bei Output-Decken, Aufpreislinien und Modalitäten — nicht an einem einzigen Häkchen „hat 1M“.
Als Nächstes: Handbuch und Repo mit dem offiziellen Tokenizer zählen; Output und Puffer nach dem Budget oben freihalten; Aufpreisschwellen auf den drei Modellkarten prüfen. JSON, das ins Fenster soll, zuerst in JSONVue durch Parse, Schema und Diff. Form festnageln: Structured Output. Fehler schichten: der JSON-Fehlerleitfaden.