Kontextfenster-Rechner
Visualisieren Sie, wie System-Prompt, Gesprächsverlauf, RAG-Dokumente und Nutzernachricht das Kontextfenster eines LLM füllen. Fügen Sie eigene Slots hinzu, sehen Sie Nutzung und Restkapazität, vergleichen Sie Ihre Payload über 16 populäre Modelle und schätzen Sie Eingabekosten – kostenlos und 100 % privat im Browser.
Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.
Context Slots
Add Slot
Context Window Utilization - GPT-4o
6.3% usedUsed
8,000
Limit
128,000
Remaining
120,000
Input Cost
$0.0200
Slot Breakdown
| Slot | Tokens | % of Window | Input Cost |
|---|---|---|---|
System Prompt | 500 | 0.39% | $0.001250 |
Conversation History | 2,000 | 1.56% | $0.005000 |
Retrieved Documents (RAG) | 4,000 | 3.13% | $0.0100 |
User Message | 500 | 0.39% | $0.001250 |
Output Reserve | 1,000 | 0.78% | $0.002500 |
| Total | 8,000 | 6.25% | $0.0200 |
Same Payload Across Models
| Model | Context Window | % Used | Fits? |
|---|---|---|---|
| GPT-4oSelected | 128,000 | 6.3% | Yes |
| GPT-4o mini | 128,000 | 6.3% | Yes |
| o3 | 200,000 | 4.0% | Yes |
| o4-mini | 200,000 | 4.0% | Yes |
| Claude 3.7 Sonnet | 200,000 | 4.0% | Yes |
| Claude 3.5 Haiku | 200,000 | 4.0% | Yes |
| Claude Opus 4 | 200,000 | 4.0% | Yes |
| Gemini 2.5 Pro | 2,000,000 | 0.4% | Yes |
| Gemini 2.5 Flash | 1,000,000 | 0.8% | Yes |
| DeepSeek-V4-Flash | 1,048,576 | 0.8% | Yes |
| DeepSeek-V4-Pro | 1,048,576 | 0.8% | Yes |
| Grok 3 | 131,072 | 6.1% | Yes |
| Grok 3 Mini | 131,072 | 6.1% | Yes |
| Mistral Large | 131,072 | 6.1% | Yes |
| Mistral Small | 131,072 | 6.1% | Yes |
| Codestral | 256,000 | 3.1% | Yes |
Was Ihr Kontextfenster wirklich belegt
In realen Anwendungen verbrauchen System-Prompt und Gesprächsverlauf oft mehr Kontext als die Dokumente, die die Antwort liefern. Die Slot-Visualisierung macht dieses Ungleichgewicht sichtbar.
Fügen Sie je Komponente einen Slot hinzu, tragen Sie Tokens ein und sehen Sie Gesamtnutzung, Restkapazität und ob Ihre Payload in jedes Modell passt.
- Das Fenster wird zwischen Eingabe und Ausgabe geteilt: Der Prompt kann es nie ganz füllen.
- Der Gesprächsverlauf wächst mit jeder Runde und verdrängt nützliche Dokumente.
- Überlauf wird rot markiert, bevor er die API erreicht.
Tokens für die Antwort budgetieren
Der häufigste Fehler ist, den Prompt bis zum letzten Token zu rechnen und die Antwort zu vergessen. Die Ausgabereserve gehört zum selben Budget.
- Reservieren Sie 1.000-4.000 Tokens für Standardantworten.
- Für Code oder lange Berichte mehr reservieren und den Prompt kürzen.
- Passt die Reserve nicht, Verlauf oder Dokumente kürzen – nicht die kritische Anweisung.
Modelle vor der Entscheidung vergleichen
Dieselbe Payload kann in einem Modell bequem passen und in einem anderen überlaufen. Der Vergleich mehrerer Modelle erspart einen Anbieterwechsel nach dem Rollout.
- Tragen Sie Ihre Prompt-Slots mit Tokens ein.
- Setzen Sie die für Ihren Anwendungsfall nötige Ausgabereserve.
- Betrachten Sie die resultierende Nutzung in jedem Modell der Liste.
- Wählen Sie das Modell mit genügend Spielraum zu den niedrigsten Eingabekosten.
Häufig gestellte Fragen
Es ist die maximale Tokenzahl, die ein großes Sprachmodell in einer Anfrage verarbeitet. Es umfasst den gesamten Prompt (Systemanweisungen, Gesprächsverlauf, abgerufene Dokumente und Nutzernachricht) plus die generierte Antwort. Übersteigt die Summe das Limit, kürzt das Modell die Anfrage oder weist sie ab.
Das Kontextfenster ist das Gesamttokenbudget einer Anfrage – geteilt zwischen Eingabe und Ausgabe. Maximale Ausgabe-Tokens sind die Höchstlänge der generierten Antwort. Bei einem 128.000-Token-Fenster und einem Prompt mit 120.000 Tokens bleiben nur 8.000 Tokens für die Antwort. Reservieren Sie beim Planen immer Ausgaberaum.
Jeder Slot dieses Rechners nimmt direkt eine Tokenzahl an. Kennen Sie die genaue Zahl nicht, gilt als verlässliche Schätzung 1 Token pro ~3,8-4,0 Zeichen englischer Prosa – oder nutzen Sie unser Token-Zählwerkzeug für eingefügten Text. Bei Code variiert das Verhältnis je nach Sprache und Symboldichte.
Die meisten APIs geben einen Fehler (400 oder 413) zurück, wenn der Prompt das Kontextlimit überschreitet. Manche Modelle kürzen stillschweigend die ältesten Gesprächsrunden oder den Prompt-Anfang, was zu unerwartetem Verhalten führt. Der Rechner markiert den Überlauf rot, damit Sie ihn vor dem API-Aufruf sehen.
Das Kontextfenster ist ein geteiltes Budget für Prompt und Antwort. Füllt der Prompt das ganze Fenster, bleiben keine Tokens für die Generierung. Reservieren Sie mindestens die erwartete Maximallänge der Antwort – typisch 1.000-4.000 Tokens, mehr bei langen Generierungen.
Mitte 2026 bietet Googles Gemini 2.5 Pro das größte Kontextfenster mit 2.000.000 Tokens. Gemini 2.5 Flash und DeepSeek-V4-Flash unterstützen über 1.000.000 Tokens. Anthropics Claude-Modelle und OpenAIs o3/o4-mini unterstützen 200.000 Tokens. GPT-4o, Grok 3 und Mistral-Modelle liegen meist bei 128.000-131.072 Tokens.
Ja. Der Rechner läuft vollständig im Browser. Slot-Bezeichnungen, Tokenzahlen, Modellauswahl und alle Ergebnisse werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server gesendet. Ihre Daten bleiben 100 % privat – keine Registrierung, kein Tracking, keine Uploads.