Zum Inhalt springen
Aback Tools Logo

Kontextfenster-Rechner

Visualisieren Sie, wie System-Prompt, Gesprächsverlauf, RAG-Dokumente und Nutzernachricht das Kontextfenster eines LLM füllen. Fügen Sie eigene Slots hinzu, sehen Sie Nutzung und Restkapazität, vergleichen Sie Ihre Payload über 16 populäre Modelle und schätzen Sie Eingabekosten – kostenlos und 100 % privat im Browser.

Context Window Calculator

Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Context Slots

System Prompt
0.4%
Conversation History
1.6%
Retrieved Documents (RAG)
3.1%
User Message
0.4%
Output Reserve
0.8%

Add Slot

Context Window Utilization - GPT-4o

6.3% used
System Prompt500
Conversation History2,000
Retrieved Documents (RAG)4,000
User Message500
Output Reserve1,000
Free120,000

Used

8,000

Limit

128,000

Remaining

120,000

Input Cost

$0.0200

Slot Breakdown

SlotTokens% of WindowInput Cost
System Prompt
5000.39%$0.001250
Conversation History
2,0001.56%$0.005000
Retrieved Documents (RAG)
4,0003.13%$0.0100
User Message
5000.39%$0.001250
Output Reserve
1,0000.78%$0.002500
Total8,0006.25%$0.0200

Same Payload Across Models

ModelContext Window% UsedFits?
GPT-4oSelected128,0006.3% Yes
GPT-4o mini128,0006.3% Yes
o3200,0004.0% Yes
o4-mini200,0004.0% Yes
Claude 3.7 Sonnet200,0004.0% Yes
Claude 3.5 Haiku200,0004.0% Yes
Claude Opus 4200,0004.0% Yes
Gemini 2.5 Pro2,000,0000.4% Yes
Gemini 2.5 Flash1,000,0000.8% Yes
DeepSeek-V4-Flash1,048,5760.8% Yes
DeepSeek-V4-Pro1,048,5760.8% Yes
Grok 3131,0726.1% Yes
Grok 3 Mini131,0726.1% Yes
Mistral Large131,0726.1% Yes
Mistral Small131,0726.1% Yes
Codestral256,0003.1% Yes
Note: Token counts entered here are the billable input tokens for each slot. Actual tokenization may vary slightly by model and content type (code vs. prose vs. non-English text). Context window limits shown are the maximum prompt+response window; reserve tokens for your expected output length.

Was Ihr Kontextfenster wirklich belegt

In realen Anwendungen verbrauchen System-Prompt und Gesprächsverlauf oft mehr Kontext als die Dokumente, die die Antwort liefern. Die Slot-Visualisierung macht dieses Ungleichgewicht sichtbar.

Fügen Sie je Komponente einen Slot hinzu, tragen Sie Tokens ein und sehen Sie Gesamtnutzung, Restkapazität und ob Ihre Payload in jedes Modell passt.

  • Das Fenster wird zwischen Eingabe und Ausgabe geteilt: Der Prompt kann es nie ganz füllen.
  • Der Gesprächsverlauf wächst mit jeder Runde und verdrängt nützliche Dokumente.
  • Überlauf wird rot markiert, bevor er die API erreicht.

Tokens für die Antwort budgetieren

Der häufigste Fehler ist, den Prompt bis zum letzten Token zu rechnen und die Antwort zu vergessen. Die Ausgabereserve gehört zum selben Budget.

  • Reservieren Sie 1.000-4.000 Tokens für Standardantworten.
  • Für Code oder lange Berichte mehr reservieren und den Prompt kürzen.
  • Passt die Reserve nicht, Verlauf oder Dokumente kürzen – nicht die kritische Anweisung.

Modelle vor der Entscheidung vergleichen

Dieselbe Payload kann in einem Modell bequem passen und in einem anderen überlaufen. Der Vergleich mehrerer Modelle erspart einen Anbieterwechsel nach dem Rollout.

  1. Tragen Sie Ihre Prompt-Slots mit Tokens ein.
  2. Setzen Sie die für Ihren Anwendungsfall nötige Ausgabereserve.
  3. Betrachten Sie die resultierende Nutzung in jedem Modell der Liste.
  4. Wählen Sie das Modell mit genügend Spielraum zu den niedrigsten Eingabekosten.

Häufig gestellte Fragen

Es ist die maximale Tokenzahl, die ein großes Sprachmodell in einer Anfrage verarbeitet. Es umfasst den gesamten Prompt (Systemanweisungen, Gesprächsverlauf, abgerufene Dokumente und Nutzernachricht) plus die generierte Antwort. Übersteigt die Summe das Limit, kürzt das Modell die Anfrage oder weist sie ab.

Das Kontextfenster ist das Gesamttokenbudget einer Anfrage – geteilt zwischen Eingabe und Ausgabe. Maximale Ausgabe-Tokens sind die Höchstlänge der generierten Antwort. Bei einem 128.000-Token-Fenster und einem Prompt mit 120.000 Tokens bleiben nur 8.000 Tokens für die Antwort. Reservieren Sie beim Planen immer Ausgaberaum.

Jeder Slot dieses Rechners nimmt direkt eine Tokenzahl an. Kennen Sie die genaue Zahl nicht, gilt als verlässliche Schätzung 1 Token pro ~3,8-4,0 Zeichen englischer Prosa – oder nutzen Sie unser Token-Zählwerkzeug für eingefügten Text. Bei Code variiert das Verhältnis je nach Sprache und Symbol­dichte.

Die meisten APIs geben einen Fehler (400 oder 413) zurück, wenn der Prompt das Kontextlimit überschreitet. Manche Modelle kürzen stillschweigend die ältesten Gesprächsrunden oder den Prompt-Anfang, was zu unerwartetem Verhalten führt. Der Rechner markiert den Überlauf rot, damit Sie ihn vor dem API-Aufruf sehen.

Das Kontextfenster ist ein geteiltes Budget für Prompt und Antwort. Füllt der Prompt das ganze Fenster, bleiben keine Tokens für die Generierung. Reservieren Sie mindestens die erwartete Maximallänge der Antwort – typisch 1.000-4.000 Tokens, mehr bei langen Generierungen.

Mitte 2026 bietet Googles Gemini 2.5 Pro das größte Kontextfenster mit 2.000.000 Tokens. Gemini 2.5 Flash und DeepSeek-V4-Flash unterstützen über 1.000.000 Tokens. Anthropics Claude-Modelle und OpenAIs o3/o4-mini unterstützen 200.000 Tokens. GPT-4o, Grok 3 und Mistral-Modelle liegen meist bei 128.000-131.072 Tokens.

Ja. Der Rechner läuft vollständig im Browser. Slot-Bezeichnungen, Tokenzahlen, Modellauswahl und alle Ergebnisse werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server gesendet. Ihre Daten bleiben 100 % privat – keine Registrierung, kein Tracking, keine Uploads.