Kontext-Packing-Rechner
Optimieren Sie kostenlos, wie viele RAG-Chunks in das Kontextfenster eines Modells passen. Konfigurieren Sie Chunk-Größe, Überlappung, System-Prompt, Ausgabereserve und Sicherheitspuffer für GPT, Claude, Gemini, DeepSeek, Llama und Mistral. Sehen Sie sofort die Token-Aufschlüsselung, den Kontextbalken und den Modellvergleich.
Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.
Fixed Context Overhead
Chunk Configuration
Safety Buffer & Volume
Max Chunks That Fit
326
of 400-token chunks
Tokens for Chunks
114.2K
of 128.0K ctx window
Unused Tokens
0
headroom remaining
Context Window Breakdown - GPT-4o
| Slot | Tokens | % of Window | Notes |
|---|---|---|---|
| System Prompt | 400 | 0% | Fixed overhead |
| User Query | 150 | 0% | Fixed overhead |
| Retrieved Chunks | 114,150 | 89% | 326 × 400 tok |
| Output Reserve | 500 | 0% | Max response |
| Safety Buffer | 12,800 | 10% | 10% headroom |
| Unused / Slack | 0 | 0% | Free headroom |
Monthly RAG Query Cost - 30,000 requests
Per Query (Input)
$0.2880
Per Query (Output)
$0.005000
Total Per Query
$0.2930
Chunks That Fit - All Models
Sorted by most chunks first| Model | Context | Max Chunks | Monthly Cost | Min Met? |
|---|---|---|---|---|
GoogleGemini 2.5 ProCapable | 2.0M | 5,139 | $67,640.62 | Yes |
OpenAIGPT-5.4Capable | 1.0M | 2,568 | $67,792.50 | Yes |
GoogleGemini 2.5 FlashBudget | 1.0M | 2,568 | $8,136.60 | Yes |
GoogleGemini 3.5 FlashBudget | 1.0M | 2,568 | $40,630.50 | Yes |
DeepSeekDeepSeek V4 ProBudget | 1.0M | 2,568 | $11,756.75 | Yes |
DeepSeekDeepSeek V4 FlashBudget | 1.0M | 2,568 | $3,783.78 | Yes |
MetaLlama 4 MaverickBudget | 524.0K | 1,344 | $3,125.10 | Yes |
OpenAIo3 (Reasoning) | 200.0K | 511 | $10,917.00 | Yes |
AnthropicClaude Sonnet 4.6Capable | 200.0K | 511 | $16,420.50 | Yes |
AnthropicClaude Haiku 4.5Budget | 200.0K | 511 | $5,473.50 | Yes |
AnthropicClaude Opus 4.8Capable | 200.0K | 511 | $27,367.50 | Yes |
MistralMistral Large | 131.1K | 333 | $7,149.00 | Yes |
MistralMistral SmallBudget | 131.1K | 333 | $357.45 | Yes |
OpenAIGPT-4o Selected | 128.0K | 326 | $8,790.00 | Yes |
OpenAIGPT-4o MiniBudget | 128.0K | 326 | $527.40 | Yes |
Was das Token-Budget einer Anfrage verbraucht
Das Kontextfenster steht nicht nur den abgerufenen Chunks zur Verfügung. System-Prompt, Nutzeranfrage, Nachrichtenformat und erwartete Antwort verbrauchen Budget, bevor überhaupt ein Dokument hineinkommt.
Geben Sie Fenstergröße, feste Tokens und Chunk-Größe ein, um zu sehen, wie viele Chunks tatsächlich passen und wie viel Kontext ungenutzt bleibt.
- Effektiver Kontext = Kontextfenster × (1 − Sicherheitspuffer).
- Verfügbar = effektiver Kontext − System-Prompt − Anfrage − Ausgabereserve.
- Max. Chunks = 1 + floor((verfügbar − Größe) / (Größe − Überlappung)).
Chunks und Struktur ausbalancieren
Ein kleinerer Chunk passt öfter hinein, liefert aber weniger Kontext. Ein größerer Chunk liefert mehr Kontext pro Einheit, reduziert aber die Zahl verschiedener Dokumente.
- 3-8 Chunks pro Anfrage sind in der Produktion üblich.
- 10-15 % Überlappung erhält die Kontinuität an Grenzen.
- Zu wenig reservierte Ausgabe-Tokens sind die häufigste Ursache für Truncation.
Das System schrittweise abstimmen
Beginnen Sie mit Modell und Kontextfenster und justieren Sie dann die Chunk-Größe, bis genügend relevante Dokumente mit komfortabler Ausgabereserve hineinpassen.
- Modell wählen und Sicherheitspuffer setzen, um den effektiven Kontext zu erhalten.
- Tokens für System-Prompt, Anfrage und Ausgabereserve abziehen.
- Chunk-Größe und Überlappung anpassen, bis die benötigte Chunk-Anzahl passt.
- Token-Aufschlüsselung prüfen und vor dem Rollout mit einem anderen Modell vergleichen.
Häufig gestellte Fragen
Er bestimmt, wie viele abgerufene Dokument-Chunks für eine einzelne RAG-Anfrage in das Kontextfenster eines Sprachmodells passen. Er berücksichtigt feste Overheads wie System-Prompt, Nutzeranfrage und Ausgabereserve und berechnet dann die maximale Chunk-Anzahl mit der Sliding-Window-Formel.
Die Formel lautet: max_chunks = 1 + floor((verfügbare_tokens − chunk_größe) / (chunk_größe − überlappung)). Dabei gilt verfügbare_tokens = effektiver_kontext − system_prompt_tokens − anfrage_tokens − ausgabereserve_tokens und effektiver_kontext = kontextfenster × (1 − sicherheitspuffer).
Die meisten Produktions-RAG-Systeme nutzen Chunk-Größen zwischen 256 und 512 Tokens. Kleinere Chunks verbessern die Abrufpräzision, benötigen aber mehr Chunks für ein Thema. Eine Chunk-Größe von 400 Tokens mit 10 % Überlappung ist ein üblicher Startpunkt.
Überlappung bedeutet, dass benachbarte Chunks an ihren Grenzen einige Tokens teilen. Das erhält Satz- und Absatzkontinuität: über Grenzen geteilte Information ist in beiden Chunks verfügbar, was den Recall verbessert. Typisch sind 10-15 % der Chunk-Größe.
LLMs nutzen dasselbe Kontextfenster für Eingabe und Ausgabe. Füllen Sie den gesamten Kontext mit Prompt-Tokens, bleibt dem Modell kein Platz für eine Antwort. Reservieren Sie mindestens 256-512 Tokens für kurze Antworten, mehr für lange strukturierte Ausgaben.
Ein Sicherheitspuffer reserviert einen Prozentsatz des Kontextfensters als Reserve für Tokenisierungsabweichungen. Reale Tokenzahlen können durch Nachrichtenformat-Tokens und Tokenizer-Unterschiede um einige Prozent abweichen. Ein Puffer von 5-10 % verhindert Überlauf-Fehler in der Produktion.
Die meisten RAG-Systeme rufen 3-8 Chunks pro Anfrage ab. Weniger als 3 liefern oft zu wenig vielfältigen Kontext. Mehr als 8 verwässert die Relevanz. Der optimale Wert hängt vom Anwendungsfall ab: faktische Q&A braucht meist 3-5 Chunks, Dokumentensynthese profitiert von 8-12.
Vollständig. Der Rechner läuft ganz im Browser. Chunk-Größe, Tokenzahlen, Modelleinstellungen und Kostenschätzungen werden lokal verarbeitet – nichts wird an einen Server gesendet. Ihre RAG-Konfiguration bleibt 100 % privat.