Zum Inhalt springen
Aback Tools Logo

Kontext-Packing-Rechner

Optimieren Sie kostenlos, wie viele RAG-Chunks in das Kontextfenster eines Modells passen. Konfigurieren Sie Chunk-Größe, Überlappung, System-Prompt, Ausgabereserve und Sicherheitspuffer für GPT, Claude, Gemini, DeepSeek, Llama und Mistral. Sehen Sie sofort die Token-Aufschlüsselung, den Kontextbalken und den Modellvergleich.

Context Packing Calculator

Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Fixed Context Overhead

tokens
tokens
tokens
Fixed overhead: 1,050 tokens (1% of context)

Chunk Configuration

tokens
tokens
chunks

Safety Buffer & Volume

%
reqs

Max Chunks That Fit

326

of 400-token chunks

Tokens for Chunks

114.2K

of 128.0K ctx window

Unused Tokens

0

headroom remaining

Context Window Breakdown - GPT-4o

System (400)Query (150)Chunks (114.2K)Output (500)Buffer (12.8K)Unused (0)
Used: 115.2K (90%)Effective: 115.2KLimit: 128.0K
SlotTokens% of WindowNotes
System Prompt4000%Fixed overhead
User Query1500%Fixed overhead
Retrieved Chunks114,15089%326 × 400 tok
Output Reserve5000%Max response
Safety Buffer12,80010%10% headroom
Unused / Slack00%Free headroom

Monthly RAG Query Cost - 30,000 requests

$8,790.00GPT-4o

Per Query (Input)

$0.2880

Per Query (Output)

$0.005000

Total Per Query

$0.2930

Chunks That Fit - All Models

Sorted by most chunks first
ModelContextMax ChunksMonthly CostMin Met?
GoogleGemini 2.5 ProCapable
2.0M5,139$67,640.62 Yes
OpenAIGPT-5.4Capable
1.0M2,568$67,792.50 Yes
GoogleGemini 2.5 FlashBudget
1.0M2,568$8,136.60 Yes
GoogleGemini 3.5 FlashBudget
1.0M2,568$40,630.50 Yes
DeepSeekDeepSeek V4 ProBudget
1.0M2,568$11,756.75 Yes
DeepSeekDeepSeek V4 FlashBudget
1.0M2,568$3,783.78 Yes
MetaLlama 4 MaverickBudget
524.0K1,344$3,125.10 Yes
OpenAIo3 (Reasoning)
200.0K511$10,917.00 Yes
AnthropicClaude Sonnet 4.6Capable
200.0K511$16,420.50 Yes
AnthropicClaude Haiku 4.5Budget
200.0K511$5,473.50 Yes
AnthropicClaude Opus 4.8Capable
200.0K511$27,367.50 Yes
MistralMistral Large
131.1K333$7,149.00 Yes
MistralMistral SmallBudget
131.1K333$357.45 Yes
OpenAIGPT-4o Selected
128.0K326$8,790.00 Yes
OpenAIGPT-4o MiniBudget
128.0K326$527.40 Yes
Packing Formula: Chunk capacity = 1 + floor((available_tokens − chunk_size) / (chunk_size − overlap)). Available tokens = effective context − system prompt − query − output reserve. Effective context = context window × (1 − safety buffer%). Actual results may vary slightly due to tokenizer overhead on special tokens and message format wrappers.

Was das Token-Budget einer Anfrage verbraucht

Das Kontextfenster steht nicht nur den abgerufenen Chunks zur Verfügung. System-Prompt, Nutzeranfrage, Nachrichtenformat und erwartete Antwort verbrauchen Budget, bevor überhaupt ein Dokument hineinkommt.

Geben Sie Fenstergröße, feste Tokens und Chunk-Größe ein, um zu sehen, wie viele Chunks tatsächlich passen und wie viel Kontext ungenutzt bleibt.

  • Effektiver Kontext = Kontextfenster × (1 − Sicherheitspuffer).
  • Verfügbar = effektiver Kontext − System-Prompt − Anfrage − Ausgabereserve.
  • Max. Chunks = 1 + floor((verfügbar − Größe) / (Größe − Überlappung)).

Chunks und Struktur ausbalancieren

Ein kleinerer Chunk passt öfter hinein, liefert aber weniger Kontext. Ein größerer Chunk liefert mehr Kontext pro Einheit, reduziert aber die Zahl verschiedener Dokumente.

  • 3-8 Chunks pro Anfrage sind in der Produktion üblich.
  • 10-15 % Überlappung erhält die Kontinuität an Grenzen.
  • Zu wenig reservierte Ausgabe-Tokens sind die häufigste Ursache für Truncation.

Das System schrittweise abstimmen

Beginnen Sie mit Modell und Kontextfenster und justieren Sie dann die Chunk-Größe, bis genügend relevante Dokumente mit komfortabler Ausgabereserve hineinpassen.

  1. Modell wählen und Sicherheitspuffer setzen, um den effektiven Kontext zu erhalten.
  2. Tokens für System-Prompt, Anfrage und Ausgabereserve abziehen.
  3. Chunk-Größe und Überlappung anpassen, bis die benötigte Chunk-Anzahl passt.
  4. Token-Aufschlüsselung prüfen und vor dem Rollout mit einem anderen Modell vergleichen.

Häufig gestellte Fragen

Er bestimmt, wie viele abgerufene Dokument-Chunks für eine einzelne RAG-Anfrage in das Kontextfenster eines Sprachmodells passen. Er berücksichtigt feste Overheads wie System-Prompt, Nutzeranfrage und Ausgabereserve und berechnet dann die maximale Chunk-Anzahl mit der Sliding-Window-Formel.

Die Formel lautet: max_chunks = 1 + floor((verfügbare_tokens − chunk_größe) / (chunk_größe − überlappung)). Dabei gilt verfügbare_tokens = effektiver_kontext − system_prompt_tokens − anfrage_tokens − ausgabereserve_tokens und effektiver_kontext = kontextfenster × (1 − sicherheitspuffer).

Die meisten Produktions-RAG-Systeme nutzen Chunk-Größen zwischen 256 und 512 Tokens. Kleinere Chunks verbessern die Abrufpräzision, benötigen aber mehr Chunks für ein Thema. Eine Chunk-Größe von 400 Tokens mit 10 % Überlappung ist ein üblicher Startpunkt.

Überlappung bedeutet, dass benachbarte Chunks an ihren Grenzen einige Tokens teilen. Das erhält Satz- und Absatzkontinuität: über Grenzen geteilte Information ist in beiden Chunks verfügbar, was den Recall verbessert. Typisch sind 10-15 % der Chunk-Größe.

LLMs nutzen dasselbe Kontextfenster für Eingabe und Ausgabe. Füllen Sie den gesamten Kontext mit Prompt-Tokens, bleibt dem Modell kein Platz für eine Antwort. Reservieren Sie mindestens 256-512 Tokens für kurze Antworten, mehr für lange strukturierte Ausgaben.

Ein Sicherheitspuffer reserviert einen Prozentsatz des Kontextfensters als Reserve für Tokenisierungsabweichungen. Reale Tokenzahlen können durch Nachrichtenformat-Tokens und Tokenizer-Unterschiede um einige Prozent abweichen. Ein Puffer von 5-10 % verhindert Überlauf-Fehler in der Produktion.

Die meisten RAG-Systeme rufen 3-8 Chunks pro Anfrage ab. Weniger als 3 liefern oft zu wenig vielfältigen Kontext. Mehr als 8 verwässert die Relevanz. Der optimale Wert hängt vom Anwendungsfall ab: faktische Q&A braucht meist 3-5 Chunks, Dokumentensynthese profitiert von 8-12.

Vollständig. Der Rechner läuft ganz im Browser. Chunk-Größe, Tokenzahlen, Modelleinstellungen und Kostenschätzungen werden lokal verarbeitet – nichts wird an einen Server gesendet. Ihre RAG-Konfiguration bleibt 100 % privat.