Aller au contenu
Aback Tools Logo

Calculateur de remplissage de contexte

Optimisez gratuitement le nombre de chunks RAG qui tiennent dans la fenêtre de contexte de n'importe quel modèle. Configurez taille de chunk, chevauchement, prompt système, réserve de sortie et marge de sécurité pour GPT, Claude, Gemini, DeepSeek, Llama et Mistral. Visualisez instantanément le détail des tokens, la barre de contexte et la comparaison entre modèles.

Context Packing Calculator

Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Fixed Context Overhead

tokens
tokens
tokens
Fixed overhead: 1,050 tokens (1% of context)

Chunk Configuration

tokens
tokens
chunks

Safety Buffer & Volume

%
reqs

Max Chunks That Fit

326

of 400-token chunks

Tokens for Chunks

114.2K

of 128.0K ctx window

Unused Tokens

0

headroom remaining

Context Window Breakdown - GPT-4o

System (400)Query (150)Chunks (114.2K)Output (500)Buffer (12.8K)Unused (0)
Used: 115.2K (90%)Effective: 115.2KLimit: 128.0K
SlotTokens% of WindowNotes
System Prompt4000%Fixed overhead
User Query1500%Fixed overhead
Retrieved Chunks114,15089%326 × 400 tok
Output Reserve5000%Max response
Safety Buffer12,80010%10% headroom
Unused / Slack00%Free headroom

Monthly RAG Query Cost - 30,000 requests

$8,790.00GPT-4o

Per Query (Input)

$0.2880

Per Query (Output)

$0.005000

Total Per Query

$0.2930

Chunks That Fit - All Models

Sorted by most chunks first
ModelContextMax ChunksMonthly CostMin Met?
GoogleGemini 2.5 ProCapable
2.0M5,139$67,640.62 Yes
OpenAIGPT-5.4Capable
1.0M2,568$67,792.50 Yes
GoogleGemini 2.5 FlashBudget
1.0M2,568$8,136.60 Yes
GoogleGemini 3.5 FlashBudget
1.0M2,568$40,630.50 Yes
DeepSeekDeepSeek V4 ProBudget
1.0M2,568$11,756.75 Yes
DeepSeekDeepSeek V4 FlashBudget
1.0M2,568$3,783.78 Yes
MetaLlama 4 MaverickBudget
524.0K1,344$3,125.10 Yes
OpenAIo3 (Reasoning)
200.0K511$10,917.00 Yes
AnthropicClaude Sonnet 4.6Capable
200.0K511$16,420.50 Yes
AnthropicClaude Haiku 4.5Budget
200.0K511$5,473.50 Yes
AnthropicClaude Opus 4.8Capable
200.0K511$27,367.50 Yes
MistralMistral Large
131.1K333$7,149.00 Yes
MistralMistral SmallBudget
131.1K333$357.45 Yes
OpenAIGPT-4o Selected
128.0K326$8,790.00 Yes
OpenAIGPT-4o MiniBudget
128.0K326$527.40 Yes
Packing Formula: Chunk capacity = 1 + floor((available_tokens − chunk_size) / (chunk_size − overlap)). Available tokens = effective context − system prompt − query − output reserve. Effective context = context window × (1 − safety buffer%). Actual results may vary slightly due to tokenizer overhead on special tokens and message format wrappers.

Ce qui consomme le budget de tokens d'une requête

La fenêtre de contexte n'est pas disponible uniquement pour les chunks récupérés. Le prompt système, la requête utilisateur, le formatage des messages et la réponse attendue consomment du budget avant même qu'un document n'entre.

Saisissez la taille de fenêtre, les tokens fixes et la taille de chunk pour voir combien de chunks tiennent réellement et combien de contexte reste inutilisé.

  • Contexte effectif = fenêtre de contexte × (1 − marge de sécurité).
  • Disponible = contexte effectif − prompt système − requête − réserve de sortie.
  • Max chunks = 1 + floor((disponible − taille) / (taille − chevauchement)).

Équilibrer chunks et structure

Un chunk plus petit tient plus de fois, mais apporte moins de contexte. Un chunk plus grand apporte plus de contexte par unité, mais réduit le nombre de documents distincts que vous pouvez inclure.

  • Récupérer 3 à 8 chunks par requête est la norme en production.
  • Un chevauchement de 10-15 % préserve la continuité aux frontières.
  • Réserver trop peu de tokens de sortie est la cause la plus fréquente de troncature.

Régler le système étape par étape

Commencez par le modèle et la fenêtre de contexte, puis ajustez la taille de chunk jusqu'à ce qu'assez de documents pertinents tiennent avec une réserve de sortie confortable.

  1. Sélectionnez le modèle et fixez la marge de sécurité pour obtenir le contexte effectif.
  2. Soustrayez les tokens du prompt système, de la requête et de la réserve de sortie.
  3. Ajustez taille de chunk et chevauchement jusqu'à atteindre le nombre de chunks nécessaire.
  4. Vérifiez le détail des tokens et comparez avec un autre modèle avant de déployer.

Foire aux questions

Il détermine combien de chunks de documents récupérés tiennent dans la fenêtre de contexte d'un modèle de langage pour une requête RAG unique. Il tient compte des coûts fixes (prompt système, requête utilisateur, réserve de sortie) puis calcule le nombre maximal de chunks avec la formule de fenêtre glissante.

La formule est : max_chunks = 1 + floor((tokens_disponibles − taille_chunk) / (taille_chunk − chevauchement)). Où tokens_disponibles = contexte_effectif − tokens_prompt_système − tokens_requête − tokens_réserve_sortie, et contexte_effectif = fenêtre_contexte × (1 − marge_sécurité).

La plupart des systèmes RAG en production utilisent des chunks de 256 à 512 tokens. Des chunks plus petits améliorent la précision de récupération mais nécessitent plus de chunks pour couvrir un sujet. Une taille de 400 tokens avec 10 % de chevauchement est un point de départ courant.

Le chevauchement signifie que des chunks adjacents partagent des tokens à leurs frontières. Cela préserve la continuité des phrases et paragraphes : une information coupée entre deux chunks existe dans les deux, ce qui améliore le rappel. Un chevauchement typique représente 10-15 % de la taille du chunk.

Les LLM utilisent la même fenêtre de contexte pour l'entrée et la sortie. Si vous remplissez tout le contexte avec des tokens de prompt, le modèle n'a plus de place pour générer une réponse. Réservez toujours au moins 256-512 tokens pour des réponses courtes, davantage pour des sorties longues et structurées.

Une marge de sécurité réserve un pourcentage de la fenêtre de contexte comme marge pour la variance de tokenisation. Les comptages réels peuvent différer des estimations de quelques pourcents à cause des tokens de format de message et des différences de tokenizer. Une marge de 5-10 % évite les erreurs de dépassement en production.

La plupart des systèmes RAG récupèrent 3 à 8 chunks par requête. Moins de 3 peut manquer de diversité de contexte. Plus de 8 peut diluer la pertinence. Le nombre optimal dépend de votre cas d'usage : le Q&A factuel nécessite souvent 3-5 chunks, la synthèse documentaire peut profiter de 8-12.

Complètement. Le calculateur fonctionne entièrement dans votre navigateur. Taille de chunk, comptages de tokens, réglages de modèle et estimations de coût sont traités localement : rien n'est envoyé à un serveur. Votre configuration RAG reste 100 % privée.