Calculateur de remplissage de contexte
Optimisez gratuitement le nombre de chunks RAG qui tiennent dans la fenêtre de contexte de n'importe quel modèle. Configurez taille de chunk, chevauchement, prompt système, réserve de sortie et marge de sécurité pour GPT, Claude, Gemini, DeepSeek, Llama et Mistral. Visualisez instantanément le détail des tokens, la barre de contexte et la comparaison entre modèles.
Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.
Fixed Context Overhead
Chunk Configuration
Safety Buffer & Volume
Max Chunks That Fit
326
of 400-token chunks
Tokens for Chunks
114.2K
of 128.0K ctx window
Unused Tokens
0
headroom remaining
Context Window Breakdown - GPT-4o
| Slot | Tokens | % of Window | Notes |
|---|---|---|---|
| System Prompt | 400 | 0% | Fixed overhead |
| User Query | 150 | 0% | Fixed overhead |
| Retrieved Chunks | 114,150 | 89% | 326 × 400 tok |
| Output Reserve | 500 | 0% | Max response |
| Safety Buffer | 12,800 | 10% | 10% headroom |
| Unused / Slack | 0 | 0% | Free headroom |
Monthly RAG Query Cost - 30,000 requests
Per Query (Input)
$0.2880
Per Query (Output)
$0.005000
Total Per Query
$0.2930
Chunks That Fit - All Models
Sorted by most chunks first| Model | Context | Max Chunks | Monthly Cost | Min Met? |
|---|---|---|---|---|
GoogleGemini 2.5 ProCapable | 2.0M | 5,139 | $67,640.62 | Yes |
OpenAIGPT-5.4Capable | 1.0M | 2,568 | $67,792.50 | Yes |
GoogleGemini 2.5 FlashBudget | 1.0M | 2,568 | $8,136.60 | Yes |
GoogleGemini 3.5 FlashBudget | 1.0M | 2,568 | $40,630.50 | Yes |
DeepSeekDeepSeek V4 ProBudget | 1.0M | 2,568 | $11,756.75 | Yes |
DeepSeekDeepSeek V4 FlashBudget | 1.0M | 2,568 | $3,783.78 | Yes |
MetaLlama 4 MaverickBudget | 524.0K | 1,344 | $3,125.10 | Yes |
OpenAIo3 (Reasoning) | 200.0K | 511 | $10,917.00 | Yes |
AnthropicClaude Sonnet 4.6Capable | 200.0K | 511 | $16,420.50 | Yes |
AnthropicClaude Haiku 4.5Budget | 200.0K | 511 | $5,473.50 | Yes |
AnthropicClaude Opus 4.8Capable | 200.0K | 511 | $27,367.50 | Yes |
MistralMistral Large | 131.1K | 333 | $7,149.00 | Yes |
MistralMistral SmallBudget | 131.1K | 333 | $357.45 | Yes |
OpenAIGPT-4o Selected | 128.0K | 326 | $8,790.00 | Yes |
OpenAIGPT-4o MiniBudget | 128.0K | 326 | $527.40 | Yes |
Ce qui consomme le budget de tokens d'une requête
La fenêtre de contexte n'est pas disponible uniquement pour les chunks récupérés. Le prompt système, la requête utilisateur, le formatage des messages et la réponse attendue consomment du budget avant même qu'un document n'entre.
Saisissez la taille de fenêtre, les tokens fixes et la taille de chunk pour voir combien de chunks tiennent réellement et combien de contexte reste inutilisé.
- Contexte effectif = fenêtre de contexte × (1 − marge de sécurité).
- Disponible = contexte effectif − prompt système − requête − réserve de sortie.
- Max chunks = 1 + floor((disponible − taille) / (taille − chevauchement)).
Équilibrer chunks et structure
Un chunk plus petit tient plus de fois, mais apporte moins de contexte. Un chunk plus grand apporte plus de contexte par unité, mais réduit le nombre de documents distincts que vous pouvez inclure.
- Récupérer 3 à 8 chunks par requête est la norme en production.
- Un chevauchement de 10-15 % préserve la continuité aux frontières.
- Réserver trop peu de tokens de sortie est la cause la plus fréquente de troncature.
Régler le système étape par étape
Commencez par le modèle et la fenêtre de contexte, puis ajustez la taille de chunk jusqu'à ce qu'assez de documents pertinents tiennent avec une réserve de sortie confortable.
- Sélectionnez le modèle et fixez la marge de sécurité pour obtenir le contexte effectif.
- Soustrayez les tokens du prompt système, de la requête et de la réserve de sortie.
- Ajustez taille de chunk et chevauchement jusqu'à atteindre le nombre de chunks nécessaire.
- Vérifiez le détail des tokens et comparez avec un autre modèle avant de déployer.
Foire aux questions
Il détermine combien de chunks de documents récupérés tiennent dans la fenêtre de contexte d'un modèle de langage pour une requête RAG unique. Il tient compte des coûts fixes (prompt système, requête utilisateur, réserve de sortie) puis calcule le nombre maximal de chunks avec la formule de fenêtre glissante.
La formule est : max_chunks = 1 + floor((tokens_disponibles − taille_chunk) / (taille_chunk − chevauchement)). Où tokens_disponibles = contexte_effectif − tokens_prompt_système − tokens_requête − tokens_réserve_sortie, et contexte_effectif = fenêtre_contexte × (1 − marge_sécurité).
La plupart des systèmes RAG en production utilisent des chunks de 256 à 512 tokens. Des chunks plus petits améliorent la précision de récupération mais nécessitent plus de chunks pour couvrir un sujet. Une taille de 400 tokens avec 10 % de chevauchement est un point de départ courant.
Le chevauchement signifie que des chunks adjacents partagent des tokens à leurs frontières. Cela préserve la continuité des phrases et paragraphes : une information coupée entre deux chunks existe dans les deux, ce qui améliore le rappel. Un chevauchement typique représente 10-15 % de la taille du chunk.
Les LLM utilisent la même fenêtre de contexte pour l'entrée et la sortie. Si vous remplissez tout le contexte avec des tokens de prompt, le modèle n'a plus de place pour générer une réponse. Réservez toujours au moins 256-512 tokens pour des réponses courtes, davantage pour des sorties longues et structurées.
Une marge de sécurité réserve un pourcentage de la fenêtre de contexte comme marge pour la variance de tokenisation. Les comptages réels peuvent différer des estimations de quelques pourcents à cause des tokens de format de message et des différences de tokenizer. Une marge de 5-10 % évite les erreurs de dépassement en production.
La plupart des systèmes RAG récupèrent 3 à 8 chunks par requête. Moins de 3 peut manquer de diversité de contexte. Plus de 8 peut diluer la pertinence. Le nombre optimal dépend de votre cas d'usage : le Q&A factuel nécessite souvent 3-5 chunks, la synthèse documentaire peut profiter de 8-12.
Complètement. Le calculateur fonctionne entièrement dans votre navigateur. Taille de chunk, comptages de tokens, réglages de modèle et estimations de coût sont traités localement : rien n'est envoyé à un serveur. Votre configuration RAG reste 100 % privée.