Calculateur de fenêtre de contexte
Visualisez comment votre prompt système, l'historique de conversation, les documents RAG et le message utilisateur remplissent la fenêtre de contexte d'un LLM. Ajoutez des blocs personnalisés, consultez l'utilisation et la capacité restante, comparez votre charge utile sur 16 modèles populaires et estimez les coûts d'entrée – gratuit et 100 % privé dans votre navigateur.
Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.
Context Slots
Add Slot
Context Window Utilization - GPT-4o
6.3% usedUsed
8,000
Limit
128,000
Remaining
120,000
Input Cost
$0.0200
Slot Breakdown
| Slot | Tokens | % of Window | Input Cost |
|---|---|---|---|
System Prompt | 500 | 0.39% | $0.001250 |
Conversation History | 2,000 | 1.56% | $0.005000 |
Retrieved Documents (RAG) | 4,000 | 3.13% | $0.0100 |
User Message | 500 | 0.39% | $0.001250 |
Output Reserve | 1,000 | 0.78% | $0.002500 |
| Total | 8,000 | 6.25% | $0.0200 |
Same Payload Across Models
| Model | Context Window | % Used | Fits? |
|---|---|---|---|
| GPT-4oSelected | 128,000 | 6.3% | Yes |
| GPT-4o mini | 128,000 | 6.3% | Yes |
| o3 | 200,000 | 4.0% | Yes |
| o4-mini | 200,000 | 4.0% | Yes |
| Claude 3.7 Sonnet | 200,000 | 4.0% | Yes |
| Claude 3.5 Haiku | 200,000 | 4.0% | Yes |
| Claude Opus 4 | 200,000 | 4.0% | Yes |
| Gemini 2.5 Pro | 2,000,000 | 0.4% | Yes |
| Gemini 2.5 Flash | 1,000,000 | 0.8% | Yes |
| DeepSeek-V4-Flash | 1,048,576 | 0.8% | Yes |
| DeepSeek-V4-Pro | 1,048,576 | 0.8% | Yes |
| Grok 3 | 131,072 | 6.1% | Yes |
| Grok 3 Mini | 131,072 | 6.1% | Yes |
| Mistral Large | 131,072 | 6.1% | Yes |
| Mistral Small | 131,072 | 6.1% | Yes |
| Codestral | 256,000 | 3.1% | Yes |
Ce qui occupe réellement votre fenêtre de contexte
Dans les applications réelles, le prompt système et l'historique de conversation consomment souvent plus de contexte que les documents qui apportent la réponse. La visualisation par blocs rend ce déséquilibre visible.
Ajoutez un bloc par composant, saisissez ses tokens et observez l'utilisation totale, la capacité restante et si votre charge utile tient dans chaque modèle.
- La fenêtre est partagée entre entrée et sortie : le prompt ne peut jamais la remplir entièrement.
- L'historique de conversation grossit à chaque tour et prend la place des documents utiles.
- Le dépassement est signalé en rouge avant d'atteindre l'API.
Budgéter les tokens de la réponse
L'erreur fréquente est de calculer le prompt jusqu'au dernier token et d'oublier la réponse. La réserve de sortie fait partie du même budget.
- Réservez 1 000-4 000 tokens pour des réponses standard.
- Pour du code ou des rapports longs, réservez davantage et réduisez le prompt.
- Si la réserve ne tient pas, réduisez l'historique ou les documents, pas l'instruction critique.
Comparer les modèles avant de décider
La même charge utile peut tenir largement dans un modèle et déborder dans un autre. Comparer plusieurs modèles évite de changer de fournisseur après le déploiement.
- Saisissez les blocs de votre prompt avec leurs tokens.
- Fixez la réserve de sortie nécessaire à votre cas d'usage.
- Observez l'utilisation résultante pour chaque modèle de la liste.
- Choisissez le modèle qui laisse la marge nécessaire au coût d'entrée le plus bas.
Foire aux questions
C'est le nombre maximal de tokens qu'un grand modèle de langage peut traiter dans une requête. Elle comprend tout le prompt (instructions système, historique de conversation, documents récupérés et message utilisateur) plus la réponse générée. Si le total dépasse la limite, le modèle tronque ou rejette la requête.
La fenêtre de contexte est le budget total de tokens d'une requête, partagé entre entrée et sortie. Les tokens de sortie max correspondent à la longueur maximale de la réponse générée. Par exemple, avec une fenêtre de 128 000 tokens et un prompt de 120 000 tokens, il ne reste que 8 000 tokens pour la réponse. Réservez toujours de l'espace de sortie.
Chaque bloc de ce calculateur accepte directement un nombre de tokens. Si vous ne connaissez pas le compte exact, une estimation fiable est 1 token pour ~3,8-4,0 caractères en prose anglaise, ou utilisez notre outil de comptage de tokens à partir de texte collé. Pour du code, le ratio varie selon le langage et la densité de symboles.
La plupart des API renvoient une erreur (400 ou 413) si le prompt dépasse la limite de contexte du modèle. Certains modèles tronquent silencieusement les tours les plus anciens ou le début du prompt, provoquant des comportements inattendus. Le calculateur met le dépassement en rouge pour que vous le repériez avant l'appel API.
La fenêtre de contexte est un budget partagé entre votre prompt et la réponse du modèle. Si le prompt remplit toute la fenêtre, il ne reste aucun token pour générer la sortie. La bonne pratique est de réserver au moins autant de tokens que la longueur maximale attendue – généralement 1 000-4 000 tokens, davantage pour les générations longues.
À la mi-2026, Gemini 2.5 Pro de Google offre la plus grande fenêtre avec 2 000 000 de tokens. Gemini 2.5 Flash et DeepSeek-V4-Flash supportent plus de 1 000 000 de tokens. Les modèles Claude d'Anthropic et o3/o4-mini d'OpenAI supportent 200 000 tokens. GPT-4o, Grok 3 et les modèles Mistral offrent généralement 128 000-131 072 tokens.
Oui. Le calculateur fonctionne entièrement dans votre navigateur. Libellés de blocs, comptages de tokens, choix de modèle et tous les résultats sont traités localement sur votre appareil et ne sont jamais envoyés à un serveur. Vos données restent 100 % privées – sans inscription, sans suivi, sans envoi.