Aller au contenu
Aback Tools Logo

Calculateur de fenêtre de contexte

Visualisez comment votre prompt système, l'historique de conversation, les documents RAG et le message utilisateur remplissent la fenêtre de contexte d'un LLM. Ajoutez des blocs personnalisés, consultez l'utilisation et la capacité restante, comparez votre charge utile sur 16 modèles populaires et estimez les coûts d'entrée – gratuit et 100 % privé dans votre navigateur.

Context Window Calculator

Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Context Slots

System Prompt
0.4%
Conversation History
1.6%
Retrieved Documents (RAG)
3.1%
User Message
0.4%
Output Reserve
0.8%

Add Slot

Context Window Utilization - GPT-4o

6.3% used
System Prompt500
Conversation History2,000
Retrieved Documents (RAG)4,000
User Message500
Output Reserve1,000
Free120,000

Used

8,000

Limit

128,000

Remaining

120,000

Input Cost

$0.0200

Slot Breakdown

SlotTokens% of WindowInput Cost
System Prompt
5000.39%$0.001250
Conversation History
2,0001.56%$0.005000
Retrieved Documents (RAG)
4,0003.13%$0.0100
User Message
5000.39%$0.001250
Output Reserve
1,0000.78%$0.002500
Total8,0006.25%$0.0200

Same Payload Across Models

ModelContext Window% UsedFits?
GPT-4oSelected128,0006.3% Yes
GPT-4o mini128,0006.3% Yes
o3200,0004.0% Yes
o4-mini200,0004.0% Yes
Claude 3.7 Sonnet200,0004.0% Yes
Claude 3.5 Haiku200,0004.0% Yes
Claude Opus 4200,0004.0% Yes
Gemini 2.5 Pro2,000,0000.4% Yes
Gemini 2.5 Flash1,000,0000.8% Yes
DeepSeek-V4-Flash1,048,5760.8% Yes
DeepSeek-V4-Pro1,048,5760.8% Yes
Grok 3131,0726.1% Yes
Grok 3 Mini131,0726.1% Yes
Mistral Large131,0726.1% Yes
Mistral Small131,0726.1% Yes
Codestral256,0003.1% Yes
Note: Token counts entered here are the billable input tokens for each slot. Actual tokenization may vary slightly by model and content type (code vs. prose vs. non-English text). Context window limits shown are the maximum prompt+response window; reserve tokens for your expected output length.

Ce qui occupe réellement votre fenêtre de contexte

Dans les applications réelles, le prompt système et l'historique de conversation consomment souvent plus de contexte que les documents qui apportent la réponse. La visualisation par blocs rend ce déséquilibre visible.

Ajoutez un bloc par composant, saisissez ses tokens et observez l'utilisation totale, la capacité restante et si votre charge utile tient dans chaque modèle.

  • La fenêtre est partagée entre entrée et sortie : le prompt ne peut jamais la remplir entièrement.
  • L'historique de conversation grossit à chaque tour et prend la place des documents utiles.
  • Le dépassement est signalé en rouge avant d'atteindre l'API.

Budgéter les tokens de la réponse

L'erreur fréquente est de calculer le prompt jusqu'au dernier token et d'oublier la réponse. La réserve de sortie fait partie du même budget.

  • Réservez 1 000-4 000 tokens pour des réponses standard.
  • Pour du code ou des rapports longs, réservez davantage et réduisez le prompt.
  • Si la réserve ne tient pas, réduisez l'historique ou les documents, pas l'instruction critique.

Comparer les modèles avant de décider

La même charge utile peut tenir largement dans un modèle et déborder dans un autre. Comparer plusieurs modèles évite de changer de fournisseur après le déploiement.

  1. Saisissez les blocs de votre prompt avec leurs tokens.
  2. Fixez la réserve de sortie nécessaire à votre cas d'usage.
  3. Observez l'utilisation résultante pour chaque modèle de la liste.
  4. Choisissez le modèle qui laisse la marge nécessaire au coût d'entrée le plus bas.

Foire aux questions

C'est le nombre maximal de tokens qu'un grand modèle de langage peut traiter dans une requête. Elle comprend tout le prompt (instructions système, historique de conversation, documents récupérés et message utilisateur) plus la réponse générée. Si le total dépasse la limite, le modèle tronque ou rejette la requête.

La fenêtre de contexte est le budget total de tokens d'une requête, partagé entre entrée et sortie. Les tokens de sortie max correspondent à la longueur maximale de la réponse générée. Par exemple, avec une fenêtre de 128 000 tokens et un prompt de 120 000 tokens, il ne reste que 8 000 tokens pour la réponse. Réservez toujours de l'espace de sortie.

Chaque bloc de ce calculateur accepte directement un nombre de tokens. Si vous ne connaissez pas le compte exact, une estimation fiable est 1 token pour ~3,8-4,0 caractères en prose anglaise, ou utilisez notre outil de comptage de tokens à partir de texte collé. Pour du code, le ratio varie selon le langage et la densité de symboles.

La plupart des API renvoient une erreur (400 ou 413) si le prompt dépasse la limite de contexte du modèle. Certains modèles tronquent silencieusement les tours les plus anciens ou le début du prompt, provoquant des comportements inattendus. Le calculateur met le dépassement en rouge pour que vous le repériez avant l'appel API.

La fenêtre de contexte est un budget partagé entre votre prompt et la réponse du modèle. Si le prompt remplit toute la fenêtre, il ne reste aucun token pour générer la sortie. La bonne pratique est de réserver au moins autant de tokens que la longueur maximale attendue – généralement 1 000-4 000 tokens, davantage pour les générations longues.

À la mi-2026, Gemini 2.5 Pro de Google offre la plus grande fenêtre avec 2 000 000 de tokens. Gemini 2.5 Flash et DeepSeek-V4-Flash supportent plus de 1 000 000 de tokens. Les modèles Claude d'Anthropic et o3/o4-mini d'OpenAI supportent 200 000 tokens. GPT-4o, Grok 3 et les modèles Mistral offrent généralement 128 000-131 072 tokens.

Oui. Le calculateur fonctionne entièrement dans votre navigateur. Libellés de blocs, comptages de tokens, choix de modèle et tous les résultats sont traités localement sur votre appareil et ne sont jamais envoyés à un serveur. Vos données restent 100 % privées – sans inscription, sans suivi, sans envoi.