Calculateur d'usage du contexte
Analysez la part de la fenêtre de contexte d'un modèle consommée par vos données d'entrée – en ligne, gratuit et 100 % privé. Décomposez votre prompt en segments nommés (prompt système, historique, documents, message utilisateur), définissez une réserve de sortie et obtenez instantanément les pourcentages par segment sur GPT-4o, Claude, Gemini, Mistral, DeepSeek et plus.
Break your prompt into named components - system prompt, conversation history, retrieved documents, user message - and instantly see how much of the selected model's context window each part consumes. Supports all major LLMs with live percentage breakdowns.
Reserve space for the model's reply. Most responses use 500-4,000 tokens. Instruction tasks average ~1,000; code generation averages ~2,000.
Context Window Breakdown - GPT-4o
Segment Breakdown
| Segment | Tokens | % of Context | % of Input | Input Cost |
|---|---|---|---|---|
System Prompt | ~500 | 0% | 4% | $0.001250 |
Conversation History | ~3,000 | 2% | 26% | $0.007500 |
Retrieved Documents | ~8,000 | 6% | 68% | $0.0200 |
User Message | ~200 | 0% | 2% | $0.000500 |
Output Reserve | ~2,000 | 2% | - | - |
| Total | ~13,700 | 10.7% | - | $0.0293 |
Input Tokens
~11,700
Context Remaining
114,300
Context Used
10.7%
Input Cost
$0.0293
Ce que le remplissage de contexte cache
Savoir qu'un prompt occupe 70 % de la fenêtre ne dit rien sur ce qui apporte de la valeur. La décomposition par segment révèle si l'historique de conversation prend la place des documents récupérés ou si le prompt système est devenu démesuré.
Ajoutez un segment par composant de votre prompt et indiquez leurs tokens pour voir le pourcentage de chacun et la capacité réelle restante.
- Séparez toujours prompt système, historique, documents et message utilisateur.
- Chaque token de contexte coûte de l'API à chaque requête, pas une seule fois.
- Réserver des tokens de sortie évite les erreurs de prompt trop long.
L'effet « perdu au milieu »
Les longs contextes ne sont pas traités uniformément. L'information située au centre pèse généralement moins dans la réponse, même lorsque le modèle y a accès.
- Placez les instructions critiques au début et à la fin du prompt.
- Gardez un remplissage sous 80 % lorsque la récupération compte.
- Réduisez d'abord l'historique de conversation avant de couper les documents.
Ajuster le prompt avec des données
Mesurer segment par segment transforme l'ajustement du prompt en décision informée, au lieu de couper à l'aveugle à chaque erreur de contexte.
- Collez ou estimez la taille de chaque segment de votre prompt.
- Vérifiez le pourcentage de chacun et identifiez le plus gros consommateur.
- Réduisez le segment dominant et observez le nouveau remplissage total.
- Répétez avec d'autres modèles pour voir la marge gagnée ou perdue.
Foire aux questions
C'est un outil qui montre la part de la fenêtre de contexte d'un modèle de langage consommée par vos données d'entrée, répartie par segment. Vous définissez les composants de votre prompt (instructions système, historique de conversation, documents récupérés, message utilisateur) et le calculateur affiche le nombre de tokens de chacun, son pourcentage de la fenêtre totale et sa contribution au coût API. Il aide à concevoir des prompts qui tiennent de façon fiable dans les limites du modèle.
La fenêtre de contexte est le nombre maximal de tokens qu'un LLM peut traiter dans une seule requête – prompt complet, historique de conversation, documents et réponse générée inclus. Si votre entrée dépasse la fenêtre, le modèle tronque l'entrée ou rejette la requête avec une erreur. Surveiller l'usage du contexte est essentiel pour les chatbots multi-tours, les pipelines RAG et toute application envoyant de gros documents.
Les estimations sont précises à ±5-10 % pour de la prose anglaise typique, en utilisant le ratio moyen de caractères par token publié pour chaque famille de modèles. Les textes non anglais, le code dense en symboles et les contenus très ponctués peuvent se tokeniser différemment. Pour des comptages exacts en production, utilisez le tokenizer officiel du fournisseur (tiktoken d'OpenAI, countTokens d'Anthropic, API countTokens de Google).
Oui. Chaque ligne de segment dispose d'un sélecteur d'unité permettant de basculer entre tokens, caractères et mots. Le calculateur convertit automatiquement caractères et mots en estimation de tokens avec le ratio du modèle sélectionné. Utile lorsque vous connaissez le nombre de caractères d'un document ou de mots d'un passage sans l'avoir passé dans un tokenizer.
Il soustrait un nombre fixe de tokens du contexte disponible pour tenir compte de la réponse du modèle. La fenêtre devant accueillir l'entrée et la sortie, il faut garder une marge suffisante. Les réserves typiques sont de 500-1 000 tokens pour des réponses courtes, 2 000 pour la génération de code et 4 000+ pour des rapports longs.
Les recherches et l'expérience terrain montrent que les modèles à très long contexte ont tendance à sous-pondérer l'information située au milieu de la fenêtre – phénomène dit « lost in the middle ». Pour de meilleures performances de récupération, placez les instructions critiques au début et à la fin du prompt et visez un remplissage inférieur à 80 %.
Oui. Le calculateur fonctionne entièrement côté client dans votre navigateur. Le texte du prompt, les tailles de segments et l'analyse d'usage sont calculés localement sur votre appareil et ne sont jamais envoyés à un serveur. Vous pouvez coller en toute sécurité des documents confidentiels, du code propriétaire et des instructions sensibles.