Calculadora de uso de contexto
Analise quanto da janela de contexto de um modelo é consumido pelos seus dados de entrada — online, grátis e 100 % privado. Divida seu prompt em segmentos nomeados (prompt de sistema, histórico, documentos, mensagem do usuário), defina uma reserva de saída e veja na hora a divisão percentual por segmento em GPT-4o, Claude, Gemini, Mistral, DeepSeek e mais.
Break your prompt into named components - system prompt, conversation history, retrieved documents, user message - and instantly see how much of the selected model's context window each part consumes. Supports all major LLMs with live percentage breakdowns.
Reserve space for the model's reply. Most responses use 500-4,000 tokens. Instruction tasks average ~1,000; code generation averages ~2,000.
Context Window Breakdown - GPT-4o
Segment Breakdown
| Segment | Tokens | % of Context | % of Input | Input Cost |
|---|---|---|---|---|
System Prompt | ~500 | 0% | 4% | $0.001250 |
Conversation History | ~3,000 | 2% | 26% | $0.007500 |
Retrieved Documents | ~8,000 | 6% | 68% | $0.0200 |
User Message | ~200 | 0% | 2% | $0.000500 |
Output Reserve | ~2,000 | 2% | - | - |
| Total | ~13,700 | 10.7% | - | $0.0293 |
Input Tokens
~11,700
Context Remaining
114,300
Context Used
10.7%
Input Cost
$0.0293
O que o preenchimento de contexto esconde
Saber que um prompt ocupa 70 % da janela não diz nada sobre qual parte agrega valor. A divisão por segmento revela se o histórico da conversa está empurrando os documentos recuperados para fora ou se o prompt de sistema ficou desproporcional.
Adicione um segmento para cada componente do prompt e informe seus tokens para ver o percentual de cada um e a capacidade real restante.
- Sempre separe prompt de sistema, histórico, documentos e mensagem do usuário.
- Cada token de contexto custa API em toda requisição, não apenas uma vez.
- Reservar tokens de saída evita erros por prompt longo demais.
O efeito «perdido no meio»
Contextos longos não são tratados de forma uniforme. A informação no centro tende a pesar menos na resposta, mesmo quando o modelo tem acesso a ela.
- Coloque instruções críticas no começo e no fim do prompt.
- Mantenha o preenchimento abaixo de 80 % quando a recuperação importa.
- Reduza o histórico da conversa antes de cortar documentos recuperados.
Ajustar o prompt com dados
Medir por segmento transforma o ajuste de prompt em decisão informada, em vez de cortar às cegas quando surge um erro de contexto.
- Cole ou estime o tamanho de cada segmento do prompt.
- Confira o percentual de cada um e encontre o maior consumidor.
- Reduza o segmento dominante e veja novamente o preenchimento total.
- Repita com outros modelos para ver quanta folga você ganha ou perde.
Perguntas frequentes
É uma ferramenta que mostra quanto da janela de contexto de um modelo de linguagem é consumido pelos seus dados de entrada, dividido por segmento. Você define os componentes do prompt (instruções de sistema, histórico da conversa, documentos recuperados, mensagem do usuário) e a calculadora mostra a contagem de tokens de cada um, o percentual da janela total e a contribuição para o custo de API. Ajuda a projetar prompts que caibam com segurança nos limites do modelo.
A janela de contexto é o número máximo de tokens que um LLM processa em uma única requisição, incluindo todo o prompt, o histórico da conversa, os documentos e a resposta gerada. Se sua entrada exceder a janela, o modelo trunca a entrada ou rejeita a requisição com erro. Monitorar o uso do contexto é essencial em chatbots multi-turno, pipelines RAG e qualquer aplicação que envie documentos grandes a um modelo.
As estimativas são precisas dentro de ±5-10 % para prosa em inglês típica, usando a proporção média de caracteres por token publicada de cada família de modelos. Textos em outros idiomas, código com muitos símbolos e conteúdo com muita pontuação podem tokenizar diferente. Para contagens exatas em produção, use o tokenizador oficial do fornecedor (tiktoken da OpenAI, countTokens da Anthropic, API countTokens do Google).
Sim. Cada linha de segmento tem um seletor de unidade para alternar entre tokens, caracteres e palavras. A calculadora converte caracteres e palavras em tokens estimados automaticamente com a proporção do modelo selecionado. Isso é útil quando você sabe a contagem de caracteres de um documento ou de palavras de um trecho, mas não passou por um tokenizador.
Ele subtrai um número fixo de tokens do contexto disponível para considerar a resposta do modelo. Como a janela precisa acomodar entrada e saída, é importante manter folga suficiente. Reservas típicas são de 500-1.000 tokens para respostas curtas, 2.000 para geração de código e 4.000+ para relatórios longos.
Pesquisas e a experiência prática mostram que modelos com contextos muito longos tendem a dar menos peso à informação no meio da janela — o fenômeno «lost in the middle». Para melhor desempenho de recuperação, mantenha instruções críticas no início e no fim do prompt e busque ficar abaixo de 80 % de preenchimento.
Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador. O texto do prompt, os tamanhos dos segmentos e a análise de uso são calculados localmente no seu dispositivo e nunca enviados a servidor algum. Você pode colar com segurança documentos confidenciais, código proprietário e instruções sensíveis.