Pular para o conteúdo
Aback Tools Logo

Calculadora de uso de contexto

Analise quanto da janela de contexto de um modelo é consumido pelos seus dados de entrada — online, grátis e 100 % privado. Divida seu prompt em segmentos nomeados (prompt de sistema, histórico, documentos, mensagem do usuário), defina uma reserva de saída e veja na hora a divisão percentual por segmento em GPT-4o, Claude, Gemini, Mistral, DeepSeek e mais.

Context Usage Calculator

Break your prompt into named components - system prompt, conversation history, retrieved documents, user message - and instantly see how much of the selected model's context window each part consumes. Supports all major LLMs with live percentage breakdowns.

Context: 128,000 tokens~3.8 chars/tokenInput/1M: $2.50
~500 tok(0.4%)
~3,000 tok(2.3%)
~8,000 tok(6.3%)
~200 tok(0.2%)

Reserve space for the model's reply. Most responses use 500-4,000 tokens. Instruction tasks average ~1,000; code generation averages ~2,000.

Context Window Breakdown - GPT-4o

13,700 used (11%)128,000 total
Overall context fill10.7% used

Segment Breakdown

SegmentTokens% of Context% of InputInput Cost
System Prompt
~5000%4%$0.001250
Conversation History
~3,0002%26%$0.007500
Retrieved Documents
~8,0006%68%$0.0200
User Message
~2000%2%$0.000500
Output Reserve
~2,0002%--
Total~13,70010.7%-$0.0293

Input Tokens

~11,700

Context Remaining

114,300

Context Used

10.7%

Input Cost

$0.0293

Estimation note:Token counts are calculated using each model family's average characters-per-token ratio (~3.8-4.0 for English prose). Actual counts from provider tokenizers (tiktoken, SentencePiece, etc.) may vary by ±5-10%. Code, non-English text, and special characters typically tokenize differently. For exact counts use the provider's official tokenizer.

O que o preenchimento de contexto esconde

Saber que um prompt ocupa 70 % da janela não diz nada sobre qual parte agrega valor. A divisão por segmento revela se o histórico da conversa está empurrando os documentos recuperados para fora ou se o prompt de sistema ficou desproporcional.

Adicione um segmento para cada componente do prompt e informe seus tokens para ver o percentual de cada um e a capacidade real restante.

  • Sempre separe prompt de sistema, histórico, documentos e mensagem do usuário.
  • Cada token de contexto custa API em toda requisição, não apenas uma vez.
  • Reservar tokens de saída evita erros por prompt longo demais.

O efeito «perdido no meio»

Contextos longos não são tratados de forma uniforme. A informação no centro tende a pesar menos na resposta, mesmo quando o modelo tem acesso a ela.

  • Coloque instruções críticas no começo e no fim do prompt.
  • Mantenha o preenchimento abaixo de 80 % quando a recuperação importa.
  • Reduza o histórico da conversa antes de cortar documentos recuperados.

Ajustar o prompt com dados

Medir por segmento transforma o ajuste de prompt em decisão informada, em vez de cortar às cegas quando surge um erro de contexto.

  1. Cole ou estime o tamanho de cada segmento do prompt.
  2. Confira o percentual de cada um e encontre o maior consumidor.
  3. Reduza o segmento dominante e veja novamente o preenchimento total.
  4. Repita com outros modelos para ver quanta folga você ganha ou perde.

Perguntas frequentes

É uma ferramenta que mostra quanto da janela de contexto de um modelo de linguagem é consumido pelos seus dados de entrada, dividido por segmento. Você define os componentes do prompt (instruções de sistema, histórico da conversa, documentos recuperados, mensagem do usuário) e a calculadora mostra a contagem de tokens de cada um, o percentual da janela total e a contribuição para o custo de API. Ajuda a projetar prompts que caibam com segurança nos limites do modelo.

A janela de contexto é o número máximo de tokens que um LLM processa em uma única requisição, incluindo todo o prompt, o histórico da conversa, os documentos e a resposta gerada. Se sua entrada exceder a janela, o modelo trunca a entrada ou rejeita a requisição com erro. Monitorar o uso do contexto é essencial em chatbots multi-turno, pipelines RAG e qualquer aplicação que envie documentos grandes a um modelo.

As estimativas são precisas dentro de ±5-10 % para prosa em inglês típica, usando a proporção média de caracteres por token publicada de cada família de modelos. Textos em outros idiomas, código com muitos símbolos e conteúdo com muita pontuação podem tokenizar diferente. Para contagens exatas em produção, use o tokenizador oficial do fornecedor (tiktoken da OpenAI, countTokens da Anthropic, API countTokens do Google).

Sim. Cada linha de segmento tem um seletor de unidade para alternar entre tokens, caracteres e palavras. A calculadora converte caracteres e palavras em tokens estimados automaticamente com a proporção do modelo selecionado. Isso é útil quando você sabe a contagem de caracteres de um documento ou de palavras de um trecho, mas não passou por um tokenizador.

Ele subtrai um número fixo de tokens do contexto disponível para considerar a resposta do modelo. Como a janela precisa acomodar entrada e saída, é importante manter folga suficiente. Reservas típicas são de 500-1.000 tokens para respostas curtas, 2.000 para geração de código e 4.000+ para relatórios longos.

Pesquisas e a experiência prática mostram que modelos com contextos muito longos tendem a dar menos peso à informação no meio da janela — o fenômeno «lost in the middle». Para melhor desempenho de recuperação, mantenha instruções críticas no início e no fim do prompt e busque ficar abaixo de 80 % de preenchimento.

Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador. O texto do prompt, os tamanhos dos segmentos e a análise de uso são calculados localmente no seu dispositivo e nunca enviados a servidor algum. Você pode colar com segurança documentos confidenciais, código proprietário e instruções sensíveis.