Pular para o conteúdo
Aback Tools Logo

Calculadora de janela de contexto

Visualize como seu prompt de sistema, histórico da conversa, documentos RAG e mensagem do usuário preenchem a janela de contexto de um LLM. Adicione blocos personalizados, veja a utilização e a capacidade restante, compare sua carga em 16 modelos populares e estime os custos de entrada — grátis e 100 % privado no seu navegador.

Context Window Calculator

Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Context Slots

System Prompt
0.4%
Conversation History
1.6%
Retrieved Documents (RAG)
3.1%
User Message
0.4%
Output Reserve
0.8%

Add Slot

Context Window Utilization - GPT-4o

6.3% used
System Prompt500
Conversation History2,000
Retrieved Documents (RAG)4,000
User Message500
Output Reserve1,000
Free120,000

Used

8,000

Limit

128,000

Remaining

120,000

Input Cost

$0.0200

Slot Breakdown

SlotTokens% of WindowInput Cost
System Prompt
5000.39%$0.001250
Conversation History
2,0001.56%$0.005000
Retrieved Documents (RAG)
4,0003.13%$0.0100
User Message
5000.39%$0.001250
Output Reserve
1,0000.78%$0.002500
Total8,0006.25%$0.0200

Same Payload Across Models

ModelContext Window% UsedFits?
GPT-4oSelected128,0006.3% Yes
GPT-4o mini128,0006.3% Yes
o3200,0004.0% Yes
o4-mini200,0004.0% Yes
Claude 3.7 Sonnet200,0004.0% Yes
Claude 3.5 Haiku200,0004.0% Yes
Claude Opus 4200,0004.0% Yes
Gemini 2.5 Pro2,000,0000.4% Yes
Gemini 2.5 Flash1,000,0000.8% Yes
DeepSeek-V4-Flash1,048,5760.8% Yes
DeepSeek-V4-Pro1,048,5760.8% Yes
Grok 3131,0726.1% Yes
Grok 3 Mini131,0726.1% Yes
Mistral Large131,0726.1% Yes
Mistral Small131,0726.1% Yes
Codestral256,0003.1% Yes
Note: Token counts entered here are the billable input tokens for each slot. Actual tokenization may vary slightly by model and content type (code vs. prose vs. non-English text). Context window limits shown are the maximum prompt+response window; reserve tokens for your expected output length.

O que realmente ocupa sua janela de contexto

Em aplicações reais, o prompt de sistema e o histórico da conversa costumam consumir mais contexto do que os documentos que trazem a resposta. Visualizar em blocos expõe esse desequilíbrio.

Adicione um bloco por componente, informe seus tokens e observe a utilização total, a capacidade restante e se sua carga cabe em cada modelo.

  • A janela é compartilhada entre entrada e saída: o prompt nunca pode ocupá-la inteira.
  • O histórico da conversa cresce a cada turno e desloca documentos úteis.
  • O estouro é sinalizado em vermelho antes de chegar à API.

Orçar tokens para a resposta

O erro mais comum é calcular o prompt até o último token e esquecer a resposta. A reserva de saída faz parte do mesmo orçamento.

  • Reserve 1.000-4.000 tokens para respostas padrão.
  • Para código ou relatórios longos, reserve mais e reduza o prompt.
  • Se a reserva não couber, reduza histórico ou documentos, não a instrução crítica.

Comparar modelos antes de decidir

A mesma carga pode caber com folga em um modelo e estourar em outro. Comparar vários modelos evita trocar de fornecedor depois da implantação.

  1. Informe os blocos do seu prompt com seus tokens.
  2. Defina a reserva de saída que seu caso de uso exige.
  3. Veja a utilização resultante em cada modelo da lista.
  4. Escolha o modelo que deixa a folga necessária pelo menor custo de entrada.

Perguntas frequentes

É o número máximo de tokens que um modelo de linguagem processa em uma única requisição. Inclui todo o prompt (instruções de sistema, histórico da conversa, documentos recuperados e mensagem do usuário) mais a resposta gerada. Se o total exceder o limite, o modelo trunca ou rejeita a requisição.

A janela de contexto é o orçamento total de tokens de uma requisição, compartilhado entre entrada e saída. Os tokens máximos de saída são o tamanho máximo da resposta gerada. Por exemplo, com janela de 128.000 tokens e prompt de 120.000, sobram apenas 8.000 para a resposta. Sempre reserve espaço de saída ao planejar o prompt.

Cada bloco desta calculadora aceita diretamente uma contagem de tokens. Se você não souber o número exato, uma estimativa confiável é 1 token para cada ~3,8-4,0 caracteres em texto inglês, ou use nossa ferramenta de contagem de tokens a partir de texto colado. Em código, a proporção varia conforme a linguagem e a densidade de símbolos.

A maioria das APIs retorna erro (400 ou 413) se o prompt exceder o limite de contexto do modelo. Alguns modelos truncam silenciosamente os turnos mais antigos ou o início do prompt, causando comportamento inesperado. A calculadora destaca o estouro em vermelho para você detectar antes de chamar a API.

A janela de contexto é um orçamento compartilhado entre o prompt e a resposta do modelo. Se o prompt ocupar toda a janela, não sobra token para gerar a saída. A boa prática é reservar ao menos o tamanho máximo esperado da resposta — normalmente 1.000-4.000 tokens para respostas padrão, ou mais para gerações longas.

Em meados de 2026, o Gemini 2.5 Pro do Google oferece a maior janela, com 2.000.000 de tokens. Gemini 2.5 Flash e DeepSeek-V4-Flash suportam mais de 1.000.000 de tokens. Os modelos Claude da Anthropic e o3/o4-mini da OpenAI suportam 200.000 tokens. GPT-4o, Grok 3 e os modelos Mistral costumam oferecer 128.000-131.072 tokens.

Sim. A calculadora roda inteiramente no seu navegador. Rótulos dos blocos, contagens de tokens, escolha de modelo e todos os resultados são processados localmente no seu dispositivo e nunca enviados a servidor algum. Seus dados permanecem 100 % privados — sem cadastro, sem rastreamento, sem uploads.