Calculadora de janela de contexto
Visualize como seu prompt de sistema, histórico da conversa, documentos RAG e mensagem do usuário preenchem a janela de contexto de um LLM. Adicione blocos personalizados, veja a utilização e a capacidade restante, compare sua carga em 16 modelos populares e estime os custos de entrada — grátis e 100 % privado no seu navegador.
Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.
Context Slots
Add Slot
Context Window Utilization - GPT-4o
6.3% usedUsed
8,000
Limit
128,000
Remaining
120,000
Input Cost
$0.0200
Slot Breakdown
| Slot | Tokens | % of Window | Input Cost |
|---|---|---|---|
System Prompt | 500 | 0.39% | $0.001250 |
Conversation History | 2,000 | 1.56% | $0.005000 |
Retrieved Documents (RAG) | 4,000 | 3.13% | $0.0100 |
User Message | 500 | 0.39% | $0.001250 |
Output Reserve | 1,000 | 0.78% | $0.002500 |
| Total | 8,000 | 6.25% | $0.0200 |
Same Payload Across Models
| Model | Context Window | % Used | Fits? |
|---|---|---|---|
| GPT-4oSelected | 128,000 | 6.3% | Yes |
| GPT-4o mini | 128,000 | 6.3% | Yes |
| o3 | 200,000 | 4.0% | Yes |
| o4-mini | 200,000 | 4.0% | Yes |
| Claude 3.7 Sonnet | 200,000 | 4.0% | Yes |
| Claude 3.5 Haiku | 200,000 | 4.0% | Yes |
| Claude Opus 4 | 200,000 | 4.0% | Yes |
| Gemini 2.5 Pro | 2,000,000 | 0.4% | Yes |
| Gemini 2.5 Flash | 1,000,000 | 0.8% | Yes |
| DeepSeek-V4-Flash | 1,048,576 | 0.8% | Yes |
| DeepSeek-V4-Pro | 1,048,576 | 0.8% | Yes |
| Grok 3 | 131,072 | 6.1% | Yes |
| Grok 3 Mini | 131,072 | 6.1% | Yes |
| Mistral Large | 131,072 | 6.1% | Yes |
| Mistral Small | 131,072 | 6.1% | Yes |
| Codestral | 256,000 | 3.1% | Yes |
O que realmente ocupa sua janela de contexto
Em aplicações reais, o prompt de sistema e o histórico da conversa costumam consumir mais contexto do que os documentos que trazem a resposta. Visualizar em blocos expõe esse desequilíbrio.
Adicione um bloco por componente, informe seus tokens e observe a utilização total, a capacidade restante e se sua carga cabe em cada modelo.
- A janela é compartilhada entre entrada e saída: o prompt nunca pode ocupá-la inteira.
- O histórico da conversa cresce a cada turno e desloca documentos úteis.
- O estouro é sinalizado em vermelho antes de chegar à API.
Orçar tokens para a resposta
O erro mais comum é calcular o prompt até o último token e esquecer a resposta. A reserva de saída faz parte do mesmo orçamento.
- Reserve 1.000-4.000 tokens para respostas padrão.
- Para código ou relatórios longos, reserve mais e reduza o prompt.
- Se a reserva não couber, reduza histórico ou documentos, não a instrução crítica.
Comparar modelos antes de decidir
A mesma carga pode caber com folga em um modelo e estourar em outro. Comparar vários modelos evita trocar de fornecedor depois da implantação.
- Informe os blocos do seu prompt com seus tokens.
- Defina a reserva de saída que seu caso de uso exige.
- Veja a utilização resultante em cada modelo da lista.
- Escolha o modelo que deixa a folga necessária pelo menor custo de entrada.
Perguntas frequentes
É o número máximo de tokens que um modelo de linguagem processa em uma única requisição. Inclui todo o prompt (instruções de sistema, histórico da conversa, documentos recuperados e mensagem do usuário) mais a resposta gerada. Se o total exceder o limite, o modelo trunca ou rejeita a requisição.
A janela de contexto é o orçamento total de tokens de uma requisição, compartilhado entre entrada e saída. Os tokens máximos de saída são o tamanho máximo da resposta gerada. Por exemplo, com janela de 128.000 tokens e prompt de 120.000, sobram apenas 8.000 para a resposta. Sempre reserve espaço de saída ao planejar o prompt.
Cada bloco desta calculadora aceita diretamente uma contagem de tokens. Se você não souber o número exato, uma estimativa confiável é 1 token para cada ~3,8-4,0 caracteres em texto inglês, ou use nossa ferramenta de contagem de tokens a partir de texto colado. Em código, a proporção varia conforme a linguagem e a densidade de símbolos.
A maioria das APIs retorna erro (400 ou 413) se o prompt exceder o limite de contexto do modelo. Alguns modelos truncam silenciosamente os turnos mais antigos ou o início do prompt, causando comportamento inesperado. A calculadora destaca o estouro em vermelho para você detectar antes de chamar a API.
A janela de contexto é um orçamento compartilhado entre o prompt e a resposta do modelo. Se o prompt ocupar toda a janela, não sobra token para gerar a saída. A boa prática é reservar ao menos o tamanho máximo esperado da resposta — normalmente 1.000-4.000 tokens para respostas padrão, ou mais para gerações longas.
Em meados de 2026, o Gemini 2.5 Pro do Google oferece a maior janela, com 2.000.000 de tokens. Gemini 2.5 Flash e DeepSeek-V4-Flash suportam mais de 1.000.000 de tokens. Os modelos Claude da Anthropic e o3/o4-mini da OpenAI suportam 200.000 tokens. GPT-4o, Grok 3 e os modelos Mistral costumam oferecer 128.000-131.072 tokens.
Sim. A calculadora roda inteiramente no seu navegador. Rótulos dos blocos, contagens de tokens, escolha de modelo e todos os resultados são processados localmente no seu dispositivo e nunca enviados a servidor algum. Seus dados permanecem 100 % privados — sem cadastro, sem rastreamento, sem uploads.