Calculadora de empacotamento de contexto
Otimize gratuitamente quantos chunks de RAG cabem na janela de contexto de qualquer modelo. Configure tamanho do chunk, sobreposição, prompt de sistema, reserva de saída e margem de segurança para GPT, Claude, Gemini, DeepSeek, Llama e Mistral. Veja na hora o detalhamento completo de tokens, a barra de contexto e a comparação entre modelos.
Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.
Fixed Context Overhead
Chunk Configuration
Safety Buffer & Volume
Max Chunks That Fit
326
of 400-token chunks
Tokens for Chunks
114.2K
of 128.0K ctx window
Unused Tokens
0
headroom remaining
Context Window Breakdown - GPT-4o
| Slot | Tokens | % of Window | Notes |
|---|---|---|---|
| System Prompt | 400 | 0% | Fixed overhead |
| User Query | 150 | 0% | Fixed overhead |
| Retrieved Chunks | 114,150 | 89% | 326 × 400 tok |
| Output Reserve | 500 | 0% | Max response |
| Safety Buffer | 12,800 | 10% | 10% headroom |
| Unused / Slack | 0 | 0% | Free headroom |
Monthly RAG Query Cost - 30,000 requests
Per Query (Input)
$0.2880
Per Query (Output)
$0.005000
Total Per Query
$0.2930
Chunks That Fit - All Models
Sorted by most chunks first| Model | Context | Max Chunks | Monthly Cost | Min Met? |
|---|---|---|---|---|
GoogleGemini 2.5 ProCapable | 2.0M | 5,139 | $67,640.62 | Yes |
OpenAIGPT-5.4Capable | 1.0M | 2,568 | $67,792.50 | Yes |
GoogleGemini 2.5 FlashBudget | 1.0M | 2,568 | $8,136.60 | Yes |
GoogleGemini 3.5 FlashBudget | 1.0M | 2,568 | $40,630.50 | Yes |
DeepSeekDeepSeek V4 ProBudget | 1.0M | 2,568 | $11,756.75 | Yes |
DeepSeekDeepSeek V4 FlashBudget | 1.0M | 2,568 | $3,783.78 | Yes |
MetaLlama 4 MaverickBudget | 524.0K | 1,344 | $3,125.10 | Yes |
OpenAIo3 (Reasoning) | 200.0K | 511 | $10,917.00 | Yes |
AnthropicClaude Sonnet 4.6Capable | 200.0K | 511 | $16,420.50 | Yes |
AnthropicClaude Haiku 4.5Budget | 200.0K | 511 | $5,473.50 | Yes |
AnthropicClaude Opus 4.8Capable | 200.0K | 511 | $27,367.50 | Yes |
MistralMistral Large | 131.1K | 333 | $7,149.00 | Yes |
MistralMistral SmallBudget | 131.1K | 333 | $357.45 | Yes |
OpenAIGPT-4o Selected | 128.0K | 326 | $8,790.00 | Yes |
OpenAIGPT-4o MiniBudget | 128.0K | 326 | $527.40 | Yes |
O que consome o orçamento de tokens de uma consulta
A janela de contexto não fica disponível apenas para os chunks recuperados. O prompt de sistema, a consulta do usuário, a formatação das mensagens e a resposta esperada consomem orçamento antes de qualquer documento entrar.
Informe o tamanho da janela, os tokens fixos e o tamanho do chunk para ver quantos chunks realmente cabem e quanto contexto fica sem uso.
- Contexto efetivo = janela de contexto × (1 − margem de segurança).
- Disponível = contexto efetivo − prompt de sistema − consulta − reserva de saída.
- Máximo de chunks = 1 + floor((disponível − tamanho) / (tamanho − sobreposição)).
Equilibrar chunks e estrutura
Um chunk menor cabe mais vezes, mas traz menos contexto. Um chunk maior traz mais contexto por unidade, mas reduz quantos documentos distintos você consegue incluir.
- Recuperar de 3 a 8 chunks por consulta é o padrão em produção.
- Sobreposição de 10-15 % preserva a continuidade entre limites.
- Reservar poucos tokens de saída é a causa mais comum de truncamento.
Ajustar o sistema passo a passo
Comece pelo modelo e pela janela de contexto, então ajuste o tamanho do chunk até caberem documentos relevantes suficientes com reserva de saída confortável.
- Selecione o modelo e defina a margem de segurança para obter o contexto efetivo.
- Subtraia os tokens do prompt de sistema, da consulta e da reserva de saída.
- Ajuste tamanho do chunk e sobreposição até alcançar o número de chunks necessário.
- Confira o detalhamento de tokens e compare com outro modelo antes de implantar.
Perguntas frequentes
Ela determina quantos chunks de documentos recuperados cabem na janela de contexto de um modelo de linguagem para uma única consulta RAG. Considera custos fixos como prompt de sistema, consulta do usuário e reserva de saída, e então calcula o número máximo de chunks pela fórmula da janela deslizante.
A fórmula é: max_chunks = 1 + floor((tokens_disponíveis − tamanho_chunk) / (tamanho_chunk − sobreposição)). Onde tokens_disponíveis = contexto_efetivo − tokens_prompt_sistema − tokens_consulta − tokens_reserva_saída, e contexto_efetivo = janela_contexto × (1 − margem_segurança).
A maioria dos sistemas RAG em produção usa chunks entre 256 e 512 tokens. Chunks menores melhoram a precisão da recuperação, mas exigem mais chunks para cobrir um tema. Um tamanho de 400 tokens com 10 % de sobreposição é um ponto de partida comum para RAG de uso geral.
Sobreposição significa que chunks adjacentes compartilham alguns tokens nas fronteiras. Isso preserva a continuidade de frases e parágrafos: informação cortada entre limites fica disponível nos dois chunks, melhorando a revocação. A sobreposição típica é de 10-15 % do tamanho do chunk.
Os LLMs usam a mesma janela de contexto para entrada e saída. Se você preencher todo o contexto com tokens de prompt, o modelo não tem espaço para gerar a resposta. Reserve sempre ao menos 256-512 tokens para respostas curtas, ou mais para saídas longas e estruturadas.
A margem de segurança reserva um percentual da janela de contexto como folga para variação de tokenização. Contagens reais podem diferir das estimativas em alguns pontos percentuais por causa de tokens de formato de mensagem e diferenças entre tokenizadores. Uma margem de 5-10 % evita erros de estouro em produção.
A maioria dos sistemas RAG recupera de 3 a 8 chunks por consulta. Menos de 3 pode não dar contexto diverso o suficiente. Mais de 8 pode diluir a relevância. O número ideal depende do caso de uso: perguntas factuais normalmente precisam de 3-5 chunks, enquanto a síntese de documentos pode se beneficiar de 8-12.
Completamente. A calculadora roda inteiramente no seu navegador. Tamanho de chunk, contagens de tokens, configurações de modelo e estimativas de custo são processados localmente: nada é enviado a servidor algum. A configuração do seu pipeline RAG permanece 100 % privada.