Pular para o conteúdo
Aback Tools Logo

Calculadora de empacotamento de contexto

Otimize gratuitamente quantos chunks de RAG cabem na janela de contexto de qualquer modelo. Configure tamanho do chunk, sobreposição, prompt de sistema, reserva de saída e margem de segurança para GPT, Claude, Gemini, DeepSeek, Llama e Mistral. Veja na hora o detalhamento completo de tokens, a barra de contexto e a comparação entre modelos.

Context Packing Calculator

Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Fixed Context Overhead

tokens
tokens
tokens
Fixed overhead: 1,050 tokens (1% of context)

Chunk Configuration

tokens
tokens
chunks

Safety Buffer & Volume

%
reqs

Max Chunks That Fit

326

of 400-token chunks

Tokens for Chunks

114.2K

of 128.0K ctx window

Unused Tokens

0

headroom remaining

Context Window Breakdown - GPT-4o

System (400)Query (150)Chunks (114.2K)Output (500)Buffer (12.8K)Unused (0)
Used: 115.2K (90%)Effective: 115.2KLimit: 128.0K
SlotTokens% of WindowNotes
System Prompt4000%Fixed overhead
User Query1500%Fixed overhead
Retrieved Chunks114,15089%326 × 400 tok
Output Reserve5000%Max response
Safety Buffer12,80010%10% headroom
Unused / Slack00%Free headroom

Monthly RAG Query Cost - 30,000 requests

$8,790.00GPT-4o

Per Query (Input)

$0.2880

Per Query (Output)

$0.005000

Total Per Query

$0.2930

Chunks That Fit - All Models

Sorted by most chunks first
ModelContextMax ChunksMonthly CostMin Met?
GoogleGemini 2.5 ProCapable
2.0M5,139$67,640.62 Yes
OpenAIGPT-5.4Capable
1.0M2,568$67,792.50 Yes
GoogleGemini 2.5 FlashBudget
1.0M2,568$8,136.60 Yes
GoogleGemini 3.5 FlashBudget
1.0M2,568$40,630.50 Yes
DeepSeekDeepSeek V4 ProBudget
1.0M2,568$11,756.75 Yes
DeepSeekDeepSeek V4 FlashBudget
1.0M2,568$3,783.78 Yes
MetaLlama 4 MaverickBudget
524.0K1,344$3,125.10 Yes
OpenAIo3 (Reasoning)
200.0K511$10,917.00 Yes
AnthropicClaude Sonnet 4.6Capable
200.0K511$16,420.50 Yes
AnthropicClaude Haiku 4.5Budget
200.0K511$5,473.50 Yes
AnthropicClaude Opus 4.8Capable
200.0K511$27,367.50 Yes
MistralMistral Large
131.1K333$7,149.00 Yes
MistralMistral SmallBudget
131.1K333$357.45 Yes
OpenAIGPT-4o Selected
128.0K326$8,790.00 Yes
OpenAIGPT-4o MiniBudget
128.0K326$527.40 Yes
Packing Formula: Chunk capacity = 1 + floor((available_tokens − chunk_size) / (chunk_size − overlap)). Available tokens = effective context − system prompt − query − output reserve. Effective context = context window × (1 − safety buffer%). Actual results may vary slightly due to tokenizer overhead on special tokens and message format wrappers.

O que consome o orçamento de tokens de uma consulta

A janela de contexto não fica disponível apenas para os chunks recuperados. O prompt de sistema, a consulta do usuário, a formatação das mensagens e a resposta esperada consomem orçamento antes de qualquer documento entrar.

Informe o tamanho da janela, os tokens fixos e o tamanho do chunk para ver quantos chunks realmente cabem e quanto contexto fica sem uso.

  • Contexto efetivo = janela de contexto × (1 − margem de segurança).
  • Disponível = contexto efetivo − prompt de sistema − consulta − reserva de saída.
  • Máximo de chunks = 1 + floor((disponível − tamanho) / (tamanho − sobreposição)).

Equilibrar chunks e estrutura

Um chunk menor cabe mais vezes, mas traz menos contexto. Um chunk maior traz mais contexto por unidade, mas reduz quantos documentos distintos você consegue incluir.

  • Recuperar de 3 a 8 chunks por consulta é o padrão em produção.
  • Sobreposição de 10-15 % preserva a continuidade entre limites.
  • Reservar poucos tokens de saída é a causa mais comum de truncamento.

Ajustar o sistema passo a passo

Comece pelo modelo e pela janela de contexto, então ajuste o tamanho do chunk até caberem documentos relevantes suficientes com reserva de saída confortável.

  1. Selecione o modelo e defina a margem de segurança para obter o contexto efetivo.
  2. Subtraia os tokens do prompt de sistema, da consulta e da reserva de saída.
  3. Ajuste tamanho do chunk e sobreposição até alcançar o número de chunks necessário.
  4. Confira o detalhamento de tokens e compare com outro modelo antes de implantar.

Perguntas frequentes

Ela determina quantos chunks de documentos recuperados cabem na janela de contexto de um modelo de linguagem para uma única consulta RAG. Considera custos fixos como prompt de sistema, consulta do usuário e reserva de saída, e então calcula o número máximo de chunks pela fórmula da janela deslizante.

A fórmula é: max_chunks = 1 + floor((tokens_disponíveis − tamanho_chunk) / (tamanho_chunk − sobreposição)). Onde tokens_disponíveis = contexto_efetivo − tokens_prompt_sistema − tokens_consulta − tokens_reserva_saída, e contexto_efetivo = janela_contexto × (1 − margem_segurança).

A maioria dos sistemas RAG em produção usa chunks entre 256 e 512 tokens. Chunks menores melhoram a precisão da recuperação, mas exigem mais chunks para cobrir um tema. Um tamanho de 400 tokens com 10 % de sobreposição é um ponto de partida comum para RAG de uso geral.

Sobreposição significa que chunks adjacentes compartilham alguns tokens nas fronteiras. Isso preserva a continuidade de frases e parágrafos: informação cortada entre limites fica disponível nos dois chunks, melhorando a revocação. A sobreposição típica é de 10-15 % do tamanho do chunk.

Os LLMs usam a mesma janela de contexto para entrada e saída. Se você preencher todo o contexto com tokens de prompt, o modelo não tem espaço para gerar a resposta. Reserve sempre ao menos 256-512 tokens para respostas curtas, ou mais para saídas longas e estruturadas.

A margem de segurança reserva um percentual da janela de contexto como folga para variação de tokenização. Contagens reais podem diferir das estimativas em alguns pontos percentuais por causa de tokens de formato de mensagem e diferenças entre tokenizadores. Uma margem de 5-10 % evita erros de estouro em produção.

A maioria dos sistemas RAG recupera de 3 a 8 chunks por consulta. Menos de 3 pode não dar contexto diverso o suficiente. Mais de 8 pode diluir a relevância. O número ideal depende do caso de uso: perguntas factuais normalmente precisam de 3-5 chunks, enquanto a síntese de documentos pode se beneficiar de 8-12.

Completamente. A calculadora roda inteiramente no seu navegador. Tamanho de chunk, contagens de tokens, configurações de modelo e estimativas de custo são processados localmente: nada é enviado a servidor algum. A configuração do seu pipeline RAG permanece 100 % privada.