Pular para o conteúdo
Aback Tools Logo

Calculadora de tamanho de chunk

Encontre gratuitamente o tamanho de chunk e a sobreposição ideais para seu pipeline RAG. Configure o tamanho do corpus, o tipo de conteúdo, o modelo de embeddings e a janela de contexto do LLM para obter notas de qualidade, análise do orçamento de contexto e projeções de custo de embeddings — totalmente privado e sem cadastro.

Chunk Size Calculator

Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.

Document Corpus

tokens
docs

Blog posts, documentation, books, reports

Rec. chunk: 512 tokensRec. overlap: 10%

Chunk Configuration

tokens
64 (precise)5122048 (rich)
%

= 51 overlap tokens per chunk boundary

Model Configuration

$0.020/1M tokensMax input: 8,191 tokensRec: 512 tk/chunk
$2.50/1M inputContext: 128,000 tokens

Query Context Budget

tokens
tokens
chunks

Configuration Quality

100/ 100- Excellent

Chunk: 512 tokens

Overlap: 10% (51 tokens)

Chunk Size QualityExcellent (100/100)
Overlap QualityExcellent (100/100)

Chunks / Doc

109

Total Chunks

10,900

Max Chunks in Ctx

247

Context Used

3%

Query Context Breakdown

System Prompt500 tokens (0%)
5 Retrieved Chunks2,560 tokens (2%)
Answer Reserve1,000 tokens (1%)
Total per query4,060 / 128,000 tokens

Indexing Cost (one-time)

$0.1116

10,900 chunks × 512 tokens

Query Input Cost / Call

$0.0102

4,060 tokens on GPT-4o

Chunk Size Comparison

Your overlap: 10% fixed
Chunk SizeChunks/DocTotal ChunksEmbed CostCtx Fits?Quality
128 tokens
43543,500$0.1114✓ YesGood
256 tokens
21821,800$0.1116✓ YesExcellent
512 tokens Current
10910,900$0.1116✓ YesExcellent
768 tokens
737,300$0.1121✓ YesFair
1024 tokens
555,500$0.1126✓ YesGood
1500 tokens
373,700$0.1110✓ YesFair
2048 tokens
282,800$0.1147✓ YesPoor

Como o tamanho do chunk muda qualidade e custo

Chunks menores melhoram a precisão da recuperação, pois o vetor representa um conceito mais específico, mas entregam menos contexto ao modelo. Chunks maiores fazem o oposto: mais contexto por chunk, menos precisão e maior custo de contexto por consulta.

Configure o tamanho do corpus e o modelo de embeddings para ver como mudam a nota de qualidade, o custo de indexação e o consumo por consulta.

  • Texto corrido geral: 512 tokens com 10-15 % de sobreposição é um bom começo.
  • Perguntas e respostas: 256 tokens; documentos jurídicos: 800-1.024 tokens.
  • Código: 256-512 tokens alinhados às funções, com 5-10 % de sobreposição.

Orçamento de contexto e número de chunks

A janela de contexto do LLM precisa acomodar o prompt de sistema, os chunks recuperados e a resposta esperada. Recuperar mais chunks do que caberia não melhora a qualidade: só consome orçamento.

  • Comece recuperando 3-5 chunks e ajuste conforme o tamanho escolhido.
  • Com chunks de 256 tokens você pode recuperar 8-10 sem esgotar o contexto.
  • Fique atento ao limite de entrada do modelo de embeddings: excedê-lo trunca o texto silenciosamente.

Iterar até encontrar sua configuração

A configuração ideal depende do seu corpus e das consultas reais. Trate a calculadora como ponto de partida e valide com testes de recuperação ponta a ponta.

  1. Escolha um tamanho de chunk inicial conforme o tipo de conteúdo.
  2. Calcule o número de chunks, o custo de indexação e o consumo por consulta.
  3. Compare duas ou três configurações e observe a pontuação de qualidade relativa.
  4. Valide a melhor candidata com consultas reais antes de indexar todo o corpus.

Perguntas frequentes

Em um pipeline RAG, os documentos são divididos em segmentos menores chamados chunks antes de serem vetorizados e armazenados em um banco vetorial. O tamanho do chunk — medido em tokens — define quanto texto cada segmento contém. Isso importa porque afeta diretamente a precisão da recuperação, a riqueza de contexto, o custo de embeddings e o consumo de contexto do LLM por consulta.

Para texto corrido em inglês, 512 tokens com 10-15 % de sobreposição é um ponto de partida amplamente usado. Documentos de perguntas e respostas se beneficiam de chunks menores, de 256 tokens. Documentos jurídicos funcionam melhor com 800-1.024 tokens. Código-fonte deve usar 256-512 tokens alinhados aos limites de função. Sempre valide com testes de recuperação ponta a ponta.

A sobreposição repete os últimos N tokens de um chunk no início do próximo para evitar que o contexto seja cortado nas fronteiras. Sobreposição de 10-20 % do tamanho do chunk é padrão em texto. Sobreposição muito baixa arrisca artefatos de borda; muito alta infla seu armazenamento vetorial. Em código, usa-se 5-10 %.

Todo modelo de embeddings tem limite máximo de tokens de entrada. O OpenAI text-embedding-3-small suporta até 8.191 tokens por entrada, enquanto o Cohere embed-english-v3 suporta no máximo 512. A calculadora mostra um alerta se o tamanho configurado exceder o limite do modelo de embeddings selecionado.

Um ponto de partida comum são 3-5 chunks. Com chunks menores (256 tokens) você pode recuperar mais (8-10) sem encher o contexto. Use a visualização do orçamento de contexto para confirmar que prompt de sistema + chunks recuperados + reserva de resposta cabem na janela de contexto do seu LLM.

Custo de embeddings = total de chunks × tamanho do chunk em tokens × custo por token do modelo. Por exemplo, 10.000 chunks de 512 tokens com OpenAI text-embedding-3-small (US$ 0,020/1 M tokens) = cerca de US$ 0,10. É um custo único de indexação — reindexar só é necessário quando os documentos mudam ou você troca de modelo de embeddings.

Sim, nos dois sentidos. A calculadora é 100 % grátis e não exige conta. Todos os cálculos rodam inteiramente no seu navegador: nenhuma configuração ou dado de custo é enviado a servidor algum. O design do seu pipeline RAG permanece totalmente privado no seu dispositivo.