Calculadora de tamanho de chunk
Encontre gratuitamente o tamanho de chunk e a sobreposição ideais para seu pipeline RAG. Configure o tamanho do corpus, o tipo de conteúdo, o modelo de embeddings e a janela de contexto do LLM para obter notas de qualidade, análise do orçamento de contexto e projeções de custo de embeddings — totalmente privado e sem cadastro.
Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.
Document Corpus
Blog posts, documentation, books, reports
Chunk Configuration
= 51 overlap tokens per chunk boundary
Model Configuration
Query Context Budget
Configuration Quality
Chunk: 512 tokens
Overlap: 10% (51 tokens)
Chunks / Doc
109
Total Chunks
10,900
Max Chunks in Ctx
247
Context Used
3%
Query Context Breakdown
Indexing Cost (one-time)
$0.1116
10,900 chunks × 512 tokens
Query Input Cost / Call
$0.0102
4,060 tokens on GPT-4o
Chunk Size Comparison
Your overlap: 10% fixed| Chunk Size | Chunks/Doc | Total Chunks | Embed Cost | Ctx Fits? | Quality |
|---|---|---|---|---|---|
128 tokens | 435 | 43,500 | $0.1114 | ✓ Yes | Good |
256 tokens | 218 | 21,800 | $0.1116 | ✓ Yes | Excellent |
512 tokens Current | 109 | 10,900 | $0.1116 | ✓ Yes | Excellent |
768 tokens | 73 | 7,300 | $0.1121 | ✓ Yes | Fair |
1024 tokens | 55 | 5,500 | $0.1126 | ✓ Yes | Good |
1500 tokens | 37 | 3,700 | $0.1110 | ✓ Yes | Fair |
2048 tokens | 28 | 2,800 | $0.1147 | ✓ Yes | Poor |
Como o tamanho do chunk muda qualidade e custo
Chunks menores melhoram a precisão da recuperação, pois o vetor representa um conceito mais específico, mas entregam menos contexto ao modelo. Chunks maiores fazem o oposto: mais contexto por chunk, menos precisão e maior custo de contexto por consulta.
Configure o tamanho do corpus e o modelo de embeddings para ver como mudam a nota de qualidade, o custo de indexação e o consumo por consulta.
- Texto corrido geral: 512 tokens com 10-15 % de sobreposição é um bom começo.
- Perguntas e respostas: 256 tokens; documentos jurídicos: 800-1.024 tokens.
- Código: 256-512 tokens alinhados às funções, com 5-10 % de sobreposição.
Orçamento de contexto e número de chunks
A janela de contexto do LLM precisa acomodar o prompt de sistema, os chunks recuperados e a resposta esperada. Recuperar mais chunks do que caberia não melhora a qualidade: só consome orçamento.
- Comece recuperando 3-5 chunks e ajuste conforme o tamanho escolhido.
- Com chunks de 256 tokens você pode recuperar 8-10 sem esgotar o contexto.
- Fique atento ao limite de entrada do modelo de embeddings: excedê-lo trunca o texto silenciosamente.
Iterar até encontrar sua configuração
A configuração ideal depende do seu corpus e das consultas reais. Trate a calculadora como ponto de partida e valide com testes de recuperação ponta a ponta.
- Escolha um tamanho de chunk inicial conforme o tipo de conteúdo.
- Calcule o número de chunks, o custo de indexação e o consumo por consulta.
- Compare duas ou três configurações e observe a pontuação de qualidade relativa.
- Valide a melhor candidata com consultas reais antes de indexar todo o corpus.
Perguntas frequentes
Em um pipeline RAG, os documentos são divididos em segmentos menores chamados chunks antes de serem vetorizados e armazenados em um banco vetorial. O tamanho do chunk — medido em tokens — define quanto texto cada segmento contém. Isso importa porque afeta diretamente a precisão da recuperação, a riqueza de contexto, o custo de embeddings e o consumo de contexto do LLM por consulta.
Para texto corrido em inglês, 512 tokens com 10-15 % de sobreposição é um ponto de partida amplamente usado. Documentos de perguntas e respostas se beneficiam de chunks menores, de 256 tokens. Documentos jurídicos funcionam melhor com 800-1.024 tokens. Código-fonte deve usar 256-512 tokens alinhados aos limites de função. Sempre valide com testes de recuperação ponta a ponta.
A sobreposição repete os últimos N tokens de um chunk no início do próximo para evitar que o contexto seja cortado nas fronteiras. Sobreposição de 10-20 % do tamanho do chunk é padrão em texto. Sobreposição muito baixa arrisca artefatos de borda; muito alta infla seu armazenamento vetorial. Em código, usa-se 5-10 %.
Todo modelo de embeddings tem limite máximo de tokens de entrada. O OpenAI text-embedding-3-small suporta até 8.191 tokens por entrada, enquanto o Cohere embed-english-v3 suporta no máximo 512. A calculadora mostra um alerta se o tamanho configurado exceder o limite do modelo de embeddings selecionado.
Um ponto de partida comum são 3-5 chunks. Com chunks menores (256 tokens) você pode recuperar mais (8-10) sem encher o contexto. Use a visualização do orçamento de contexto para confirmar que prompt de sistema + chunks recuperados + reserva de resposta cabem na janela de contexto do seu LLM.
Custo de embeddings = total de chunks × tamanho do chunk em tokens × custo por token do modelo. Por exemplo, 10.000 chunks de 512 tokens com OpenAI text-embedding-3-small (US$ 0,020/1 M tokens) = cerca de US$ 0,10. É um custo único de indexação — reindexar só é necessário quando os documentos mudam ou você troca de modelo de embeddings.
Sim, nos dois sentidos. A calculadora é 100 % grátis e não exige conta. Todos os cálculos rodam inteiramente no seu navegador: nenhuma configuração ou dado de custo é enviado a servidor algum. O design do seu pipeline RAG permanece totalmente privado no seu dispositivo.