Calculadora de tamaño de fragmento
Encuentra gratis el tamaño de fragmento y el solapamiento óptimos para tu pipeline RAG. Configura el tamaño del corpus, el tipo de contenido, el modelo de embeddings y la ventana de contexto del LLM para obtener puntuaciones de calidad, análisis del presupuesto de contexto y proyecciones de coste de embeddings — totalmente privado y sin registro.
Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.
Document Corpus
Blog posts, documentation, books, reports
Chunk Configuration
= 51 overlap tokens per chunk boundary
Model Configuration
Query Context Budget
Configuration Quality
Chunk: 512 tokens
Overlap: 10% (51 tokens)
Chunks / Doc
109
Total Chunks
10,900
Max Chunks in Ctx
247
Context Used
3%
Query Context Breakdown
Indexing Cost (one-time)
$0.1116
10,900 chunks × 512 tokens
Query Input Cost / Call
$0.0102
4,060 tokens on GPT-4o
Chunk Size Comparison
Your overlap: 10% fixed| Chunk Size | Chunks/Doc | Total Chunks | Embed Cost | Ctx Fits? | Quality |
|---|---|---|---|---|---|
128 tokens | 435 | 43,500 | $0.1114 | ✓ Yes | Good |
256 tokens | 218 | 21,800 | $0.1116 | ✓ Yes | Excellent |
512 tokens Current | 109 | 10,900 | $0.1116 | ✓ Yes | Excellent |
768 tokens | 73 | 7,300 | $0.1121 | ✓ Yes | Fair |
1024 tokens | 55 | 5,500 | $0.1126 | ✓ Yes | Good |
1500 tokens | 37 | 3,700 | $0.1110 | ✓ Yes | Fair |
2048 tokens | 28 | 2,800 | $0.1147 | ✓ Yes | Poor |
Cómo el tamaño de fragmento cambia la calidad y el coste
Fragmentos pequeños mejoran la precisión de recuperación, porque el vector representa un concepto más concreto, pero aportan menos contexto al modelo. Fragmentos grandes hacen lo contrario: más contexto por fragmento, menos precisión y más coste de contexto por consulta.
Configura el tamaño del corpus y el modelo de embeddings para ver cómo cambian la puntuación de calidad, el coste de indexación y el consumo por consulta.
- Prosa general: 512 tokens con 10-15 % de solapamiento es un buen punto de partida.
- Preguntas y respuestas: 256 tokens; documentos legales: 800-1.024 tokens.
- Código: 256-512 tokens alineados con los límites de funciones, con 5-10 % de solapamiento.
Presupuesto de contexto y número de fragmentos
La ventana de contexto del LLM debe alojar el prompt de sistema, los fragmentos recuperados y la respuesta esperada. Recuperar más fragmentos de los que caben no mejora la calidad: solo consume presupuesto.
- Empieza recuperando 3-5 fragmentos y ajusta según el tamaño elegido.
- Con fragmentos de 256 tokens puedes recuperar 8-10 sin agotar el contexto.
- Vigila el límite de entrada del modelo de embeddings: excederlo trunca el texto silenciosamente.
Iterar hasta encontrar tu configuración
La configuración óptima depende de tu corpus y de tus consultas reales. Trata la calculadora como punto de partida y valida con pruebas de recuperación de extremo a extremo.
- Elige un tamaño de fragmento inicial según el tipo de contenido.
- Calcula el número de fragmentos, el coste de indexación y el consumo por consulta.
- Compara dos o tres configuraciones y observa la puntuación de calidad relativa.
- Valida la mejor candidata con consultas reales antes de indexar todo el corpus.
Preguntas frecuentes
En un pipeline RAG, los documentos se dividen en segmentos más pequeños llamados fragmentos antes de vectorizarlos y almacenarlos en una base de datos vectorial. El tamaño de fragmento —medido en tokens— determina cuánto texto contiene cada segmento. Importa porque afecta directamente a la precisión de recuperación, la riqueza de contexto, el coste de embeddings y el consumo de contexto del LLM por consulta.
Para prosa general en inglés, 512 tokens con un 10-15 % de solapamiento es un punto de partida muy extendido. Los documentos de preguntas y respuestas se benefician de fragmentos más pequeños, de 256 tokens. Los documentos legales funcionan mejor con 800-1.024 tokens. El código fuente debería usar 256-512 tokens alineados con los límites de funciones. Valida siempre con pruebas de recuperación de extremo a extremo.
El solapamiento repite los últimos N tokens de un fragmento al inicio del siguiente para evitar que el contexto se corte en los límites. Un solapamiento del 10-20 % del tamaño del fragmento es lo estándar en prosa. Un solapamiento muy bajo arriesga artefactos en los bordes; uno muy alto infla tu almacén vectorial. En código se suele usar un solapamiento del 5-10 %.
Cada modelo de embeddings tiene un límite máximo de tokens de entrada. OpenAI text-embedding-3-small admite hasta 8.191 tokens por entrada, mientras que Cohere embed-english-v3 admite un máximo de 512. La calculadora muestra una advertencia si el tamaño de fragmento configurado supera el límite del modelo de embeddings seleccionado.
Un punto de partida habitual son 3-5 fragmentos. Con fragmentos más pequeños (256 tokens) puedes recuperar más (8-10) sin llenar el contexto. Usa la visualización del presupuesto de contexto para confirmar que el prompt de sistema, los fragmentos recuperados y la reserva para la respuesta caben en la ventana de contexto de tu LLM.
Coste de embeddings = total de fragmentos × tamaño del fragmento en tokens × coste por token del modelo de embeddings. Por ejemplo, 10.000 fragmentos de 512 tokens con OpenAI text-embedding-3-small (0,020 $/1 M tokens) = aproximadamente 0,10 $. Es un coste de indexación único: solo hay que reindexar cuando cambian los documentos o cambias de modelo de embeddings.
Sí, en ambos sentidos. La calculadora es 100 % gratis y no requiere cuenta. Todos los cálculos se ejecutan íntegramente en tu navegador: ni la configuración ni los datos de coste se envían nunca a un servidor. El diseño de tu pipeline RAG permanece totalmente privado en tu dispositivo.