Saltar al contenido
Aback Tools Logo

Calculadora de número de fragmentos

Estima cuántos fragmentos genera tu dataset de documentos para un pipeline RAG — gratis y totalmente privado en tu navegador. Configura el número de documentos, la media de palabras, el tamaño de fragmento, el solapamiento y la estrategia (tamaño fijo, ventana deslizante, frases, párrafos, recursiva o semántica). Obtén al instante el total de fragmentos, el coste de embeddings en 5 proveedores y las estimaciones de almacenamiento vectorial.

Chunk Count Calculator

Estimate how many chunks your dataset produces based on document size, chunk size, overlap, and chunking strategy. See total embedding token counts, embedding costs, and vector storage requirements - instantly in your browser.

Dataset

docs
words
w/tok
Avg. tokens / doc: 667 · Total dataset tokens: 66,700

Splits text into equal-sized chunks. Simple and predictable.

Chunk Parameters

tokens
tokens
Cost/1M tokens: $0.020Dimensions: 1,536

Chunk Count Results

Total Chunks

200

Chunks / Doc

2

Avg Doc Tokens

667

Effective Tokens

462

per chunk

Embedding & Storage Estimates

Tokens to Embed

102,400

chunk_count × chunk_size

Embedding Cost

$0.0020

OpenAI text-embedding-3-small

Vector Storage

1.2 MB

1,536 dims × float32

Strategy Comparison (same dataset & chunk size)

StrategyTotal ChunksEmbed Costvs. Fixed
Fixed-Size (no overlap)Selected
200$0.0020Baseline
Sliding Window (with overlap)
200$0.0020Baseline
Sentence-Based
200$0.0020Baseline
Paragraph-Based
200$0.0020Baseline
Recursive Character Split
200$0.0020Baseline
Semantic Chunking
200$0.0020Baseline
Estimation note: Chunk counts are estimates. Sentence-based, paragraph-based, and semantic strategies produce variable chunk sizes depending on content structure. Embedding costs assume each chunk is embedded exactly once. Vector storage uses float32 (4 bytes/dim); actual storage may vary by database (quantization, metadata overhead). All calculations run locally in your browser.

Por qué el número de fragmentos decide el coste del RAG

En un pipeline RAG, el número de fragmentos determina dos costes a la vez: el de generar embeddings en la ingesta y el de almacenar vectores. Una estrategia mal elegida puede multiplicar ambos sin mejorar la calidad de recuperación.

Introduce el número de documentos, la media de palabras, el tamaño de fragmento y el solapamiento para ver cuántos fragmentos generará el dataset y cuánto costará vectorizarlos.

  • Fragmentos = ceil((tokens del documento − solapamiento) / (tamaño de fragmento − solapamiento)).
  • El coste de embeddings se paga una vez en la ingesta, pero se repite si cambia el contenido o el modelo.
  • El almacenamiento real supera la estimación bruta por metadatos e índices HNSW.

Elegir la estrategia de fragmentación

No existe una estrategia universal mejor. El tamaño fijo es simple y predecible; las estrategias semánticas y recursivas respetan mejor la estructura del documento, pero producen conteos y costes menos previsibles.

  • Tamaño fijo y ventana deslizante: sencillas y fáciles de presupuestar.
  • Por frases y párrafos: mantienen unidades de significado, con conteos algo irregulares.
  • Recursiva y semántica: mejor calidad de recuperación, mayor coste y menos previsibilidad.

Cómo ajustar el tamaño y el solapamiento

Empieza en 512 tokens con 50 de solapamiento, mide la calidad de recuperación y ajusta. Subir el solapamiento mejora la continuidad, pero encarece la ingesta.

  1. Estima el número de fragmentos con tu tamaño y solapamiento actuales.
  2. Calcula el coste de embeddings y el almacenamiento vectorial resultantes.
  3. Prueba una segunda configuración (por ejemplo 256 tokens) y compara ambos escenarios.
  4. Elige la configuración que mejor equilibre recuperación, coste y volumen de almacenamiento.

Preguntas frecuentes

Un fragmento (chunk) es un pasaje de texto de longitud fija o variable que se obtiene al dividir un documento mayor. En un sistema RAG (generación aumentada por recuperación), los documentos se dividen en fragmentos, cada fragmento se convierte en un embedding vectorial y los embeddings se almacenan en una base de datos vectorial. En el momento de la consulta, se recuperan los fragmentos semánticamente más similares y se inyectan como contexto en el prompt del LLM.

Para la fragmentación de tamaño fijo, la fórmula es: fragmentos = ceil((tokens_documento − solapamiento) / (tamaño_fragmento − solapamiento)). Así, un documento de 1.000 tokens con fragmentos de 512 tokens y 50 de solapamiento produce ceil((1000 − 50) / (512 − 50)) = ceil(950 / 462) = 3 fragmentos por documento. Las estrategias por frases y párrafos dan cifras ligeramente distintas por los efectos de alineación de límites.

Un punto de partida habitual es 512 tokens con 50 tokens de solapamiento para documentos de prosa. Los fragmentos más pequeños (128-256 tokens) mejoran la precisión de recuperación, pero pueden quedarse sin contexto. Los más grandes (1024+ tokens) aportan contexto más rico, pero pueden reducir la relevancia de la recuperación. El tamaño óptimo depende del tipo de documento, el estilo de consulta y el modelo de embeddings. Evalúa siempre la calidad de recuperación de forma empírica con tu contenido real.

Los tokens de solapamiento se comparten entre fragmentos consecutivos. Por ejemplo, con 512 tokens de tamaño y 50 de solapamiento, los últimos 50 tokens del fragmento N se convierten en los primeros 50 del fragmento N+1. Esto evita perder información cerca de los límites y mejora la continuidad para consultas que cruzan fronteras. El solapamiento aumenta proporcionalmente el número total de fragmentos y el coste de embeddings.

Coste de embeddings = total_fragmentos × tokens_fragmento / 1.000.000 × coste_por_millón_de_tokens. Por ejemplo, 1.000 fragmentos × 512 tokens = 512.000 tokens que vectorizar. Con OpenAI text-embedding-3-small (0,020 $/millón de tokens), esto cuesta 0,0102 $. Ten en cuenta que cada fragmento se vectoriza una sola vez en la ingesta: solo hay que re-vectorizar cuando cambia el contenido.

Almacenamiento vectorial = total_fragmentos × dimensiones_del_embedding × 4 bytes (float32). Para 10.000 fragmentos con OpenAI text-embedding-3-small (1.536 dimensiones): 10.000 × 1.536 × 4 = ~61,4 MB de vectores sin procesar. El almacenamiento real en la base de datos es mayor por los metadatos, las estructuras de indexación (grafos HNSW) y cualquier replicación. Los modelos cuantizados (int8) reducen esta estimación a la mitad.

Sí. La calculadora funciona íntegramente en tu navegador. No se envía a ningún servidor el contenido de los documentos, los detalles del dataset ni la configuración. Todos los cálculos —número de fragmentos, coste de embeddings, estimaciones de almacenamiento— se realizan localmente en tu dispositivo. Tus datos permanecen 100 % privados y no hace falta registro.