Calculadora del tamaño de la base de conocimiento
Estima los requisitos de almacenamiento, el tamaño del índice vectorial y los costes de ingesta de embeddings de tu base de conocimiento de IA. Ajusta el número de documentos, la longitud media, el tamaño de fragmento y el solapamiento para ver el total de fragmentos y el tamaño del índice en GB. Compara 9 modelos de embeddings y 7 bases de datos vectoriales, y proyecta cuánto crecen el almacenamiento y los costes de 1 a 60 meses mientras escala tu base de conocimiento.
Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.
Document Corpus
Chunking Strategy
Vector Database Storage
Growth & Re-indexing
Current Knowledge Base Snapshot
Total Chunks
20,000
2 per doc
Index Storage
0.120 GB
6.3 KB / chunk
Ingestion Cost
$0.2048
one-time embed
Storage / Month
$0.0397
0.12 GB
Storage Breakdown per Chunk
Growth Projection (12 months, 10%/mo)
| Month | Total Docs | Total Chunks | Index Size | Storage/Mo | New Embed Cost |
|---|---|---|---|---|---|
| Mo 1 | 11,000 | 22,000 | 0.132 GB | $0.0437 | $0.0205 |
| Mo 2 | 12,100 | 24,200 | 0.146 GB | $0.0480 | $0.0225 |
| Mo 3 | 13,310 | 26,620 | 0.160 GB | $0.0529 | $0.0248 |
| Mo 4 | 14,641 | 29,282 | 0.176 GB | $0.0581 | $0.0273 |
| Mo 5 | 16,105 | 32,210 | 0.194 GB | $0.0639 | $0.0300 |
| Mo 6 | 17,716 | 35,432 | 0.213 GB | $0.0703 | $0.0330 |
| Mo 7 | 19,488 | 38,976 | 0.234 GB | $0.0774 | $0.0363 |
| Mo 8 | 21,437 | 42,874 | 0.258 GB | $0.0851 | $0.0399 |
| Mo 9 | 23,581 | 47,162 | 0.284 GB | $0.0936 | $0.0439 |
| Mo 10 | 25,939 | 51,878 | 0.312 GB | $0.1030 | $0.0483 |
| Mo 11 | 28,533 | 57,066 | 0.343 GB | $0.1133 | $0.0531 |
| Mo 12 Final | 31,386 | 62,772 | 0.378 GB | $0.1246 | $0.0584 |
12-Month Total Cost Summary
Initial Ingestion
$0.2048
one-time embed cost
Growth Ingestion
$0.4380
new docs over 12 mo
Re-index Cost
$7.82
every 30 days
Storage (period)
$0.9341
12 mo accumulated
Final Index Size
0.378 GB
62,772 total chunks
Total Period Cost
$9.09
all costs combined
Embedding Model Comparison (initial ingestion)
| Model | Dims | Vector Size | Index Size | Ingestion Cost |
|---|---|---|---|---|
text-embedding-3-smallOpenAISelected | 1,536 | 6.1 KB | 0.120 GB | $0.2048 |
text-embedding-3-largeOpenAI | 3,072 | 12.1 KB | 0.235 GB | $1.33 |
text-embedding-ada-002OpenAI | 1,536 | 6.1 KB | 0.120 GB | $1.02 |
embed-english-v3Cohere | 1,024 | 4.1 KB | 0.082 GB | $1.02 |
embed-multilingual-v3Cohere | 1,024 | 4.1 KB | 0.082 GB | $1.02 |
text-embedding-004Google | 768 | 3.1 KB | 0.063 GB | $0.2560 |
voyage-3-liteVoyage | 512 | 2.1 KB | 0.044 GB | $0.2048 |
voyage-3Voyage | 1,024 | 4.1 KB | 0.082 GB | $0.6144 |
voyage-3-largeVoyage | 2,048 | 8.1 KB | 0.158 GB | $1.84 |
Cómo se acumula el almacenamiento vectorial
El tamaño del índice depende de cuántos fragmentos produce tu corpus y de la dimensión del modelo de embeddings elegido. Cada fragmento genera un vector que se almacena en la base de datos vectorial.
La fórmula básica es dimensiones × 4 bytes por vector, más una sobrecarga fija y los metadatos asociados.
- Fragmentos = documentos × longitud media ÷ tamaño de fragmento, ajustado por solapamiento.
- Vectores float32: dimensiones × 4 bytes cada uno.
- Metadatos por fragmento (URL, fechas, título) suman bytes adicionales.
Elegir fragmentación y modelo
El tamaño de fragmento es un equilibrio entre precisión de recuperación y coste de almacenamiento e ingesta. El modelo define tanto la dimensión como el precio por millón de tokens.
- Elige un tamaño de fragmento acorde a la densidad de tus documentos.
- Añade solapamiento para no perder contexto en los bordes.
- Selecciona el modelo de embeddings por su relación coste-calidad.
- Aplica el factor de sobrecarga HNSW de tu base de datos vectorial.
Proyectar el crecimiento y el reindexado
El almacenamiento y los costes crecen con cada documento nuevo. Proyectar de 1 a 60 meses ayuda a dimensionar la infraestructura antes de que se convierta en un problema.
- El crecimiento mensual multiplica fragmentos, vectores y almacenamiento.
- Reindexar solo al cambiar de modelo o de estrategia de fragmentación.
- Las actualizaciones de documentos se cubren mejor con indexación incremental.
Preguntas frecuentes
Estima el almacenamiento del índice vectorial, el número de fragmentos, los costes de ingesta de embeddings y las proyecciones de crecimiento mensual para sistemas RAG y de búsqueda semántica. Modela cuántos fragmentos produce tu corpus de documentos, cuánto almacenamiento requiere cada fragmento en una base de datos vectorial y cómo escalan los costes de ingesta y almacenamiento a medida que crece la base de conocimiento.
Cada fragmento de documento produce un vector de embedding. El tamaño del vector = número de dimensiones × 4 bytes (codificación float32) más unos 60 bytes de sobrecarga por vector para IDs internos y punteros de grafo. Los metadatos que se guardan junto a cada vector (URL de origen, marcas de tiempo, título del documento) añaden bytes adicionales por fragmento.
Puntos de partida habituales: 256-512 tokens para documentos factuales densos y 512-1024 tokens para contenido narrativo más largo. Los fragmentos más pequeños generan más vectores y mayor precisión de recuperación, pero aumentan el almacenamiento y los costes de embeddings. Usa esta calculadora para comparar el almacenamiento total entre distintos tamaños de fragmento antes de comprometerte con un pipeline de ingesta.
El solapamiento es el número de tokens que comparten fragmentos adyacentes para preservar el contexto en los límites. Un solapamiento de 64 tokens en un fragmento de 512 significa que cada fragmento comparte 64 tokens con el siguiente. El solapamiento añade fragmentos extra al total. La calculadora lo tiene en cuenta al calcular el número total de fragmentos y el almacenamiento.
La calculadora muestra el almacenamiento bruto de vectores + metadatos. La mayoría de bases de datos vectoriales añaden un 25-60 % de sobrecarga por el índice de grafo HNSW sobre el almacenamiento bruto. Prevé entre 1,3 y 1,6 veces el almacenamiento bruto estimado para bases de datos vectoriales gestionadas con índices HNSW por defecto.
La reindexación completa solo es necesaria cuando cambias de modelo de embeddings, ajustas la estrategia de fragmentación o haces una reestructuración importante de documentos. Para actualizaciones y adiciones de documentos, la indexación incremental es mucho más rentable. El campo de coste de reindexado estima ciclos programados de re-embedding completo.
Para la mayoría de aplicaciones RAG en inglés, Google text-embedding-004 (0,025 $/1M tokens, 768 dimensiones) o Voyage voyage-3-lite (0,020 $/1M tokens, 512 dimensiones) ofrecen la mejor relación coste-calidad para ingesta a gran escala. OpenAI text-embedding-3-small también es rentable a 0,020 $/1M con 1536 dimensiones.
Sí. La calculadora funciona íntegramente en tu navegador con JavaScript. El número de documentos, las descripciones del corpus, las estimaciones de coste y las proyecciones de crecimiento se calculan localmente en tu dispositivo y nunca se transmiten a ningún servidor. No requiere registro y la herramienta es totalmente gratuita.