Saltar al contenido
Aback Tools Logo

Calculadora del tamaño de la base de conocimiento

Estima los requisitos de almacenamiento, el tamaño del índice vectorial y los costes de ingesta de embeddings de tu base de conocimiento de IA. Ajusta el número de documentos, la longitud media, el tamaño de fragmento y el solapamiento para ver el total de fragmentos y el tamaño del índice en GB. Compara 9 modelos de embeddings y 7 bases de datos vectoriales, y proyecta cuánto crecen el almacenamiento y los costes de 1 a 60 meses mientras escala tu base de conocimiento.

Knowledge Base Size Calculator

Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.

Dimensions: 1,536Vector size: 6.1 KBEmbed cost: $0.020/1M tokens

Document Corpus

docs
words

Chunking Strategy

tokens
tokens
Tokens per document667
Chunks per document2
Total chunks (initial)20,000

Vector Database Storage

bytes

Growth & Re-indexing

% / mo
months
days

Current Knowledge Base Snapshot

Total Chunks

20,000

2 per doc

Index Storage

0.120 GB

6.3 KB / chunk

Ingestion Cost

$0.2048

one-time embed

Storage / Month

$0.0397

0.12 GB

Storage Breakdown per Chunk

Vector (1,536d × 4 bytes)6.0 KB (95%)
Vector overhead (ID, pointers)60 B (1%)
Metadata (source, title, timestamps)256 B (4%)
Total per chunk6.3 KB

Growth Projection (12 months, 10%/mo)

MonthTotal DocsTotal ChunksIndex SizeStorage/MoNew Embed Cost
Mo 111,00022,0000.132 GB$0.0437$0.0205
Mo 212,10024,2000.146 GB$0.0480$0.0225
Mo 313,31026,6200.160 GB$0.0529$0.0248
Mo 414,64129,2820.176 GB$0.0581$0.0273
Mo 516,10532,2100.194 GB$0.0639$0.0300
Mo 617,71635,4320.213 GB$0.0703$0.0330
Mo 719,48838,9760.234 GB$0.0774$0.0363
Mo 821,43742,8740.258 GB$0.0851$0.0399
Mo 923,58147,1620.284 GB$0.0936$0.0439
Mo 1025,93951,8780.312 GB$0.1030$0.0483
Mo 1128,53357,0660.343 GB$0.1133$0.0531
Mo 12 Final31,38662,7720.378 GB$0.1246$0.0584

12-Month Total Cost Summary

Initial Ingestion

$0.2048

one-time embed cost

Growth Ingestion

$0.4380

new docs over 12 mo

Re-index Cost

$7.82

every 30 days

Storage (period)

$0.9341

12 mo accumulated

Final Index Size

0.378 GB

62,772 total chunks

Total Period Cost

$9.09

all costs combined

Embedding Model Comparison (initial ingestion)

ModelDimsVector SizeIndex SizeIngestion Cost
text-embedding-3-smallOpenAISelected
1,5366.1 KB0.120 GB$0.2048
text-embedding-3-largeOpenAI
3,07212.1 KB0.235 GB$1.33
text-embedding-ada-002OpenAI
1,5366.1 KB0.120 GB$1.02
embed-english-v3Cohere
1,0244.1 KB0.082 GB$1.02
embed-multilingual-v3Cohere
1,0244.1 KB0.082 GB$1.02
text-embedding-004Google
7683.1 KB0.063 GB$0.2560
voyage-3-liteVoyage
5122.1 KB0.044 GB$0.2048
voyage-3Voyage
1,0244.1 KB0.082 GB$0.6144
voyage-3-largeVoyage
2,0488.1 KB0.158 GB$1.84
Estimation Notes: Document token count uses 0.75 words/token ratio (standard English prose). Vector storage uses float32 (4 bytes/dimension) plus 60 bytes overhead per vector for IDs and pointers. Actual storage may vary by vector database compression, HNSW index overhead (typically +25-50%), and payload indexing. Storage rates are indicative list prices - actual billing depends on plan tier, region, and committed capacity. All calculations run locally in your browser.

Cómo se acumula el almacenamiento vectorial

El tamaño del índice depende de cuántos fragmentos produce tu corpus y de la dimensión del modelo de embeddings elegido. Cada fragmento genera un vector que se almacena en la base de datos vectorial.

La fórmula básica es dimensiones × 4 bytes por vector, más una sobrecarga fija y los metadatos asociados.

  • Fragmentos = documentos × longitud media ÷ tamaño de fragmento, ajustado por solapamiento.
  • Vectores float32: dimensiones × 4 bytes cada uno.
  • Metadatos por fragmento (URL, fechas, título) suman bytes adicionales.

Elegir fragmentación y modelo

El tamaño de fragmento es un equilibrio entre precisión de recuperación y coste de almacenamiento e ingesta. El modelo define tanto la dimensión como el precio por millón de tokens.

  1. Elige un tamaño de fragmento acorde a la densidad de tus documentos.
  2. Añade solapamiento para no perder contexto en los bordes.
  3. Selecciona el modelo de embeddings por su relación coste-calidad.
  4. Aplica el factor de sobrecarga HNSW de tu base de datos vectorial.

Proyectar el crecimiento y el reindexado

El almacenamiento y los costes crecen con cada documento nuevo. Proyectar de 1 a 60 meses ayuda a dimensionar la infraestructura antes de que se convierta en un problema.

  • El crecimiento mensual multiplica fragmentos, vectores y almacenamiento.
  • Reindexar solo al cambiar de modelo o de estrategia de fragmentación.
  • Las actualizaciones de documentos se cubren mejor con indexación incremental.

Preguntas frecuentes

Estima el almacenamiento del índice vectorial, el número de fragmentos, los costes de ingesta de embeddings y las proyecciones de crecimiento mensual para sistemas RAG y de búsqueda semántica. Modela cuántos fragmentos produce tu corpus de documentos, cuánto almacenamiento requiere cada fragmento en una base de datos vectorial y cómo escalan los costes de ingesta y almacenamiento a medida que crece la base de conocimiento.

Cada fragmento de documento produce un vector de embedding. El tamaño del vector = número de dimensiones × 4 bytes (codificación float32) más unos 60 bytes de sobrecarga por vector para IDs internos y punteros de grafo. Los metadatos que se guardan junto a cada vector (URL de origen, marcas de tiempo, título del documento) añaden bytes adicionales por fragmento.

Puntos de partida habituales: 256-512 tokens para documentos factuales densos y 512-1024 tokens para contenido narrativo más largo. Los fragmentos más pequeños generan más vectores y mayor precisión de recuperación, pero aumentan el almacenamiento y los costes de embeddings. Usa esta calculadora para comparar el almacenamiento total entre distintos tamaños de fragmento antes de comprometerte con un pipeline de ingesta.

El solapamiento es el número de tokens que comparten fragmentos adyacentes para preservar el contexto en los límites. Un solapamiento de 64 tokens en un fragmento de 512 significa que cada fragmento comparte 64 tokens con el siguiente. El solapamiento añade fragmentos extra al total. La calculadora lo tiene en cuenta al calcular el número total de fragmentos y el almacenamiento.

La calculadora muestra el almacenamiento bruto de vectores + metadatos. La mayoría de bases de datos vectoriales añaden un 25-60 % de sobrecarga por el índice de grafo HNSW sobre el almacenamiento bruto. Prevé entre 1,3 y 1,6 veces el almacenamiento bruto estimado para bases de datos vectoriales gestionadas con índices HNSW por defecto.

La reindexación completa solo es necesaria cuando cambias de modelo de embeddings, ajustas la estrategia de fragmentación o haces una reestructuración importante de documentos. Para actualizaciones y adiciones de documentos, la indexación incremental es mucho más rentable. El campo de coste de reindexado estima ciclos programados de re-embedding completo.

Para la mayoría de aplicaciones RAG en inglés, Google text-embedding-004 (0,025 $/1M tokens, 768 dimensiones) o Voyage voyage-3-lite (0,020 $/1M tokens, 512 dimensiones) ofrecen la mejor relación coste-calidad para ingesta a gran escala. OpenAI text-embedding-3-small también es rentable a 0,020 $/1M con 1536 dimensiones.

Sí. La calculadora funciona íntegramente en tu navegador con JavaScript. El número de documentos, las descripciones del corpus, las estimaciones de coste y las proyecciones de crecimiento se calculan localmente en tu dispositivo y nunca se transmiten a ningún servidor. No requiere registro y la herramienta es totalmente gratuita.