Aller au contenu
Aback Tools Logo

Calculateur de taille de base de connaissances

Estimez les besoins de stockage, la taille de l'index vectoriel et les coûts d'ingestion d'embeddings de votre base de connaissances IA. Réglez le nombre de documents, la longueur moyenne, la taille des segments et le chevauchement pour voir le nombre total de segments et la taille de l'index en Go. Comparez 9 modèles d'embeddings et 7 bases de données vectorielles, et projetez la croissance du stockage et des coûts sur 1 à 60 mois.

Knowledge Base Size Calculator

Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.

Dimensions: 1,536Vector size: 6.1 KBEmbed cost: $0.020/1M tokens

Document Corpus

docs
words

Chunking Strategy

tokens
tokens
Tokens per document667
Chunks per document2
Total chunks (initial)20,000

Vector Database Storage

bytes

Growth & Re-indexing

% / mo
months
days

Current Knowledge Base Snapshot

Total Chunks

20,000

2 per doc

Index Storage

0.120 GB

6.3 KB / chunk

Ingestion Cost

$0.2048

one-time embed

Storage / Month

$0.0397

0.12 GB

Storage Breakdown per Chunk

Vector (1,536d × 4 bytes)6.0 KB (95%)
Vector overhead (ID, pointers)60 B (1%)
Metadata (source, title, timestamps)256 B (4%)
Total per chunk6.3 KB

Growth Projection (12 months, 10%/mo)

MonthTotal DocsTotal ChunksIndex SizeStorage/MoNew Embed Cost
Mo 111,00022,0000.132 GB$0.0437$0.0205
Mo 212,10024,2000.146 GB$0.0480$0.0225
Mo 313,31026,6200.160 GB$0.0529$0.0248
Mo 414,64129,2820.176 GB$0.0581$0.0273
Mo 516,10532,2100.194 GB$0.0639$0.0300
Mo 617,71635,4320.213 GB$0.0703$0.0330
Mo 719,48838,9760.234 GB$0.0774$0.0363
Mo 821,43742,8740.258 GB$0.0851$0.0399
Mo 923,58147,1620.284 GB$0.0936$0.0439
Mo 1025,93951,8780.312 GB$0.1030$0.0483
Mo 1128,53357,0660.343 GB$0.1133$0.0531
Mo 12 Final31,38662,7720.378 GB$0.1246$0.0584

12-Month Total Cost Summary

Initial Ingestion

$0.2048

one-time embed cost

Growth Ingestion

$0.4380

new docs over 12 mo

Re-index Cost

$7.82

every 30 days

Storage (period)

$0.9341

12 mo accumulated

Final Index Size

0.378 GB

62,772 total chunks

Total Period Cost

$9.09

all costs combined

Embedding Model Comparison (initial ingestion)

ModelDimsVector SizeIndex SizeIngestion Cost
text-embedding-3-smallOpenAISelected
1,5366.1 KB0.120 GB$0.2048
text-embedding-3-largeOpenAI
3,07212.1 KB0.235 GB$1.33
text-embedding-ada-002OpenAI
1,5366.1 KB0.120 GB$1.02
embed-english-v3Cohere
1,0244.1 KB0.082 GB$1.02
embed-multilingual-v3Cohere
1,0244.1 KB0.082 GB$1.02
text-embedding-004Google
7683.1 KB0.063 GB$0.2560
voyage-3-liteVoyage
5122.1 KB0.044 GB$0.2048
voyage-3Voyage
1,0244.1 KB0.082 GB$0.6144
voyage-3-largeVoyage
2,0488.1 KB0.158 GB$1.84
Estimation Notes: Document token count uses 0.75 words/token ratio (standard English prose). Vector storage uses float32 (4 bytes/dimension) plus 60 bytes overhead per vector for IDs and pointers. Actual storage may vary by vector database compression, HNSW index overhead (typically +25-50%), and payload indexing. Storage rates are indicative list prices - actual billing depends on plan tier, region, and committed capacity. All calculations run locally in your browser.

Comment le stockage vectoriel s'accumule

La taille de l'index dépend du nombre de segments produits par votre corpus et de la dimension du modèle d'embeddings choisi. Chaque segment génère un vecteur stocké dans la base vectorielle.

La formule de base est dimensions × 4 octets par vecteur, plus un surcoût fixe et les métadonnées associées.

  • Segments = documents × longueur moyenne ÷ taille de segment, ajusté du chevauchement.
  • Vecteurs float32 : dimensions × 4 octets chacun.
  • Métadonnées par segment (URL, dates, titre) ajoutent des octets.

Choisir la segmentation et le modèle

La taille de segment est un compromis entre précision de récupération et coût de stockage et d'ingestion. Le modèle détermine à la fois la dimension et le prix au million de tokens.

  1. Choisissez une taille de segment adaptée à la densité de vos documents.
  2. Ajoutez du chevauchement pour ne pas perdre le contexte aux frontières.
  3. Sélectionnez le modèle d'embeddings selon son rapport coût-qualité.
  4. Appliquez le facteur de surcoût HNSW de votre base vectorielle.

Projeter la croissance et la réindexation

Le stockage et les coûts augmentent à chaque nouveau document. Projeter sur 1 à 60 mois aide à dimensionner l'infrastructure avant que cela ne devienne un problème.

  • La croissance mensuelle multiplie segments, vecteurs et stockage.
  • Réindexez seulement lors d'un changement de modèle ou de stratégie.
  • Les mises à jour de documents se traitent mieux en indexation incrémentale.

Foire aux questions

Il estime le stockage de l'index vectoriel, le nombre de segments, les coûts d'ingestion d'embeddings et les projections de croissance mensuelle pour les systèmes RAG et de recherche sémantique. Il modélise combien de segments votre corpus produit, quel stockage chaque segment requiert dans une base vectorielle, et comment les coûts d'ingestion et de stockage évoluent avec la croissance de la base.

Chaque segment de document produit un vecteur d'embedding. Taille du vecteur = nombre de dimensions × 4 octets (encodage float32) plus environ 60 octets de surcoût par vecteur pour les identifiants internes et les pointeurs de graphe. Les métadonnées stockées avec chaque vecteur (URL source, horodatages, titre du document) ajoutent des octets supplémentaires par segment.

Les points de départ courants sont 256-512 tokens pour des documents factuels denses et 512-1024 tokens pour un contenu narratif plus long. Les petits segments produisent plus de vecteurs et une meilleure précision de récupération, mais augmentent le stockage et les coûts d'embeddings. Utilisez ce calculateur pour comparer le stockage total selon différentes tailles de segment avant de vous engager sur un pipeline d'ingestion.

Le chevauchement est le nombre de tokens partagés entre segments adjacents pour préserver le contexte aux frontières. Un chevauchement de 64 tokens sur un segment de 512 signifie que chaque segment partage 64 tokens avec le suivant. Le chevauchement ajoute des segments supplémentaires au total. Le calculateur en tient compte dans le nombre total de segments et le stockage.

Le calculateur affiche le stockage brut vecteurs + métadonnées. La plupart des bases vectorielles ajoutent 25-60 % de surcoût d'index HNSW au-dessus du stockage brut. Prévoyez 1,3 à 1,6× le stockage brut estimé pour les bases vectorielles managées avec index HNSW par défaut.

La réindexation complète n'est nécessaire que si vous changez de modèle d'embeddings, ajustez la stratégie de segments ou restructurez en profondeur vos documents. Pour les mises à jour et ajouts, l'indexation incrémentale est bien plus rentable. Le champ de coût de réindexation estime les cycles planifiés de ré-embedding complet.

Pour la plupart des applications RAG en anglais, Google text-embedding-004 (0,025 $/1M tokens, 768 dimensions) ou Voyage voyage-3-lite (0,020 $/1M tokens, 512 dimensions) offrent le meilleur rapport coût-qualité pour l'ingestion à grande échelle. OpenAI text-embedding-3-small est aussi rentable à 0,020 $/1M avec 1536 dimensions.

Oui. Le calculateur fonctionne entièrement dans votre navigateur en JavaScript. Nombre de documents, descriptions de corpus, estimations de coûts et projections de croissance sont calculés localement sur votre appareil et jamais transmis à un serveur. Aucune inscription requise, outil entièrement gratuit.