Zum Inhalt springen
Aback Tools Logo

Wissensdatenbank-Größenrechner

Schätzen Sie Speicherbedarf, Vektorindex-Größe und Embedding-Ingestionskosten Ihrer KI-Wissensdatenbank. Stellen Sie Dokumentanzahl, durchschnittliche Länge, Chunk-Größe und Überlappung ein, um Gesamt-Chunk-Anzahl und Indexgröße in GB zu sehen. Vergleichen Sie 9 Embedding-Modelle und 7 Vektordatenbanken und projizieren Sie das Wachstum von Speicher und Kosten über 1 bis 60 Monate.

Knowledge Base Size Calculator

Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.

Dimensions: 1,536Vector size: 6.1 KBEmbed cost: $0.020/1M tokens

Document Corpus

docs
words

Chunking Strategy

tokens
tokens
Tokens per document667
Chunks per document2
Total chunks (initial)20,000

Vector Database Storage

bytes

Growth & Re-indexing

% / mo
months
days

Current Knowledge Base Snapshot

Total Chunks

20,000

2 per doc

Index Storage

0.120 GB

6.3 KB / chunk

Ingestion Cost

$0.2048

one-time embed

Storage / Month

$0.0397

0.12 GB

Storage Breakdown per Chunk

Vector (1,536d × 4 bytes)6.0 KB (95%)
Vector overhead (ID, pointers)60 B (1%)
Metadata (source, title, timestamps)256 B (4%)
Total per chunk6.3 KB

Growth Projection (12 months, 10%/mo)

MonthTotal DocsTotal ChunksIndex SizeStorage/MoNew Embed Cost
Mo 111,00022,0000.132 GB$0.0437$0.0205
Mo 212,10024,2000.146 GB$0.0480$0.0225
Mo 313,31026,6200.160 GB$0.0529$0.0248
Mo 414,64129,2820.176 GB$0.0581$0.0273
Mo 516,10532,2100.194 GB$0.0639$0.0300
Mo 617,71635,4320.213 GB$0.0703$0.0330
Mo 719,48838,9760.234 GB$0.0774$0.0363
Mo 821,43742,8740.258 GB$0.0851$0.0399
Mo 923,58147,1620.284 GB$0.0936$0.0439
Mo 1025,93951,8780.312 GB$0.1030$0.0483
Mo 1128,53357,0660.343 GB$0.1133$0.0531
Mo 12 Final31,38662,7720.378 GB$0.1246$0.0584

12-Month Total Cost Summary

Initial Ingestion

$0.2048

one-time embed cost

Growth Ingestion

$0.4380

new docs over 12 mo

Re-index Cost

$7.82

every 30 days

Storage (period)

$0.9341

12 mo accumulated

Final Index Size

0.378 GB

62,772 total chunks

Total Period Cost

$9.09

all costs combined

Embedding Model Comparison (initial ingestion)

ModelDimsVector SizeIndex SizeIngestion Cost
text-embedding-3-smallOpenAISelected
1,5366.1 KB0.120 GB$0.2048
text-embedding-3-largeOpenAI
3,07212.1 KB0.235 GB$1.33
text-embedding-ada-002OpenAI
1,5366.1 KB0.120 GB$1.02
embed-english-v3Cohere
1,0244.1 KB0.082 GB$1.02
embed-multilingual-v3Cohere
1,0244.1 KB0.082 GB$1.02
text-embedding-004Google
7683.1 KB0.063 GB$0.2560
voyage-3-liteVoyage
5122.1 KB0.044 GB$0.2048
voyage-3Voyage
1,0244.1 KB0.082 GB$0.6144
voyage-3-largeVoyage
2,0488.1 KB0.158 GB$1.84
Estimation Notes: Document token count uses 0.75 words/token ratio (standard English prose). Vector storage uses float32 (4 bytes/dimension) plus 60 bytes overhead per vector for IDs and pointers. Actual storage may vary by vector database compression, HNSW index overhead (typically +25-50%), and payload indexing. Storage rates are indicative list prices - actual billing depends on plan tier, region, and committed capacity. All calculations run locally in your browser.

Wie sich Vektorspeicher ansammelt

Die Indexgröße hängt davon ab, wie viele Chunks Ihr Korpus erzeugt und welche Dimension das gewählte Embedding-Modell hat. Jeder Chunk erzeugt einen Vektor, der in der Vektordatenbank liegt.

Die Grundformel lautet Dimensionen × 4 Byte pro Vektor, plus fester Overhead und zugehörige Metadaten.

  • Chunks = Dokumente × Durchschnittslänge ÷ Chunk-Größe, angepasst um Überlappung.
  • Float32-Vektoren: Dimensionen × 4 Byte je Vektor.
  • Metadaten pro Chunk (URL, Daten, Titel) addieren zusätzliche Bytes.

Chunking und Modell wählen

Die Chunk-Größe ist ein Kompromiss zwischen Abrufpräzision und Speicher- bzw. Ingestionskosten. Das Modell bestimmt Dimension und Preis pro Million Tokens.

  1. Wählen Sie eine Chunk-Größe passend zur Dichte Ihrer Dokumente.
  2. Fügen Sie Überlappung hinzu, um Kontext an Grenzen zu bewahren.
  3. Wählen Sie das Embedding-Modell nach Kosten-Qualitäts-Verhältnis.
  4. Wenden Sie den HNSW-Overheadfaktor Ihrer Vektordatenbank an.

Wachstum und Re-Indexierung projizieren

Speicher und Kosten wachsen mit jedem neuen Dokument. Eine Projektion über 1-60 Monate hilft, die Infrastruktur zu dimensionieren, bevor sie zum Problem wird.

  • Monatliches Wachstum vervielfacht Chunks, Vektoren und Speicher.
  • Re-Indexieren nur bei Modellwechsel oder geänderter Chunking-Strategie.
  • Dokumentaktualisierungen lassen sich besser inkrementell indexieren.

Häufig gestellte Fragen

Er schätzt Vektorindex-Speicher, Chunk-Anzahl, Embedding-Ingestionskosten und monatliche Wachstumsprognosen für RAG- und semantische Suchsysteme. Er modelliert, wie viele Chunks Ihr Dokumentkorpus erzeugt, wie viel Speicher jeder Chunk in einer Vektordatenbank benötigt und wie Ingestions- und Speicherkosten mit dem Wachstum skalieren.

Jeder Dokument-Chunk erzeugt einen Embedding-Vektor. Vektorgröße = Anzahl Dimensionen × 4 Byte (float32) plus ca. 60 Byte Overhead pro Vektor für interne IDs und Graphzeiger. Metadaten neben jedem Vektor (Quell-URL, Zeitstempel, Dokumenttitel) erhöhen die Bytes pro Chunk.

Gängige Startpunkte sind 256-512 Tokens für dichte Fakten-Dokumente und 512-1024 Tokens für längere narrative Inhalte. Kleinere Chunks erzeugen mehr Vektoren und höhere Abrufpräzision, erhöhen aber Speicher- und Embedding-Kosten. Vergleichen Sie mit diesem Rechner den Gesamtspeicher verschiedener Chunk-Größen, bevor Sie eine Ingestion-Pipeline festlegen.

Überlappung ist die Anzahl Tokens, die benachbarte Chunks teilen, um Kontext an den Grenzen zu erhalten. Eine Überlappung von 64 Tokens bei einem 512-Token-Chunk bedeutet, dass jeder Chunk 64 Tokens mit dem nächsten teilt. Überlappung erhöht die Gesamtanzahl der Chunks. Der Rechner berücksichtigt sie bei Chunk-Anzahl und Speicher.

Der Rechner zeigt den Rohspeicher für Vektoren + Metadaten. Die meisten Vektordatenbanken fügen 25-60 % HNSW-Graphindex-Overhead hinzu. Planen Sie bei verwalteten Vektordatenbanken mit Standard-HNSW-Indizes das 1,3- bis 1,6-Fache des geschätzten Rohspeichers ein.

Ein vollständiges Re-Indexieren ist nur nötig, wenn Sie das Embedding-Modell wechseln, die Chunking-Strategie anpassen oder Dokumente stark umstrukturieren. Für Aktualisierungen und Ergänzungen ist inkrementelles Indexieren deutlich wirtschaftlicher. Das Feld für Re-Indexierungskosten schätzt geplante vollständige Re-Embedding-Zyklen.

Für die meisten englischsprachigen RAG-Anwendungen bieten Google text-embedding-004 (0,025 $/1M Tokens, 768 Dimensionen) oder Voyage voyage-3-lite (0,020 $/1M Tokens, 512 Dimensionen) das beste Kosten-Qualitäts-Verhältnis für Ingestion in großem Maßstab. OpenAI text-embedding-3-small ist mit 0,020 $/1M und 1536 Dimensionen ebenfalls wirtschaftlich.

Ja. Der Rechner läuft vollständig im Browser mit JavaScript. Dokumentanzahl, Korpusbeschreibungen, Kostenschätzungen und Wachstumsprognosen werden lokal auf Ihrem Gerät berechnet und nie an einen Server übertragen. Keine Registrierung nötig, das Tool ist völlig kostenlos.