Wissensdatenbank-Größenrechner
Schätzen Sie Speicherbedarf, Vektorindex-Größe und Embedding-Ingestionskosten Ihrer KI-Wissensdatenbank. Stellen Sie Dokumentanzahl, durchschnittliche Länge, Chunk-Größe und Überlappung ein, um Gesamt-Chunk-Anzahl und Indexgröße in GB zu sehen. Vergleichen Sie 9 Embedding-Modelle und 7 Vektordatenbanken und projizieren Sie das Wachstum von Speicher und Kosten über 1 bis 60 Monate.
Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.
Document Corpus
Chunking Strategy
Vector Database Storage
Growth & Re-indexing
Current Knowledge Base Snapshot
Total Chunks
20,000
2 per doc
Index Storage
0.120 GB
6.3 KB / chunk
Ingestion Cost
$0.2048
one-time embed
Storage / Month
$0.0397
0.12 GB
Storage Breakdown per Chunk
Growth Projection (12 months, 10%/mo)
| Month | Total Docs | Total Chunks | Index Size | Storage/Mo | New Embed Cost |
|---|---|---|---|---|---|
| Mo 1 | 11,000 | 22,000 | 0.132 GB | $0.0437 | $0.0205 |
| Mo 2 | 12,100 | 24,200 | 0.146 GB | $0.0480 | $0.0225 |
| Mo 3 | 13,310 | 26,620 | 0.160 GB | $0.0529 | $0.0248 |
| Mo 4 | 14,641 | 29,282 | 0.176 GB | $0.0581 | $0.0273 |
| Mo 5 | 16,105 | 32,210 | 0.194 GB | $0.0639 | $0.0300 |
| Mo 6 | 17,716 | 35,432 | 0.213 GB | $0.0703 | $0.0330 |
| Mo 7 | 19,488 | 38,976 | 0.234 GB | $0.0774 | $0.0363 |
| Mo 8 | 21,437 | 42,874 | 0.258 GB | $0.0851 | $0.0399 |
| Mo 9 | 23,581 | 47,162 | 0.284 GB | $0.0936 | $0.0439 |
| Mo 10 | 25,939 | 51,878 | 0.312 GB | $0.1030 | $0.0483 |
| Mo 11 | 28,533 | 57,066 | 0.343 GB | $0.1133 | $0.0531 |
| Mo 12 Final | 31,386 | 62,772 | 0.378 GB | $0.1246 | $0.0584 |
12-Month Total Cost Summary
Initial Ingestion
$0.2048
one-time embed cost
Growth Ingestion
$0.4380
new docs over 12 mo
Re-index Cost
$7.82
every 30 days
Storage (period)
$0.9341
12 mo accumulated
Final Index Size
0.378 GB
62,772 total chunks
Total Period Cost
$9.09
all costs combined
Embedding Model Comparison (initial ingestion)
| Model | Dims | Vector Size | Index Size | Ingestion Cost |
|---|---|---|---|---|
text-embedding-3-smallOpenAISelected | 1,536 | 6.1 KB | 0.120 GB | $0.2048 |
text-embedding-3-largeOpenAI | 3,072 | 12.1 KB | 0.235 GB | $1.33 |
text-embedding-ada-002OpenAI | 1,536 | 6.1 KB | 0.120 GB | $1.02 |
embed-english-v3Cohere | 1,024 | 4.1 KB | 0.082 GB | $1.02 |
embed-multilingual-v3Cohere | 1,024 | 4.1 KB | 0.082 GB | $1.02 |
text-embedding-004Google | 768 | 3.1 KB | 0.063 GB | $0.2560 |
voyage-3-liteVoyage | 512 | 2.1 KB | 0.044 GB | $0.2048 |
voyage-3Voyage | 1,024 | 4.1 KB | 0.082 GB | $0.6144 |
voyage-3-largeVoyage | 2,048 | 8.1 KB | 0.158 GB | $1.84 |
Wie sich Vektorspeicher ansammelt
Die Indexgröße hängt davon ab, wie viele Chunks Ihr Korpus erzeugt und welche Dimension das gewählte Embedding-Modell hat. Jeder Chunk erzeugt einen Vektor, der in der Vektordatenbank liegt.
Die Grundformel lautet Dimensionen × 4 Byte pro Vektor, plus fester Overhead und zugehörige Metadaten.
- Chunks = Dokumente × Durchschnittslänge ÷ Chunk-Größe, angepasst um Überlappung.
- Float32-Vektoren: Dimensionen × 4 Byte je Vektor.
- Metadaten pro Chunk (URL, Daten, Titel) addieren zusätzliche Bytes.
Chunking und Modell wählen
Die Chunk-Größe ist ein Kompromiss zwischen Abrufpräzision und Speicher- bzw. Ingestionskosten. Das Modell bestimmt Dimension und Preis pro Million Tokens.
- Wählen Sie eine Chunk-Größe passend zur Dichte Ihrer Dokumente.
- Fügen Sie Überlappung hinzu, um Kontext an Grenzen zu bewahren.
- Wählen Sie das Embedding-Modell nach Kosten-Qualitäts-Verhältnis.
- Wenden Sie den HNSW-Overheadfaktor Ihrer Vektordatenbank an.
Wachstum und Re-Indexierung projizieren
Speicher und Kosten wachsen mit jedem neuen Dokument. Eine Projektion über 1-60 Monate hilft, die Infrastruktur zu dimensionieren, bevor sie zum Problem wird.
- Monatliches Wachstum vervielfacht Chunks, Vektoren und Speicher.
- Re-Indexieren nur bei Modellwechsel oder geänderter Chunking-Strategie.
- Dokumentaktualisierungen lassen sich besser inkrementell indexieren.
Häufig gestellte Fragen
Er schätzt Vektorindex-Speicher, Chunk-Anzahl, Embedding-Ingestionskosten und monatliche Wachstumsprognosen für RAG- und semantische Suchsysteme. Er modelliert, wie viele Chunks Ihr Dokumentkorpus erzeugt, wie viel Speicher jeder Chunk in einer Vektordatenbank benötigt und wie Ingestions- und Speicherkosten mit dem Wachstum skalieren.
Jeder Dokument-Chunk erzeugt einen Embedding-Vektor. Vektorgröße = Anzahl Dimensionen × 4 Byte (float32) plus ca. 60 Byte Overhead pro Vektor für interne IDs und Graphzeiger. Metadaten neben jedem Vektor (Quell-URL, Zeitstempel, Dokumenttitel) erhöhen die Bytes pro Chunk.
Gängige Startpunkte sind 256-512 Tokens für dichte Fakten-Dokumente und 512-1024 Tokens für längere narrative Inhalte. Kleinere Chunks erzeugen mehr Vektoren und höhere Abrufpräzision, erhöhen aber Speicher- und Embedding-Kosten. Vergleichen Sie mit diesem Rechner den Gesamtspeicher verschiedener Chunk-Größen, bevor Sie eine Ingestion-Pipeline festlegen.
Überlappung ist die Anzahl Tokens, die benachbarte Chunks teilen, um Kontext an den Grenzen zu erhalten. Eine Überlappung von 64 Tokens bei einem 512-Token-Chunk bedeutet, dass jeder Chunk 64 Tokens mit dem nächsten teilt. Überlappung erhöht die Gesamtanzahl der Chunks. Der Rechner berücksichtigt sie bei Chunk-Anzahl und Speicher.
Der Rechner zeigt den Rohspeicher für Vektoren + Metadaten. Die meisten Vektordatenbanken fügen 25-60 % HNSW-Graphindex-Overhead hinzu. Planen Sie bei verwalteten Vektordatenbanken mit Standard-HNSW-Indizes das 1,3- bis 1,6-Fache des geschätzten Rohspeichers ein.
Ein vollständiges Re-Indexieren ist nur nötig, wenn Sie das Embedding-Modell wechseln, die Chunking-Strategie anpassen oder Dokumente stark umstrukturieren. Für Aktualisierungen und Ergänzungen ist inkrementelles Indexieren deutlich wirtschaftlicher. Das Feld für Re-Indexierungskosten schätzt geplante vollständige Re-Embedding-Zyklen.
Für die meisten englischsprachigen RAG-Anwendungen bieten Google text-embedding-004 (0,025 $/1M Tokens, 768 Dimensionen) oder Voyage voyage-3-lite (0,020 $/1M Tokens, 512 Dimensionen) das beste Kosten-Qualitäts-Verhältnis für Ingestion in großem Maßstab. OpenAI text-embedding-3-small ist mit 0,020 $/1M und 1536 Dimensionen ebenfalls wirtschaftlich.
Ja. Der Rechner läuft vollständig im Browser mit JavaScript. Dokumentanzahl, Korpusbeschreibungen, Kostenschätzungen und Wachstumsprognosen werden lokal auf Ihrem Gerät berechnet und nie an einen Server übertragen. Keine Registrierung nötig, das Tool ist völlig kostenlos.