Chunk-Anzahl-Rechner
Schätzen Sie, wie viele Chunks Ihr Dokumentdatensatz für eine RAG-Pipeline erzeugt – kostenlos und vollständig privat im Browser. Konfigurieren Sie Dokumentanzahl, durchschnittliche Wortzahl, Chunk-Größe, Überlappung und Strategie (Fixed-Size, Sliding Window, Sentence, Paragraph, Recursive oder Semantic). Sie erhalten sofort Gesamt-Chunkzahl, Embedding-Kosten über 5 Anbieter und Vektorspeicher-Schätzungen.
Estimate how many chunks your dataset produces based on document size, chunk size, overlap, and chunking strategy. See total embedding token counts, embedding costs, and vector storage requirements - instantly in your browser.
Dataset
Splits text into equal-sized chunks. Simple and predictable.
Chunk Parameters
Chunk Count Results
Total Chunks
200
Chunks / Doc
2
Avg Doc Tokens
667
Effective Tokens
462
per chunk
Embedding & Storage Estimates
Tokens to Embed
102,400
chunk_count × chunk_size
Embedding Cost
$0.0020
OpenAI text-embedding-3-small
Vector Storage
1.2 MB
1,536 dims × float32
Strategy Comparison (same dataset & chunk size)
| Strategy | Total Chunks | Embed Cost | vs. Fixed |
|---|---|---|---|
Fixed-Size (no overlap)Selected | 200 | $0.0020 | Baseline |
Sliding Window (with overlap) | 200 | $0.0020 | Baseline |
Sentence-Based | 200 | $0.0020 | Baseline |
Paragraph-Based | 200 | $0.0020 | Baseline |
Recursive Character Split | 200 | $0.0020 | Baseline |
Semantic Chunking | 200 | $0.0020 | Baseline |
Warum die Chunk-Anzahl die RAG-Kosten bestimmt
In einer RAG-Pipeline bestimmt die Chunk-Anzahl gleich zwei Kosten: das Erzeugen der Embeddings bei der Ingestion und das Speichern der Vektoren. Eine schlechte Strategie kann beide vervielfachen, ohne die Abrufqualität zu verbessern.
Geben Sie Dokumentanzahl, durchschnittliche Wortzahl, Chunk-Größe und Überlappung ein, um zu sehen, wie viele Chunks entstehen und was das Einbetten kostet.
- Chunks = ceil((Dokument-Tokens − Überlappung) / (Chunk-Größe − Überlappung)).
- Embedding-Kosten fallen einmal bei der Ingestion an, wiederholen sich aber bei Inhalts- oder Modellwechsel.
- Der reale Speicherbedarf übersteigt die Rohschätzung durch Metadaten und HNSW-Indizes.
Die Chunking-Strategie wählen
Es gibt keine universell beste Strategie. Fixed-Size ist einfach und planbar; semantische und rekursive Ansätze respektieren die Dokumentstruktur besser, liefern aber weniger planbare Kosten.
- Fixed-Size und Sliding Window: einfach und gut kalkulierbar.
- Sentence und Paragraph: erhalten Sinneinheiten, etwas unregelmäßige Zahlen.
- Recursive und Semantic: besserer Abruf, höhere und weniger planbare Kosten.
Größe und Überlappung abstimmen
Starten Sie mit 512 Tokens und 50 Überlappung, messen Sie die Abrufqualität und justieren Sie. Mehr Überlappung verbessert die Kontinuität, verteuert aber die Ingestion.
- Schätzen Sie die Chunk-Anzahl mit Ihrer aktuellen Größe und Überlappung.
- Berechnen Sie die entstehenden Embedding-Kosten und den Vektorspeicher.
- Testen Sie eine zweite Konfiguration (z. B. 256 Tokens) und vergleichen Sie beide Szenarien.
- Wählen Sie die Konfiguration mit dem besten Verhältnis von Abruf, Kosten und Speicher.
Häufig gestellte Fragen
Ein Chunk ist ein Textabschnitt fester oder variabler Länge, der beim Aufteilen eines größeren Dokuments entsteht. In einem RAG-System (Retrieval-Augmented Generation) werden Dokumente in Chunks geteilt, jeder Chunk in ein Vektor-Embedding umgewandelt und die Embeddings in einer Vektordatenbank gespeichert. Zur Abfragezeit werden die semantisch ähnlichsten Chunks abgerufen und als Kontext in den LLM-Prompt eingefügt.
Für Fixed-Size-Chunking gilt: chunks = ceil((dokument_tokens − überlappung) / (chunk_größe − überlappung)). Ein Dokument mit 1.000 Tokens, Chunk-Größe 512 und 50 Tokens Überlappung ergibt ceil((1000 − 50) / (512 − 50)) = ceil(950 / 462) = 3 Chunks pro Dokument. Sentence- und Paragraph-Strategien ergeben durch Grenzausrichtung leicht abweichende Zahlen.
Ein üblicher Startpunkt ist 512 Tokens mit 50 Tokens Überlappung für Prosadokumente. Kleinere Chunks (128-256 Tokens) verbessern die Abrufpräzision, können aber Kontext verlieren. Größere Chunks (1024+ Tokens) liefern reicheren Kontext, können aber die Relevanz senken. Die optimale Größe hängt von Dokumenttyp, Fragestil und Embedding-Modell ab. Bewerten Sie die Abrufqualität immer empirisch mit Ihren Inhalten.
Überlappungs-Tokens werden zwischen aufeinanderfolgenden Chunks geteilt. Bei 512 Tokens Chunk-Größe und 50 Tokens Überlappung werden die letzten 50 Tokens von Chunk N zu den ersten 50 von Chunk N+1. Das verhindert Informationsverlust an Chunk-Grenzen und verbessert die Kontinuität bei grenzüberschreitenden Abfragen. Überlappung erhöht Gesamt-Chunkzahl und Embedding-Kosten proportional.
Embedding-Kosten = gesamt_chunks × chunk_tokens / 1.000.000 × kosten_pro_million_tokens. Beispiel: 1.000 Chunks × 512 Tokens = 512.000 zu embeddende Tokens. Bei OpenAI text-embedding-3-small (0,020 $/M Tokens) kostet das 0,0102 $. Jeder Chunk wird einmal bei der Ingestion eingebettet – erneutes Einbetten ist nur bei Inhaltsänderungen nötig.
Vektorspeicher = gesamt_chunks × embedding_dimensionen × 4 Byte (float32). Für 10.000 Chunks mit OpenAI text-embedding-3-small (1.536 Dims): 10.000 × 1.536 × 4 = ~61,4 MB für Rohvektoren. Der tatsächliche Datenbankbedarf ist höher – durch Metadaten, Indexstrukturen (HNSW-Graphen) und Replikation. Quantisierte Modelle (int8) halbieren diese Schätzung.
Ja. Der Rechner läuft vollständig im Browser. Keine Dokumentinhalte, Datensatzdetails oder Konfigurationen werden an einen Server gesendet. Alle Berechnungen – Chunk-Anzahl, Embedding-Kosten, Speicher – erfolgen lokal auf Ihrem Gerät. Ihre Daten bleiben 100 % privat, ohne Registrierung.