Chunk-Größen-Rechner
Finden Sie kostenlos die optimale Chunk-Größe und Überlappung für Ihre RAG-Pipeline. Konfigurieren Sie Korpusgröße, Inhaltstyp, Embedding-Modell und LLM-Kontextfenster und erhalten Sie Qualitätswerte, Kontextbudget-Analysen und Embedding-Kostenprognosen – vollständig privat, ohne Registrierung.
Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.
Document Corpus
Blog posts, documentation, books, reports
Chunk Configuration
= 51 overlap tokens per chunk boundary
Model Configuration
Query Context Budget
Configuration Quality
Chunk: 512 tokens
Overlap: 10% (51 tokens)
Chunks / Doc
109
Total Chunks
10,900
Max Chunks in Ctx
247
Context Used
3%
Query Context Breakdown
Indexing Cost (one-time)
$0.1116
10,900 chunks × 512 tokens
Query Input Cost / Call
$0.0102
4,060 tokens on GPT-4o
Chunk Size Comparison
Your overlap: 10% fixed| Chunk Size | Chunks/Doc | Total Chunks | Embed Cost | Ctx Fits? | Quality |
|---|---|---|---|---|---|
128 tokens | 435 | 43,500 | $0.1114 | ✓ Yes | Good |
256 tokens | 218 | 21,800 | $0.1116 | ✓ Yes | Excellent |
512 tokens Current | 109 | 10,900 | $0.1116 | ✓ Yes | Excellent |
768 tokens | 73 | 7,300 | $0.1121 | ✓ Yes | Fair |
1024 tokens | 55 | 5,500 | $0.1126 | ✓ Yes | Good |
1500 tokens | 37 | 3,700 | $0.1110 | ✓ Yes | Fair |
2048 tokens | 28 | 2,800 | $0.1147 | ✓ Yes | Poor |
Wie die Chunk-Größe Qualität und Kosten verändert
Kleinere Chunks verbessern die Abrufpräzision, weil der Vektor einen engeren Begriff repräsentiert, liefern dem Modell aber weniger Kontext. Größere Chunks machen das Gegenteil: mehr Kontext pro Chunk, weniger Präzision und höhere Kontextkosten pro Anfrage.
Konfigurieren Sie Korpusgröße und Embedding-Modell, um zu sehen, wie sich Qualitätswert, Indexierungskosten und Verbrauch pro Anfrage ändern.
- Allgemeine Prosa: 512 Tokens mit 10-15 % Überlappung ist ein guter Start.
- Q&A: 256 Tokens; juristische Dokumente: 800-1.024 Tokens.
- Code: 256-512 Tokens entlang Funktionsgrenzen, mit 5-10 % Überlappung.
Kontextbudget und Chunk-Anzahl
Das LLM-Kontextfenster muss System-Prompt, abgerufene Chunks und erwartete Antwort aufnehmen. Mehr Chunks abzurufen, als hineinpassen, verbessert die Qualität nicht – es verbraucht nur Budget.
- Starten Sie mit 3-5 abgerufenen Chunks und passen Sie sie an die Größe an.
- Bei 256-Token-Chunks können Sie 8-10 abrufen, ohne den Kontext zu erschöpfen.
- Beachten Sie das Eingabelimit des Embedding-Modells: Überschreitung schneidet Text still ab.
Iterieren bis zur passenden Konfiguration
Die optimale Konfiguration hängt von Ihrem Korpus und echten Anfragen ab. Betrachten Sie den Rechner als Startpunkt und validieren Sie mit End-to-End-Abruftests.
- Wählen Sie eine Startgröße je nach Inhaltstyp.
- Berechnen Sie Chunk-Anzahl, Indexierungskosten und Verbrauch pro Anfrage.
- Vergleichen Sie zwei bis drei Konfigurationen und den relativen Qualitätswert.
- Validieren Sie die beste Variante mit echten Anfragen, bevor Sie den ganzen Korpus indexieren.
Häufig gestellte Fragen
In einer RAG-Pipeline werden Dokumente in kleinere Segmente – Chunks – geteilt, bevor sie eingebettet und in einer Vektordatenbank gespeichert werden. Die Chunk-Größe in Tokens bestimmt, wie viel Text ein Segment enthält. Sie ist wichtig, weil sie Abrufpräzision, Kontextreichtum, Embedding-Kosten und den Kontextverbrauch des LLM pro Anfrage direkt beeinflusst.
Für allgemeine englische Prosa sind 512 Tokens mit 10-15 % Überlappung ein weit verbreiteter Startpunkt. Q&A-Dokumente profitieren von kleineren 256-Token-Chunks. Juristische Dokumente funktionieren besser mit 800-1.024 Tokens. Quellcode sollte 256-512 Tokens entlang von Funktionsgrenzen nutzen. Validieren Sie immer mit End-to-End-Abruftests.
Die Überlappung wiederholt die letzten N Tokens eines Chunks am Anfang des nächsten, damit der Kontext an Grenzen nicht abgeschnitten wird. 10-20 % der Chunk-Größe sind für Prosa Standard. Sehr geringe Überlappung riskiert Grenzartefakte; sehr hohe Überlappung bläht den Vektorspeicher auf. Bei Code sind 5-10 % üblich.
Jedes Embedding-Modell hat ein maximales Eingabe-Tokenlimit. OpenAI text-embedding-3-small unterstützt bis zu 8.191 Tokens pro Eingabe, Cohere embed-english-v3 maximal 512. Der Rechner zeigt eine Warnung, wenn die konfigurierte Chunk-Größe das Limit des gewählten Embedding-Modells überschreitet.
Ein üblicher Startpunkt sind 3-5 Chunks. Bei kleineren Chunks (256 Tokens) können Sie mehr abrufen (8-10), ohne den Kontext zu füllen. Nutzen Sie die Kontextbudget-Visualisierung, um sicherzustellen, dass System-Prompt + abgerufene Chunks + Antwortreserve ins LLM-Kontextfenster passen.
Embedding-Kosten = Gesamt-Chunks × Chunk-Größe in Tokens × Kosten pro Token des Modells. Beispiel: 10.000 Chunks à 512 Tokens mit OpenAI text-embedding-3-small (0,020 $/1 Mio. Tokens) = etwa 0,10 $. Das ist eine einmalige Indexierungskosten – Neuindexierung ist nur bei Dokument- oder Modellwechsel nötig.
Ja, in beidem. Der Rechner ist 100 % kostenlos, ohne Konto. Alle Berechnungen laufen vollständig im Browser: Keine Konfiguration oder Kostendaten werden an einen Server gesendet. Ihr RAG-Design bleibt vollständig privat auf Ihrem Gerät.