Zum Inhalt springen
Aback Tools Logo

Chunk-Größen-Rechner

Finden Sie kostenlos die optimale Chunk-Größe und Überlappung für Ihre RAG-Pipeline. Konfigurieren Sie Korpusgröße, Inhaltstyp, Embedding-Modell und LLM-Kontextfenster und erhalten Sie Qualitätswerte, Kontextbudget-Analysen und Embedding-Kostenprognosen – vollständig privat, ohne Registrierung.

Chunk Size Calculator

Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.

Document Corpus

tokens
docs

Blog posts, documentation, books, reports

Rec. chunk: 512 tokensRec. overlap: 10%

Chunk Configuration

tokens
64 (precise)5122048 (rich)
%

= 51 overlap tokens per chunk boundary

Model Configuration

$0.020/1M tokensMax input: 8,191 tokensRec: 512 tk/chunk
$2.50/1M inputContext: 128,000 tokens

Query Context Budget

tokens
tokens
chunks

Configuration Quality

100/ 100- Excellent

Chunk: 512 tokens

Overlap: 10% (51 tokens)

Chunk Size QualityExcellent (100/100)
Overlap QualityExcellent (100/100)

Chunks / Doc

109

Total Chunks

10,900

Max Chunks in Ctx

247

Context Used

3%

Query Context Breakdown

System Prompt500 tokens (0%)
5 Retrieved Chunks2,560 tokens (2%)
Answer Reserve1,000 tokens (1%)
Total per query4,060 / 128,000 tokens

Indexing Cost (one-time)

$0.1116

10,900 chunks × 512 tokens

Query Input Cost / Call

$0.0102

4,060 tokens on GPT-4o

Chunk Size Comparison

Your overlap: 10% fixed
Chunk SizeChunks/DocTotal ChunksEmbed CostCtx Fits?Quality
128 tokens
43543,500$0.1114✓ YesGood
256 tokens
21821,800$0.1116✓ YesExcellent
512 tokens Current
10910,900$0.1116✓ YesExcellent
768 tokens
737,300$0.1121✓ YesFair
1024 tokens
555,500$0.1126✓ YesGood
1500 tokens
373,700$0.1110✓ YesFair
2048 tokens
282,800$0.1147✓ YesPoor

Wie die Chunk-Größe Qualität und Kosten verändert

Kleinere Chunks verbessern die Abrufpräzision, weil der Vektor einen engeren Begriff repräsentiert, liefern dem Modell aber weniger Kontext. Größere Chunks machen das Gegenteil: mehr Kontext pro Chunk, weniger Präzision und höhere Kontextkosten pro Anfrage.

Konfigurieren Sie Korpusgröße und Embedding-Modell, um zu sehen, wie sich Qualitätswert, Indexierungskosten und Verbrauch pro Anfrage ändern.

  • Allgemeine Prosa: 512 Tokens mit 10-15 % Überlappung ist ein guter Start.
  • Q&A: 256 Tokens; juristische Dokumente: 800-1.024 Tokens.
  • Code: 256-512 Tokens entlang Funktionsgrenzen, mit 5-10 % Überlappung.

Kontextbudget und Chunk-Anzahl

Das LLM-Kontextfenster muss System-Prompt, abgerufene Chunks und erwartete Antwort aufnehmen. Mehr Chunks abzurufen, als hineinpassen, verbessert die Qualität nicht – es verbraucht nur Budget.

  • Starten Sie mit 3-5 abgerufenen Chunks und passen Sie sie an die Größe an.
  • Bei 256-Token-Chunks können Sie 8-10 abrufen, ohne den Kontext zu erschöpfen.
  • Beachten Sie das Eingabelimit des Embedding-Modells: Überschreitung schneidet Text still ab.

Iterieren bis zur passenden Konfiguration

Die optimale Konfiguration hängt von Ihrem Korpus und echten Anfragen ab. Betrachten Sie den Rechner als Startpunkt und validieren Sie mit End-to-End-Abruftests.

  1. Wählen Sie eine Startgröße je nach Inhaltstyp.
  2. Berechnen Sie Chunk-Anzahl, Indexierungskosten und Verbrauch pro Anfrage.
  3. Vergleichen Sie zwei bis drei Konfigurationen und den relativen Qualitätswert.
  4. Validieren Sie die beste Variante mit echten Anfragen, bevor Sie den ganzen Korpus indexieren.

Häufig gestellte Fragen

In einer RAG-Pipeline werden Dokumente in kleinere Segmente – Chunks – geteilt, bevor sie eingebettet und in einer Vektordatenbank gespeichert werden. Die Chunk-Größe in Tokens bestimmt, wie viel Text ein Segment enthält. Sie ist wichtig, weil sie Abrufpräzision, Kontextreichtum, Embedding-Kosten und den Kontextverbrauch des LLM pro Anfrage direkt beeinflusst.

Für allgemeine englische Prosa sind 512 Tokens mit 10-15 % Überlappung ein weit verbreiteter Startpunkt. Q&A-Dokumente profitieren von kleineren 256-Token-Chunks. Juristische Dokumente funktionieren besser mit 800-1.024 Tokens. Quellcode sollte 256-512 Tokens entlang von Funktionsgrenzen nutzen. Validieren Sie immer mit End-to-End-Abruftests.

Die Überlappung wiederholt die letzten N Tokens eines Chunks am Anfang des nächsten, damit der Kontext an Grenzen nicht abgeschnitten wird. 10-20 % der Chunk-Größe sind für Prosa Standard. Sehr geringe Überlappung riskiert Grenzartefakte; sehr hohe Überlappung bläht den Vektorspeicher auf. Bei Code sind 5-10 % üblich.

Jedes Embedding-Modell hat ein maximales Eingabe-Tokenlimit. OpenAI text-embedding-3-small unterstützt bis zu 8.191 Tokens pro Eingabe, Cohere embed-english-v3 maximal 512. Der Rechner zeigt eine Warnung, wenn die konfigurierte Chunk-Größe das Limit des gewählten Embedding-Modells überschreitet.

Ein üblicher Startpunkt sind 3-5 Chunks. Bei kleineren Chunks (256 Tokens) können Sie mehr abrufen (8-10), ohne den Kontext zu füllen. Nutzen Sie die Kontextbudget-Visualisierung, um sicherzustellen, dass System-Prompt + abgerufene Chunks + Antwortreserve ins LLM-Kontextfenster passen.

Embedding-Kosten = Gesamt-Chunks × Chunk-Größe in Tokens × Kosten pro Token des Modells. Beispiel: 10.000 Chunks à 512 Tokens mit OpenAI text-embedding-3-small (0,020 $/1 Mio. Tokens) = etwa 0,10 $. Das ist eine einmalige Indexierungskosten – Neuindexierung ist nur bei Dokument- oder Modellwechsel nötig.

Ja, in beidem. Der Rechner ist 100 % kostenlos, ohne Konto. Alle Berechnungen laufen vollständig im Browser: Keine Konfiguration oder Kostendaten werden an einen Server gesendet. Ihr RAG-Design bleibt vollständig privat auf Ihrem Gerät.