Lompat ke konten
Aback Tools Logo

Kalkulator Ukuran Chunk

Temukan gratis ukuran chunk dan tumpang tindih optimal untuk pipeline RAG Anda. Atur ukuran korpus, jenis konten, model embedding, dan jendela konteks LLM untuk mendapatkan skor kualitas, analisis anggaran konteks, dan proyeksi biaya embedding — sepenuhnya privat, tanpa pendaftaran.

Chunk Size Calculator

Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.

Document Corpus

tokens
docs

Blog posts, documentation, books, reports

Rec. chunk: 512 tokensRec. overlap: 10%

Chunk Configuration

tokens
64 (precise)5122048 (rich)
%

= 51 overlap tokens per chunk boundary

Model Configuration

$0.020/1M tokensMax input: 8,191 tokensRec: 512 tk/chunk
$2.50/1M inputContext: 128,000 tokens

Query Context Budget

tokens
tokens
chunks

Configuration Quality

100/ 100- Excellent

Chunk: 512 tokens

Overlap: 10% (51 tokens)

Chunk Size QualityExcellent (100/100)
Overlap QualityExcellent (100/100)

Chunks / Doc

109

Total Chunks

10,900

Max Chunks in Ctx

247

Context Used

3%

Query Context Breakdown

System Prompt500 tokens (0%)
5 Retrieved Chunks2,560 tokens (2%)
Answer Reserve1,000 tokens (1%)
Total per query4,060 / 128,000 tokens

Indexing Cost (one-time)

$0.1116

10,900 chunks × 512 tokens

Query Input Cost / Call

$0.0102

4,060 tokens on GPT-4o

Chunk Size Comparison

Your overlap: 10% fixed
Chunk SizeChunks/DocTotal ChunksEmbed CostCtx Fits?Quality
128 tokens
43543,500$0.1114✓ YesGood
256 tokens
21821,800$0.1116✓ YesExcellent
512 tokens Current
10910,900$0.1116✓ YesExcellent
768 tokens
737,300$0.1121✓ YesFair
1024 tokens
555,500$0.1126✓ YesGood
1500 tokens
373,700$0.1110✓ YesFair
2048 tokens
282,800$0.1147✓ YesPoor

Bagaimana ukuran chunk mengubah kualitas dan biaya

Chunk lebih kecil meningkatkan presisi pengambilan karena vektor mewakili konsep yang lebih sempit, tetapi memberi model lebih sedikit konteks. Chunk lebih besar sebaliknya: konteks lebih banyak per chunk, presisi lebih rendah, dan biaya konteks per kueri lebih tinggi.

Atur ukuran korpus dan model embedding untuk melihat perubahan skor kualitas, biaya indeksasi, dan konsumsi per kueri.

  • Prosa umum: 512 token dengan tumpang tindih 10-15 % adalah awal yang baik.
  • Tanya-jawab: 256 token; dokumen hukum: 800-1.024 token.
  • Kode: 256-512 token pada batas fungsi, dengan tumpang tindih 5-10 %.

Anggaran konteks dan jumlah chunk

Jendela konteks LLM harus menampung prompt sistem, chunk yang diambil, dan jawaban yang diharapkan. Mengambil lebih banyak chunk daripada yang muat tidak meningkatkan kualitas — hanya menghabiskan anggaran.

  • Mulai dengan mengambil 3-5 chunk dan sesuaikan dengan ukuran yang dipilih.
  • Dengan chunk 256 token Anda bisa mengambil 8-10 tanpa menghabiskan konteks.
  • Perhatikan batas input model embedding: melewatinya memotong teks secara diam-diam.

Iterasi sampai menemukan konfigurasi Anda

Konfigurasi optimal bergantung pada korpus dan kueri nyata Anda. Perlakukan kalkulator sebagai titik awal dan validasi dengan pengujian pengambilan ujung ke ujung.

  1. Pilih ukuran chunk awal sesuai jenis konten.
  2. Hitung jumlah chunk, biaya indeksasi, dan konsumsi per kueri.
  3. Bandingkan dua atau tiga konfigurasi dan lihat skor kualitas relatifnya.
  4. Validasi kandidat terbaik dengan kueri nyata sebelum mengindeks seluruh korpus.

Pertanyaan yang Sering Diajukan

Dalam pipeline RAG, dokumen dipotong menjadi segmen lebih kecil bernama chunk sebelum divektorisasi dan disimpan di basis data vektor. Ukuran chunk — diukur dalam token — menentukan berapa banyak teks per segmen. Ini penting karena memengaruhi langsung presisi pengambilan, kekayaan konteks, biaya embedding, dan konsumsi konteks LLM per kueri.

Untuk prosa bahasa Inggris umum, 512 token dengan tumpang tindih 10-15 % adalah titik awal yang luas dipakai. Dokumen tanya-jawab lebih cocok memakai chunk 256 token. Dokumen hukum bekerja lebih baik dengan 800-1.024 token. Kode sumber sebaiknya memakai 256-512 token yang disejajarkan dengan batas fungsi. Selalu validasi dengan pengujian pengambilan ujung ke ujung.

Tumpang tindih mengulang N token terakhir satu chunk di awal chunk berikutnya agar konteks tidak terpotong di batas. Tumpang tindih 10-20 % dari ukuran chunk adalah standar untuk prosa. Tumpang tindih sangat kecil berisiko artefak batas; yang sangat besar membengkakkan penyimpanan vektor. Untuk kode biasanya 5-10 %.

Setiap model embedding punya batas maksimum token input. OpenAI text-embedding-3-small mendukung hingga 8.191 token per input, sedangkan Cohere embed-english-v3 maksimal 512. Kalkulator menampilkan peringatan jika ukuran chunk yang diatur melebihi batas model embedding yang dipilih.

Titik awal umum adalah 3-5 chunk. Dengan chunk lebih kecil (256 token) Anda bisa mengambil lebih banyak (8-10) tanpa mengisi konteks. Gunakan visualisasi anggaran konteks untuk memastikan prompt sistem + chunk yang diambil + cadangan jawaban muat di jendela konteks LLM Anda.

Biaya embedding = total chunk × ukuran chunk dalam token × biaya per token model embedding. Contohnya, 10.000 chunk berukuran 512 token dengan OpenAI text-embedding-3-small ($0,020/1 juta token) = sekitar $0,10. Ini biaya indeksasi sekali pakai — indeksasi ulang hanya perlu bila dokumen berubah atau Anda berganti model embedding.

Ya untuk keduanya. Kalkulator 100 % gratis tanpa akun. Semua perhitungan berjalan sepenuhnya di browser Anda: tidak ada konfigurasi atau data biaya yang dikirim ke server. Desain pipeline RAG Anda tetap sepenuhnya privat di perangkat Anda.