Kalkulator Ukuran Chunk
Temukan gratis ukuran chunk dan tumpang tindih optimal untuk pipeline RAG Anda. Atur ukuran korpus, jenis konten, model embedding, dan jendela konteks LLM untuk mendapatkan skor kualitas, analisis anggaran konteks, dan proyeksi biaya embedding — sepenuhnya privat, tanpa pendaftaran.
Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.
Document Corpus
Blog posts, documentation, books, reports
Chunk Configuration
= 51 overlap tokens per chunk boundary
Model Configuration
Query Context Budget
Configuration Quality
Chunk: 512 tokens
Overlap: 10% (51 tokens)
Chunks / Doc
109
Total Chunks
10,900
Max Chunks in Ctx
247
Context Used
3%
Query Context Breakdown
Indexing Cost (one-time)
$0.1116
10,900 chunks × 512 tokens
Query Input Cost / Call
$0.0102
4,060 tokens on GPT-4o
Chunk Size Comparison
Your overlap: 10% fixed| Chunk Size | Chunks/Doc | Total Chunks | Embed Cost | Ctx Fits? | Quality |
|---|---|---|---|---|---|
128 tokens | 435 | 43,500 | $0.1114 | ✓ Yes | Good |
256 tokens | 218 | 21,800 | $0.1116 | ✓ Yes | Excellent |
512 tokens Current | 109 | 10,900 | $0.1116 | ✓ Yes | Excellent |
768 tokens | 73 | 7,300 | $0.1121 | ✓ Yes | Fair |
1024 tokens | 55 | 5,500 | $0.1126 | ✓ Yes | Good |
1500 tokens | 37 | 3,700 | $0.1110 | ✓ Yes | Fair |
2048 tokens | 28 | 2,800 | $0.1147 | ✓ Yes | Poor |
Bagaimana ukuran chunk mengubah kualitas dan biaya
Chunk lebih kecil meningkatkan presisi pengambilan karena vektor mewakili konsep yang lebih sempit, tetapi memberi model lebih sedikit konteks. Chunk lebih besar sebaliknya: konteks lebih banyak per chunk, presisi lebih rendah, dan biaya konteks per kueri lebih tinggi.
Atur ukuran korpus dan model embedding untuk melihat perubahan skor kualitas, biaya indeksasi, dan konsumsi per kueri.
- Prosa umum: 512 token dengan tumpang tindih 10-15 % adalah awal yang baik.
- Tanya-jawab: 256 token; dokumen hukum: 800-1.024 token.
- Kode: 256-512 token pada batas fungsi, dengan tumpang tindih 5-10 %.
Anggaran konteks dan jumlah chunk
Jendela konteks LLM harus menampung prompt sistem, chunk yang diambil, dan jawaban yang diharapkan. Mengambil lebih banyak chunk daripada yang muat tidak meningkatkan kualitas — hanya menghabiskan anggaran.
- Mulai dengan mengambil 3-5 chunk dan sesuaikan dengan ukuran yang dipilih.
- Dengan chunk 256 token Anda bisa mengambil 8-10 tanpa menghabiskan konteks.
- Perhatikan batas input model embedding: melewatinya memotong teks secara diam-diam.
Iterasi sampai menemukan konfigurasi Anda
Konfigurasi optimal bergantung pada korpus dan kueri nyata Anda. Perlakukan kalkulator sebagai titik awal dan validasi dengan pengujian pengambilan ujung ke ujung.
- Pilih ukuran chunk awal sesuai jenis konten.
- Hitung jumlah chunk, biaya indeksasi, dan konsumsi per kueri.
- Bandingkan dua atau tiga konfigurasi dan lihat skor kualitas relatifnya.
- Validasi kandidat terbaik dengan kueri nyata sebelum mengindeks seluruh korpus.
Pertanyaan yang Sering Diajukan
Dalam pipeline RAG, dokumen dipotong menjadi segmen lebih kecil bernama chunk sebelum divektorisasi dan disimpan di basis data vektor. Ukuran chunk — diukur dalam token — menentukan berapa banyak teks per segmen. Ini penting karena memengaruhi langsung presisi pengambilan, kekayaan konteks, biaya embedding, dan konsumsi konteks LLM per kueri.
Untuk prosa bahasa Inggris umum, 512 token dengan tumpang tindih 10-15 % adalah titik awal yang luas dipakai. Dokumen tanya-jawab lebih cocok memakai chunk 256 token. Dokumen hukum bekerja lebih baik dengan 800-1.024 token. Kode sumber sebaiknya memakai 256-512 token yang disejajarkan dengan batas fungsi. Selalu validasi dengan pengujian pengambilan ujung ke ujung.
Tumpang tindih mengulang N token terakhir satu chunk di awal chunk berikutnya agar konteks tidak terpotong di batas. Tumpang tindih 10-20 % dari ukuran chunk adalah standar untuk prosa. Tumpang tindih sangat kecil berisiko artefak batas; yang sangat besar membengkakkan penyimpanan vektor. Untuk kode biasanya 5-10 %.
Setiap model embedding punya batas maksimum token input. OpenAI text-embedding-3-small mendukung hingga 8.191 token per input, sedangkan Cohere embed-english-v3 maksimal 512. Kalkulator menampilkan peringatan jika ukuran chunk yang diatur melebihi batas model embedding yang dipilih.
Titik awal umum adalah 3-5 chunk. Dengan chunk lebih kecil (256 token) Anda bisa mengambil lebih banyak (8-10) tanpa mengisi konteks. Gunakan visualisasi anggaran konteks untuk memastikan prompt sistem + chunk yang diambil + cadangan jawaban muat di jendela konteks LLM Anda.
Biaya embedding = total chunk × ukuran chunk dalam token × biaya per token model embedding. Contohnya, 10.000 chunk berukuran 512 token dengan OpenAI text-embedding-3-small ($0,020/1 juta token) = sekitar $0,10. Ini biaya indeksasi sekali pakai — indeksasi ulang hanya perlu bila dokumen berubah atau Anda berganti model embedding.
Ya untuk keduanya. Kalkulator 100 % gratis tanpa akun. Semua perhitungan berjalan sepenuhnya di browser Anda: tidak ada konfigurasi atau data biaya yang dikirim ke server. Desain pipeline RAG Anda tetap sepenuhnya privat di perangkat Anda.