Kalkulator Jumlah Chunk
Estimasi berapa banyak chunk yang dihasilkan dataset dokumen Anda untuk pipeline RAG — gratis dan sepenuhnya privat di browser Anda. Atur jumlah dokumen, rata-rata jumlah kata, ukuran chunk, tumpang tindih, dan strategi (ukuran tetap, jendela geser, kalimat, paragraf, rekursif, atau semantik). Dapatkan total chunk, biaya embedding di 5 penyedia, dan estimasi penyimpanan vektor seketika.
Estimate how many chunks your dataset produces based on document size, chunk size, overlap, and chunking strategy. See total embedding token counts, embedding costs, and vector storage requirements - instantly in your browser.
Dataset
Splits text into equal-sized chunks. Simple and predictable.
Chunk Parameters
Chunk Count Results
Total Chunks
200
Chunks / Doc
2
Avg Doc Tokens
667
Effective Tokens
462
per chunk
Embedding & Storage Estimates
Tokens to Embed
102,400
chunk_count × chunk_size
Embedding Cost
$0.0020
OpenAI text-embedding-3-small
Vector Storage
1.2 MB
1,536 dims × float32
Strategy Comparison (same dataset & chunk size)
| Strategy | Total Chunks | Embed Cost | vs. Fixed |
|---|---|---|---|
Fixed-Size (no overlap)Selected | 200 | $0.0020 | Baseline |
Sliding Window (with overlap) | 200 | $0.0020 | Baseline |
Sentence-Based | 200 | $0.0020 | Baseline |
Paragraph-Based | 200 | $0.0020 | Baseline |
Recursive Character Split | 200 | $0.0020 | Baseline |
Semantic Chunking | 200 | $0.0020 | Baseline |
Mengapa jumlah chunk menentukan biaya RAG
Pada pipeline RAG, jumlah chunk menentukan dua biaya sekaligus: pembuatan embedding saat ingest dan penyimpanan vektor. Strategi yang salah bisa melipatgandakan keduanya tanpa memperbaiki kualitas pengambilan.
Masukkan jumlah dokumen, rata-rata kata, ukuran chunk, dan tumpang tindih untuk melihat berapa chunk yang akan dihasilkan dan berapa biaya vektorisasinya.
- Chunk = ceil((token dokumen − tumpang tindih) / (ukuran chunk − tumpang tindih)).
- Biaya embedding dibayar sekali saat ingest, tetapi berulang bila konten atau model berubah.
- Penyimpanan nyata melebihi estimasi mentah karena metadata dan indeks HNSW.
Memilih strategi pemotongan
Tidak ada strategi yang terbaik untuk semua kasus. Ukuran tetap sederhana dan mudah diprediksi; pendekatan semantik dan rekursif lebih menghormati struktur dokumen tetapi menghasilkan biaya yang kurang terprediksi.
- Ukuran tetap dan jendela geser: sederhana dan mudah dianggarkan.
- Per kalimat dan paragraf: menjaga satuan makna, jumlahnya agak tidak beraturan.
- Rekursif dan semantik: pengambilan lebih baik, biaya lebih tinggi dan kurang terprediksi.
Menyetel ukuran dan tumpang tindih
Mulai dari 512 token dengan tumpang tindih 50, ukur kualitas pengambilan, lalu sesuaikan. Menambah tumpang tindih memperbaiki kesinambungan tetapi menaikkan biaya ingest.
- Estimasi jumlah chunk dengan ukuran dan tumpang tindih saat ini.
- Hitung biaya embedding dan penyimpanan vektor yang dihasilkan.
- Uji konfigurasi kedua (misalnya 256 token) dan bandingkan kedua skenario.
- Pilih konfigurasi dengan keseimbangan terbaik antara pengambilan, biaya, dan penyimpanan.
Pertanyaan yang Sering Diajukan
Chunk adalah potongan teks dengan panjang tetap atau variabel yang dihasilkan dari pemotongan dokumen besar. Pada sistem RAG (Retrieval-Augmented Generation), dokumen dipotong menjadi chunk, setiap chunk diubah menjadi embedding vektor, dan embedding disimpan di basis data vektor. Saat kueri, chunk yang paling mirip secara semantik diambil lalu disisipkan sebagai konteks ke prompt LLM.
Untuk pemotongan ukuran tetap: chunk = ceil((token_dokumen − tumpang_tindih) / (ukuran_chunk − tumpang_tindih)). Dokumen 1.000 token dengan ukuran chunk 512 dan tumpang tindih 50 menghasilkan ceil((1000 − 50) / (512 − 50)) = ceil(950 / 462) = 3 chunk per dokumen. Strategi kalimat dan paragraf memberi angka sedikit berbeda akibat penyejajaran batas.
Titik awal yang umum adalah 512 token dengan tumpang tindih 50 untuk dokumen prosa. Chunk lebih kecil (128-256 token) meningkatkan presisi pengambilan tetapi bisa kurang konteks. Chunk lebih besar (1024+ token) memberi konteks lebih kaya tetapi bisa menurunkan relevansi. Ukuran optimal bergantung pada jenis dokumen, gaya kueri, dan model embedding. Selalu evaluasi kualitas pengambilan secara empiris.
Token tumpang tindih dibagi antar chunk berurutan. Dengan ukuran 512 dan tumpang tindih 50, 50 token terakhir chunk N menjadi 50 token pertama chunk N+1. Ini mencegah kehilangan informasi di sekitar batas chunk dan meningkatkan kesinambungan untuk kueri yang melintasi batas. Tumpang tindih menambah total chunk dan biaya embedding secara proporsional.
Biaya embedding = total_chunk × token_per_chunk / 1.000.000 × biaya_per_juta_token. Contohnya, 1.000 chunk × 512 token = 512.000 token untuk divektorisasi. Dengan OpenAI text-embedding-3-small ($0,020/juta token), biayanya $0,0102. Setiap chunk divektorisasi sekali saat ingest — vektorisasi ulang hanya perlu jika konten berubah.
Penyimpanan vektor = total_chunk × dimensi_embedding × 4 byte (float32). Untuk 10.000 chunk dengan OpenAI text-embedding-3-small (1.536 dim): 10.000 × 1.536 × 4 = ~61,4 MB vektor mentah. Penyimpanan basis data nyata lebih besar karena metadata, struktur indeks (graf HNSW), dan replikasi. Model terkuantisasi (int8) memangkas estimasi ini setengahnya.
Ya. Kalkulator berjalan seluruhnya di browser Anda. Tidak ada konten dokumen, detail dataset, atau konfigurasi yang dikirim ke server mana pun. Semua perhitungan — jumlah chunk, biaya embedding, penyimpanan — dilakukan lokal di perangkat Anda. Data Anda tetap 100 % privat, tanpa pendaftaran.