Lompat ke konten
Aback Tools Logo

Kalkulator Jumlah Chunk

Estimasi berapa banyak chunk yang dihasilkan dataset dokumen Anda untuk pipeline RAG — gratis dan sepenuhnya privat di browser Anda. Atur jumlah dokumen, rata-rata jumlah kata, ukuran chunk, tumpang tindih, dan strategi (ukuran tetap, jendela geser, kalimat, paragraf, rekursif, atau semantik). Dapatkan total chunk, biaya embedding di 5 penyedia, dan estimasi penyimpanan vektor seketika.

Chunk Count Calculator

Estimate how many chunks your dataset produces based on document size, chunk size, overlap, and chunking strategy. See total embedding token counts, embedding costs, and vector storage requirements - instantly in your browser.

Dataset

docs
words
w/tok
Avg. tokens / doc: 667 · Total dataset tokens: 66,700

Splits text into equal-sized chunks. Simple and predictable.

Chunk Parameters

tokens
tokens
Cost/1M tokens: $0.020Dimensions: 1,536

Chunk Count Results

Total Chunks

200

Chunks / Doc

2

Avg Doc Tokens

667

Effective Tokens

462

per chunk

Embedding & Storage Estimates

Tokens to Embed

102,400

chunk_count × chunk_size

Embedding Cost

$0.0020

OpenAI text-embedding-3-small

Vector Storage

1.2 MB

1,536 dims × float32

Strategy Comparison (same dataset & chunk size)

StrategyTotal ChunksEmbed Costvs. Fixed
Fixed-Size (no overlap)Selected
200$0.0020Baseline
Sliding Window (with overlap)
200$0.0020Baseline
Sentence-Based
200$0.0020Baseline
Paragraph-Based
200$0.0020Baseline
Recursive Character Split
200$0.0020Baseline
Semantic Chunking
200$0.0020Baseline
Estimation note: Chunk counts are estimates. Sentence-based, paragraph-based, and semantic strategies produce variable chunk sizes depending on content structure. Embedding costs assume each chunk is embedded exactly once. Vector storage uses float32 (4 bytes/dim); actual storage may vary by database (quantization, metadata overhead). All calculations run locally in your browser.

Mengapa jumlah chunk menentukan biaya RAG

Pada pipeline RAG, jumlah chunk menentukan dua biaya sekaligus: pembuatan embedding saat ingest dan penyimpanan vektor. Strategi yang salah bisa melipatgandakan keduanya tanpa memperbaiki kualitas pengambilan.

Masukkan jumlah dokumen, rata-rata kata, ukuran chunk, dan tumpang tindih untuk melihat berapa chunk yang akan dihasilkan dan berapa biaya vektorisasinya.

  • Chunk = ceil((token dokumen − tumpang tindih) / (ukuran chunk − tumpang tindih)).
  • Biaya embedding dibayar sekali saat ingest, tetapi berulang bila konten atau model berubah.
  • Penyimpanan nyata melebihi estimasi mentah karena metadata dan indeks HNSW.

Memilih strategi pemotongan

Tidak ada strategi yang terbaik untuk semua kasus. Ukuran tetap sederhana dan mudah diprediksi; pendekatan semantik dan rekursif lebih menghormati struktur dokumen tetapi menghasilkan biaya yang kurang terprediksi.

  • Ukuran tetap dan jendela geser: sederhana dan mudah dianggarkan.
  • Per kalimat dan paragraf: menjaga satuan makna, jumlahnya agak tidak beraturan.
  • Rekursif dan semantik: pengambilan lebih baik, biaya lebih tinggi dan kurang terprediksi.

Menyetel ukuran dan tumpang tindih

Mulai dari 512 token dengan tumpang tindih 50, ukur kualitas pengambilan, lalu sesuaikan. Menambah tumpang tindih memperbaiki kesinambungan tetapi menaikkan biaya ingest.

  1. Estimasi jumlah chunk dengan ukuran dan tumpang tindih saat ini.
  2. Hitung biaya embedding dan penyimpanan vektor yang dihasilkan.
  3. Uji konfigurasi kedua (misalnya 256 token) dan bandingkan kedua skenario.
  4. Pilih konfigurasi dengan keseimbangan terbaik antara pengambilan, biaya, dan penyimpanan.

Pertanyaan yang Sering Diajukan

Chunk adalah potongan teks dengan panjang tetap atau variabel yang dihasilkan dari pemotongan dokumen besar. Pada sistem RAG (Retrieval-Augmented Generation), dokumen dipotong menjadi chunk, setiap chunk diubah menjadi embedding vektor, dan embedding disimpan di basis data vektor. Saat kueri, chunk yang paling mirip secara semantik diambil lalu disisipkan sebagai konteks ke prompt LLM.

Untuk pemotongan ukuran tetap: chunk = ceil((token_dokumen − tumpang_tindih) / (ukuran_chunk − tumpang_tindih)). Dokumen 1.000 token dengan ukuran chunk 512 dan tumpang tindih 50 menghasilkan ceil((1000 − 50) / (512 − 50)) = ceil(950 / 462) = 3 chunk per dokumen. Strategi kalimat dan paragraf memberi angka sedikit berbeda akibat penyejajaran batas.

Titik awal yang umum adalah 512 token dengan tumpang tindih 50 untuk dokumen prosa. Chunk lebih kecil (128-256 token) meningkatkan presisi pengambilan tetapi bisa kurang konteks. Chunk lebih besar (1024+ token) memberi konteks lebih kaya tetapi bisa menurunkan relevansi. Ukuran optimal bergantung pada jenis dokumen, gaya kueri, dan model embedding. Selalu evaluasi kualitas pengambilan secara empiris.

Token tumpang tindih dibagi antar chunk berurutan. Dengan ukuran 512 dan tumpang tindih 50, 50 token terakhir chunk N menjadi 50 token pertama chunk N+1. Ini mencegah kehilangan informasi di sekitar batas chunk dan meningkatkan kesinambungan untuk kueri yang melintasi batas. Tumpang tindih menambah total chunk dan biaya embedding secara proporsional.

Biaya embedding = total_chunk × token_per_chunk / 1.000.000 × biaya_per_juta_token. Contohnya, 1.000 chunk × 512 token = 512.000 token untuk divektorisasi. Dengan OpenAI text-embedding-3-small ($0,020/juta token), biayanya $0,0102. Setiap chunk divektorisasi sekali saat ingest — vektorisasi ulang hanya perlu jika konten berubah.

Penyimpanan vektor = total_chunk × dimensi_embedding × 4 byte (float32). Untuk 10.000 chunk dengan OpenAI text-embedding-3-small (1.536 dim): 10.000 × 1.536 × 4 = ~61,4 MB vektor mentah. Penyimpanan basis data nyata lebih besar karena metadata, struktur indeks (graf HNSW), dan replikasi. Model terkuantisasi (int8) memangkas estimasi ini setengahnya.

Ya. Kalkulator berjalan seluruhnya di browser Anda. Tidak ada konten dokumen, detail dataset, atau konfigurasi yang dikirim ke server mana pun. Semua perhitungan — jumlah chunk, biaya embedding, penyimpanan — dilakukan lokal di perangkat Anda. Data Anda tetap 100 % privat, tanpa pendaftaran.