Kalkulator Pengemasan Konteks
Optimalkan gratis berapa banyak chunk RAG yang muat di jendela konteks model mana pun. Atur ukuran chunk, tumpang tindih, prompt sistem, cadangan output, dan buffer keamanan untuk GPT, Claude, Gemini, DeepSeek, Llama, dan Mistral. Lihat rincian token lengkap, bilah konteks, dan perbandingan antar model seketika.
Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.
Fixed Context Overhead
Chunk Configuration
Safety Buffer & Volume
Max Chunks That Fit
326
of 400-token chunks
Tokens for Chunks
114.2K
of 128.0K ctx window
Unused Tokens
0
headroom remaining
Context Window Breakdown - GPT-4o
| Slot | Tokens | % of Window | Notes |
|---|---|---|---|
| System Prompt | 400 | 0% | Fixed overhead |
| User Query | 150 | 0% | Fixed overhead |
| Retrieved Chunks | 114,150 | 89% | 326 × 400 tok |
| Output Reserve | 500 | 0% | Max response |
| Safety Buffer | 12,800 | 10% | 10% headroom |
| Unused / Slack | 0 | 0% | Free headroom |
Monthly RAG Query Cost - 30,000 requests
Per Query (Input)
$0.2880
Per Query (Output)
$0.005000
Total Per Query
$0.2930
Chunks That Fit - All Models
Sorted by most chunks first| Model | Context | Max Chunks | Monthly Cost | Min Met? |
|---|---|---|---|---|
GoogleGemini 2.5 ProCapable | 2.0M | 5,139 | $67,640.62 | Yes |
OpenAIGPT-5.4Capable | 1.0M | 2,568 | $67,792.50 | Yes |
GoogleGemini 2.5 FlashBudget | 1.0M | 2,568 | $8,136.60 | Yes |
GoogleGemini 3.5 FlashBudget | 1.0M | 2,568 | $40,630.50 | Yes |
DeepSeekDeepSeek V4 ProBudget | 1.0M | 2,568 | $11,756.75 | Yes |
DeepSeekDeepSeek V4 FlashBudget | 1.0M | 2,568 | $3,783.78 | Yes |
MetaLlama 4 MaverickBudget | 524.0K | 1,344 | $3,125.10 | Yes |
OpenAIo3 (Reasoning) | 200.0K | 511 | $10,917.00 | Yes |
AnthropicClaude Sonnet 4.6Capable | 200.0K | 511 | $16,420.50 | Yes |
AnthropicClaude Haiku 4.5Budget | 200.0K | 511 | $5,473.50 | Yes |
AnthropicClaude Opus 4.8Capable | 200.0K | 511 | $27,367.50 | Yes |
MistralMistral Large | 131.1K | 333 | $7,149.00 | Yes |
MistralMistral SmallBudget | 131.1K | 333 | $357.45 | Yes |
OpenAIGPT-4o Selected | 128.0K | 326 | $8,790.00 | Yes |
OpenAIGPT-4o MiniBudget | 128.0K | 326 | $527.40 | Yes |
Apa yang menghabiskan anggaran token sebuah kueri
Jendela konteks tidak hanya tersedia untuk chunk yang diambil. Prompt sistem, kueri pengguna, format pesan, dan jawaban yang diharapkan memakai anggaran sebelum satu dokumen pun masuk.
Masukkan ukuran jendela, token tetap, dan ukuran chunk untuk melihat berapa chunk yang sebenarnya muat dan berapa banyak konteks yang tidak terpakai.
- Konteks efektif = jendela konteks × (1 − buffer keamanan).
- Tersedia = konteks efektif − prompt sistem − kueri − cadangan output.
- Maksimum chunk = 1 + floor((tersedia − ukuran) / (ukuran − tumpang tindih)).
Menyeimbangkan chunk dan struktur
Chunk lebih kecil lebih sering muat, tetapi memberi konteks lebih sedikit. Chunk lebih besar memberi konteks lebih banyak per unit, tetapi mengurangi jumlah dokumen berbeda yang bisa disertakan.
- Mengambil 3-8 chunk per kueri adalah norma di produksi.
- Tumpang tindih 10-15 % menjaga kesinambungan di batas chunk.
- Cadangan output terlalu kecil adalah penyebab truncation paling umum.
Menyetel sistem langkah demi langkah
Mulai dari model dan jendela konteks, lalu sesuaikan ukuran chunk hingga cukup banyak dokumen relevan yang muat dengan cadangan output yang nyaman.
- Pilih model dan tetapkan buffer keamanan untuk mendapatkan konteks efektif.
- Kurangi token prompt sistem, kueri, dan cadangan output.
- Sesuaikan ukuran chunk dan tumpang tindih sampai mencapai jumlah chunk yang dibutuhkan.
- Periksa rincian token dan bandingkan dengan model lain sebelum menerapkan.
Pertanyaan yang Sering Diajukan
Alat ini menentukan berapa banyak chunk dokumen yang diambil bisa muat di jendela konteks sebuah model bahasa untuk satu kueri RAG. Alat ini memperhitungkan biaya tetap seperti prompt sistem, kueri pengguna, dan cadangan output, lalu menghitung jumlah chunk maksimum dengan rumus jendela geser.
Rumusnya: max_chunk = 1 + floor((token_tersedia − ukuran_chunk) / (ukuran_chunk − tumpang_tindih)). Dengan token_tersedia = konteks_efektif − token_prompt_sistem − token_kueri − token_cadangan_output, dan konteks_efektif = jendela_konteks × (1 − buffer_keamanan).
Sebagian besar sistem RAG produksi memakai ukuran chunk antara 256 dan 512 token. Chunk lebih kecil meningkatkan presisi pengambilan tetapi butuh lebih banyak chunk untuk mencakup satu topik. Ukuran 400 token dengan tumpang tindih 10 % adalah titik awal yang umum untuk RAG serbaguna.
Tumpang tindih berarti chunk yang berdekatan berbagi sebagian token di batasnya. Ini menjaga kesinambungan kalimat dan paragraf: informasi yang terpotong batas tersedia di kedua chunk, sehingga meningkatkan recall pengambilan. Tumpang tindih tipikal 10-15 % dari ukuran chunk.
LLM memakai jendela konteks yang sama untuk input dan output. Jika seluruh konteks diisi token prompt, model tidak punya ruang untuk menghasilkan jawaban. Selalu cadangkan minimal 256-512 token untuk jawaban pendek, atau lebih untuk keluaran panjang dan terstruktur.
Buffer keamanan mencadangkan persentase jendela konteks sebagai ruang cadangan untuk variasi tokenisasi. Jumlah token nyata bisa berbeda beberapa persen dari estimasi karena token format pesan dan perbedaan tokenizer antar model. Buffer 5-10 % mencegah error overflow di produksi.
Sebagian besar sistem RAG mengambil 3-8 chunk per kueri. Kurang dari 3 mungkin tidak memberi konteks yang cukup beragam. Lebih dari 8 bisa mengencerkan relevansi. Angka optimal bergantung pada kasus penggunaan: Q&A faktual biasanya butuh 3-5 chunk, sedangkan sintesis dokumen bisa memanfaatkan 8-12.
Sepenuhnya. Kalkulator berjalan seluruhnya di browser Anda. Ukuran chunk, jumlah token, pengaturan model, dan estimasi biaya diproses lokal — tidak ada yang dikirim ke server. Konfigurasi pipeline RAG Anda tetap 100 % privat.