Lompat ke konten
Aback Tools Logo

Kalkulator Pengemasan Konteks

Optimalkan gratis berapa banyak chunk RAG yang muat di jendela konteks model mana pun. Atur ukuran chunk, tumpang tindih, prompt sistem, cadangan output, dan buffer keamanan untuk GPT, Claude, Gemini, DeepSeek, Llama, dan Mistral. Lihat rincian token lengkap, bilah konteks, dan perbandingan antar model seketika.

Context Packing Calculator

Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Fixed Context Overhead

tokens
tokens
tokens
Fixed overhead: 1,050 tokens (1% of context)

Chunk Configuration

tokens
tokens
chunks

Safety Buffer & Volume

%
reqs

Max Chunks That Fit

326

of 400-token chunks

Tokens for Chunks

114.2K

of 128.0K ctx window

Unused Tokens

0

headroom remaining

Context Window Breakdown - GPT-4o

System (400)Query (150)Chunks (114.2K)Output (500)Buffer (12.8K)Unused (0)
Used: 115.2K (90%)Effective: 115.2KLimit: 128.0K
SlotTokens% of WindowNotes
System Prompt4000%Fixed overhead
User Query1500%Fixed overhead
Retrieved Chunks114,15089%326 × 400 tok
Output Reserve5000%Max response
Safety Buffer12,80010%10% headroom
Unused / Slack00%Free headroom

Monthly RAG Query Cost - 30,000 requests

$8,790.00GPT-4o

Per Query (Input)

$0.2880

Per Query (Output)

$0.005000

Total Per Query

$0.2930

Chunks That Fit - All Models

Sorted by most chunks first
ModelContextMax ChunksMonthly CostMin Met?
GoogleGemini 2.5 ProCapable
2.0M5,139$67,640.62 Yes
OpenAIGPT-5.4Capable
1.0M2,568$67,792.50 Yes
GoogleGemini 2.5 FlashBudget
1.0M2,568$8,136.60 Yes
GoogleGemini 3.5 FlashBudget
1.0M2,568$40,630.50 Yes
DeepSeekDeepSeek V4 ProBudget
1.0M2,568$11,756.75 Yes
DeepSeekDeepSeek V4 FlashBudget
1.0M2,568$3,783.78 Yes
MetaLlama 4 MaverickBudget
524.0K1,344$3,125.10 Yes
OpenAIo3 (Reasoning)
200.0K511$10,917.00 Yes
AnthropicClaude Sonnet 4.6Capable
200.0K511$16,420.50 Yes
AnthropicClaude Haiku 4.5Budget
200.0K511$5,473.50 Yes
AnthropicClaude Opus 4.8Capable
200.0K511$27,367.50 Yes
MistralMistral Large
131.1K333$7,149.00 Yes
MistralMistral SmallBudget
131.1K333$357.45 Yes
OpenAIGPT-4o Selected
128.0K326$8,790.00 Yes
OpenAIGPT-4o MiniBudget
128.0K326$527.40 Yes
Packing Formula: Chunk capacity = 1 + floor((available_tokens − chunk_size) / (chunk_size − overlap)). Available tokens = effective context − system prompt − query − output reserve. Effective context = context window × (1 − safety buffer%). Actual results may vary slightly due to tokenizer overhead on special tokens and message format wrappers.

Apa yang menghabiskan anggaran token sebuah kueri

Jendela konteks tidak hanya tersedia untuk chunk yang diambil. Prompt sistem, kueri pengguna, format pesan, dan jawaban yang diharapkan memakai anggaran sebelum satu dokumen pun masuk.

Masukkan ukuran jendela, token tetap, dan ukuran chunk untuk melihat berapa chunk yang sebenarnya muat dan berapa banyak konteks yang tidak terpakai.

  • Konteks efektif = jendela konteks × (1 − buffer keamanan).
  • Tersedia = konteks efektif − prompt sistem − kueri − cadangan output.
  • Maksimum chunk = 1 + floor((tersedia − ukuran) / (ukuran − tumpang tindih)).

Menyeimbangkan chunk dan struktur

Chunk lebih kecil lebih sering muat, tetapi memberi konteks lebih sedikit. Chunk lebih besar memberi konteks lebih banyak per unit, tetapi mengurangi jumlah dokumen berbeda yang bisa disertakan.

  • Mengambil 3-8 chunk per kueri adalah norma di produksi.
  • Tumpang tindih 10-15 % menjaga kesinambungan di batas chunk.
  • Cadangan output terlalu kecil adalah penyebab truncation paling umum.

Menyetel sistem langkah demi langkah

Mulai dari model dan jendela konteks, lalu sesuaikan ukuran chunk hingga cukup banyak dokumen relevan yang muat dengan cadangan output yang nyaman.

  1. Pilih model dan tetapkan buffer keamanan untuk mendapatkan konteks efektif.
  2. Kurangi token prompt sistem, kueri, dan cadangan output.
  3. Sesuaikan ukuran chunk dan tumpang tindih sampai mencapai jumlah chunk yang dibutuhkan.
  4. Periksa rincian token dan bandingkan dengan model lain sebelum menerapkan.

Pertanyaan yang Sering Diajukan

Alat ini menentukan berapa banyak chunk dokumen yang diambil bisa muat di jendela konteks sebuah model bahasa untuk satu kueri RAG. Alat ini memperhitungkan biaya tetap seperti prompt sistem, kueri pengguna, dan cadangan output, lalu menghitung jumlah chunk maksimum dengan rumus jendela geser.

Rumusnya: max_chunk = 1 + floor((token_tersedia − ukuran_chunk) / (ukuran_chunk − tumpang_tindih)). Dengan token_tersedia = konteks_efektif − token_prompt_sistem − token_kueri − token_cadangan_output, dan konteks_efektif = jendela_konteks × (1 − buffer_keamanan).

Sebagian besar sistem RAG produksi memakai ukuran chunk antara 256 dan 512 token. Chunk lebih kecil meningkatkan presisi pengambilan tetapi butuh lebih banyak chunk untuk mencakup satu topik. Ukuran 400 token dengan tumpang tindih 10 % adalah titik awal yang umum untuk RAG serbaguna.

Tumpang tindih berarti chunk yang berdekatan berbagi sebagian token di batasnya. Ini menjaga kesinambungan kalimat dan paragraf: informasi yang terpotong batas tersedia di kedua chunk, sehingga meningkatkan recall pengambilan. Tumpang tindih tipikal 10-15 % dari ukuran chunk.

LLM memakai jendela konteks yang sama untuk input dan output. Jika seluruh konteks diisi token prompt, model tidak punya ruang untuk menghasilkan jawaban. Selalu cadangkan minimal 256-512 token untuk jawaban pendek, atau lebih untuk keluaran panjang dan terstruktur.

Buffer keamanan mencadangkan persentase jendela konteks sebagai ruang cadangan untuk variasi tokenisasi. Jumlah token nyata bisa berbeda beberapa persen dari estimasi karena token format pesan dan perbedaan tokenizer antar model. Buffer 5-10 % mencegah error overflow di produksi.

Sebagian besar sistem RAG mengambil 3-8 chunk per kueri. Kurang dari 3 mungkin tidak memberi konteks yang cukup beragam. Lebih dari 8 bisa mengencerkan relevansi. Angka optimal bergantung pada kasus penggunaan: Q&A faktual biasanya butuh 3-5 chunk, sedangkan sintesis dokumen bisa memanfaatkan 8-12.

Sepenuhnya. Kalkulator berjalan seluruhnya di browser Anda. Ukuran chunk, jumlah token, pengaturan model, dan estimasi biaya diproses lokal — tidak ada yang dikirim ke server. Konfigurasi pipeline RAG Anda tetap 100 % privat.