Lompat ke konten
Aback Tools Logo

Kalkulator Jendela Konteks

Visualisasikan bagaimana prompt sistem, riwayat percakapan, dokumen RAG, dan pesan pengguna mengisi jendela konteks sebuah LLM. Tambahkan slot khusus, lihat pemakaian dan sisa kapasitas, bandingkan muatan Anda di 16 model populer, dan estimasi biaya input — semuanya gratis dan 100 % privat di browser Anda.

Context Window Calculator

Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Context Slots

System Prompt
0.4%
Conversation History
1.6%
Retrieved Documents (RAG)
3.1%
User Message
0.4%
Output Reserve
0.8%

Add Slot

Context Window Utilization - GPT-4o

6.3% used
System Prompt500
Conversation History2,000
Retrieved Documents (RAG)4,000
User Message500
Output Reserve1,000
Free120,000

Used

8,000

Limit

128,000

Remaining

120,000

Input Cost

$0.0200

Slot Breakdown

SlotTokens% of WindowInput Cost
System Prompt
5000.39%$0.001250
Conversation History
2,0001.56%$0.005000
Retrieved Documents (RAG)
4,0003.13%$0.0100
User Message
5000.39%$0.001250
Output Reserve
1,0000.78%$0.002500
Total8,0006.25%$0.0200

Same Payload Across Models

ModelContext Window% UsedFits?
GPT-4oSelected128,0006.3% Yes
GPT-4o mini128,0006.3% Yes
o3200,0004.0% Yes
o4-mini200,0004.0% Yes
Claude 3.7 Sonnet200,0004.0% Yes
Claude 3.5 Haiku200,0004.0% Yes
Claude Opus 4200,0004.0% Yes
Gemini 2.5 Pro2,000,0000.4% Yes
Gemini 2.5 Flash1,000,0000.8% Yes
DeepSeek-V4-Flash1,048,5760.8% Yes
DeepSeek-V4-Pro1,048,5760.8% Yes
Grok 3131,0726.1% Yes
Grok 3 Mini131,0726.1% Yes
Mistral Large131,0726.1% Yes
Mistral Small131,0726.1% Yes
Codestral256,0003.1% Yes
Note: Token counts entered here are the billable input tokens for each slot. Actual tokenization may vary slightly by model and content type (code vs. prose vs. non-English text). Context window limits shown are the maximum prompt+response window; reserve tokens for your expected output length.

Apa yang sebenarnya mengisi jendela konteks Anda

Di aplikasi nyata, prompt sistem dan riwayat percakapan sering memakai lebih banyak konteks daripada dokumen yang justru membawa jawaban. Visualisasi per slot membuat ketidakseimbangan ini terlihat.

Tambahkan satu slot per komponen, masukkan tokennya, dan lihat pemakaian total, sisa kapasitas, serta apakah muatan Anda muat di setiap model.

  • Jendela dibagi antara input dan output: prompt tidak pernah bisa mengisinya penuh.
  • Riwayat percakapan bertambah tiap giliran dan menggeser dokumen yang berguna.
  • Luapan ditandai merah sebelum sampai ke API.

Menganggarkan token untuk jawaban

Kesalahan paling umum adalah menghitung prompt sampai token terakhir dan melupakan jawaban. Cadangan output bagian dari anggaran yang sama.

  • Cadangkan 1.000-4.000 token untuk jawaban standar.
  • Untuk kode atau laporan panjang, cadangkan lebih banyak dan pangkas prompt.
  • Jika cadangan tidak muat, kurangi riwayat atau dokumen, bukan instruksi kritis.

Membandingkan model sebelum memutuskan

Muatan yang sama bisa muat lega di satu model dan meluap di model lain. Membandingkan beberapa model mencegah ganti penyedia setelah penerapan.

  1. Masukkan slot prompt Anda beserta tokennya.
  2. Tetapkan cadangan output yang dibutuhkan kasus penggunaan Anda.
  3. Lihat pemakaian yang dihasilkan pada setiap model di daftar.
  4. Pilih model yang menyisakan ruang cukup dengan biaya input terendah.

Pertanyaan yang Sering Diajukan

Ini jumlah token maksimum yang dapat diproses model bahasa besar dalam satu permintaan. Termasuk seluruh prompt (instruksi sistem, riwayat percakapan, dokumen yang diambil, dan pesan pengguna) plus jawaban yang dihasilkan. Jika totalnya melewati batas, model akan memotong atau menolak permintaan.

Jendela konteks adalah total anggaran token satu permintaan — dibagi antara input dan output. Token output maksimum adalah panjang maksimum jawaban yang dihasilkan. Misalnya, dengan jendela 128.000 token dan prompt 120.000 token, hanya tersisa 8.000 token untuk jawaban. Selalu sisakan ruang output saat merencanakan prompt.

Setiap slot di kalkulator ini menerima jumlah token secara langsung. Jika tidak tahu angka tepatnya, estimasi andal adalah 1 token per ~3,8-4,0 karakter untuk prosa Inggris, atau gunakan alat penghitung token kami untuk menghitung dari teks yang ditempel. Untuk kode, rasionya bervariasi sesuai bahasa dan kepadatan simbol.

Sebagian besar API mengembalikan error (400 atau 413) bila prompt melebihi batas konteks model. Beberapa model memotong secara diam-diam giliran percakapan terlama atau awal prompt, yang menyebabkan perilaku tak terduga. Kalkulator menandai luapan dengan warna merah agar Anda menangkapnya sebelum memanggil API.

Jendela konteks adalah anggaran bersama untuk prompt dan jawaban model. Jika prompt mengisi seluruh jendela, tidak ada token tersisa untuk menghasilkan output. Praktik terbaiknya adalah mencadangkan setidaknya sepanjang perkiraan jawaban maksimum — umumnya 1.000-4.000 token untuk jawaban standar, atau lebih untuk generasi panjang.

Per pertengahan 2026, Gemini 2.5 Pro dari Google menawarkan jendela konteks terbesar, yaitu 2.000.000 token. Gemini 2.5 Flash dan DeepSeek-V4-Flash mendukung lebih dari 1.000.000 token. Model Claude dari Anthropic dan o3/o4-mini dari OpenAI mendukung 200.000 token. GPT-4o, Grok 3, dan model Mistral biasanya menawarkan 128.000-131.072 token.

Ya. Kalkulator berjalan seluruhnya di browser Anda. Label slot, jumlah token, pilihan model, dan semua hasil dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Data Anda tetap 100 % privat — tanpa pendaftaran, tanpa pelacakan, tanpa unggahan.