Kalkulator Penggunaan Konteks
Analisis berapa banyak jendela konteks sebuah model dipakai data input Anda — online, gratis, dan 100 % privat. Bagi prompt menjadi segmen bernama (prompt sistem, riwayat, dokumen, pesan pengguna), tetapkan cadangan output, dan lihat rincian persentase per segmen pada GPT-4o, Claude, Gemini, Mistral, DeepSeek, dan lainnya seketika.
Break your prompt into named components - system prompt, conversation history, retrieved documents, user message - and instantly see how much of the selected model's context window each part consumes. Supports all major LLMs with live percentage breakdowns.
Reserve space for the model's reply. Most responses use 500-4,000 tokens. Instruction tasks average ~1,000; code generation averages ~2,000.
Context Window Breakdown - GPT-4o
Segment Breakdown
| Segment | Tokens | % of Context | % of Input | Input Cost |
|---|---|---|---|---|
System Prompt | ~500 | 0% | 4% | $0.001250 |
Conversation History | ~3,000 | 2% | 26% | $0.007500 |
Retrieved Documents | ~8,000 | 6% | 68% | $0.0200 |
User Message | ~200 | 0% | 2% | $0.000500 |
Output Reserve | ~2,000 | 2% | - | - |
| Total | ~13,700 | 10.7% | - | $0.0293 |
Input Tokens
~11,700
Context Remaining
114,300
Context Used
10.7%
Input Cost
$0.0293
Apa yang disembunyikan oleh pengisian konteks
Mengetahui prompt memakai 70 % jendela tidak menjelaskan bagian mana yang memberi nilai. Rincian per segmen mengungkap apakah riwayat percakapan mendesak dokumen yang diambil atau apakah prompt sistem menjadi tidak proporsional.
Tambahkan satu segmen untuk setiap komponen prompt dan masukkan tokennya untuk melihat persentase masing-masing serta kapasitas nyata yang tersisa.
- Selalu pisahkan prompt sistem, riwayat, dokumen, dan pesan pengguna.
- Setiap token konteks menambah biaya API di tiap permintaan, bukan sekali saja.
- Mencadangkan token output mencegah error akibat prompt terlalu panjang.
Efek «hilang di tengah»
Konteks panjang tidak diperlakukan merata. Informasi di tengah cenderung berbobot lebih kecil pada jawaban, meskipun model bisa mengaksesnya.
- Tempatkan instruksi kritis di awal dan akhir prompt.
- Jaga pengisian di bawah 80 % saat pengambilan informasi penting.
- Kurangi riwayat percakapan lebih dulu sebelum memotong dokumen yang diambil.
Menyetel prompt berbasis data
Mengukur per segmen menjadikan penyetelan prompt keputusan yang berdasar, bukan pemotongan buta setiap kali muncul error konteks.
- Tempel atau perkirakan ukuran tiap segmen prompt Anda.
- Periksa persentase masing-masing dan temukan pemakai terbesar.
- Kurangi segmen dominan lalu lihat kembali total pengisian.
- Ulangi dengan model lain untuk melihat ruang yang diperoleh atau hilang.
Pertanyaan yang Sering Diajukan
Alat ini menunjukkan berapa banyak jendela konteks sebuah model bahasa yang dipakai data input Anda, dipecah per segmen. Anda menentukan komponen prompt (instruksi sistem, riwayat percakapan, dokumen yang diambil, pesan pengguna) dan kalkulator menampilkan jumlah token tiap komponen, persentase dari total jendela, serta kontribusinya pada biaya API. Ini membantu merancang prompt yang andal muat dalam batas model.
Jendela konteks adalah jumlah token maksimum yang diproses LLM dalam satu permintaan, termasuk seluruh prompt, riwayat percakapan, dokumen, dan jawaban yang dihasilkan. Jika input melebihi jendela, model akan memotong input atau menolak permintaan dengan error. Memantau pemakaian konteks sangat penting untuk chatbot multi-giliran, pipeline RAG, dan aplikasi apa pun yang mengirim dokumen besar ke model.
Estimasi akurat dalam ±5-10 % untuk prosa bahasa Inggris tipikal dengan memakai rasio rata-rata karakter per token yang dipublikasikan tiap keluarga model. Teks non-Inggris, kode dengan banyak simbol, dan konten berpungtuasi padat bisa ditokenisasi berbeda. Untuk angka produksi yang tepat, gunakan tokenizer resmi penyedia (tiktoken OpenAI, countTokens Anthropic, API countTokens Google).
Bisa. Setiap baris segmen punya pemilih satuan untuk beralih antara token, karakter, dan kata. Kalkulator mengubah karakter dan kata menjadi estimasi token otomatis memakai rasio model yang dipilih. Ini berguna ketika Anda tahu jumlah karakter dokumen atau jumlah kata suatu bagian tetapi belum menjalankannya di tokenizer.
Kolom ini mengurangi sejumlah token tetap dari konteks yang tersedia untuk memperhitungkan jawaban model. Karena jendela konteks harus memuat input dan output, penting menyisakan ruang cukup. Cadangan umum adalah 500-1.000 token untuk jawaban pendek, 2.000 untuk pembuatan kode, dan 4.000+ untuk laporan panjang.
Riset dan pengalaman praktisi menunjukkan model dengan konteks sangat panjang cenderung memberi bobot lebih kecil pada informasi di tengah jendela — fenomena «lost in the middle». Untuk performa pengambilan terbaik, letakkan instruksi penting di bagian awal dan akhir prompt serta usahakan tetap di bawah 80 % pengisian.
Ya. Kalkulator berjalan seluruhnya di sisi klien, di browser Anda. Teks prompt, ukuran segmen, dan analisis pemakaian dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Anda bisa dengan aman menempelkan dokumen rahasia, kode proprietari, dan instruksi sensitif.