Kalkulator Biaya Prompt
Estimasi gratis dan online biaya menjalankan prompt dalam skala besar. Tentukan prompt sistem, pesan pengguna, dan ukuran token output, lalu atur volume permintaan harian untuk melihat proyeksi biaya API per hari, bulan, dan tahun. Bandingkan biaya di 13 penyedia LLM utama seketika. Cepat, privat, dan 100 % di browser.
Estimate the cost of running prompts at scale. Define your system prompt, user message, and output size - then set your request volume to see daily, monthly, and yearly API cost projections across all major models.
Support chatbot with system prompt + short user messages
Prompt Composition (per request)
Token Breakdown per Request
Scale & Model
Projected Monthly Cost - GPT-4o mini
Cost / Request
$0.000322
Cost / Day
$1.61
Input Token Cost
$21.38
Output Token Cost
$27.00
Cost at Scale - All Periods
| Period | Total Requests | Input Cost | Output Cost | Total Cost |
|---|---|---|---|---|
| Daily | 5,000 | $0.7125 | $0.9000 | $1.61 |
| MonthlySelected | 150,000 | $21.38 | $27.00 | $48.38 |
| Yearly | 1,825,000 | $260.06 | $328.50 | $588.56 |
Cross-Model Price Comparison
Sorted by lowest monthly cost| Model | In/1M | Out/1M | Cost/Req | Monthly Total |
|---|---|---|---|---|
Mistral Small(Mistral)Budget | $0.10 | $0.30 | $0.000185 | $27.75 |
GPT-4o mini(OpenAI)Budget Active | $0.15 | $0.60 | $0.000322 | $48.37 |
DeepSeek-V3(DeepSeek)Budget | $0.27 | $1.10 | $0.000586 | $87.98 |
Gemini 2.5 Flash(Google)Budget | $0.30 | $2.50 | $0.001035 | $155.25 |
Grok 4.3(xAI) | $1.25 | $2.50 | $0.001937 | $290.63 |
Claude 3.5 Haiku(Anthropic)Budget | $0.80 | $4.00 | $0.001960 | $294.00 |
o4-mini(OpenAI)Budget | $1.10 | $4.40 | $0.002365 | $354.75 |
Mistral Large(Mistral) | $2.00 | $6.00 | $0.003700 | $555.00 |
Gemini 2.5 Pro(Google) | $1.25 | $10.00 | $0.004187 | $628.12 |
o3(OpenAI) | $2.00 | $8.00 | $0.004300 | $645.00 |
GPT-4o(OpenAI) | $2.50 | $10.00 | $0.005375 | $806.25 |
Claude Sonnet 4.6(Anthropic)Powerful | $3.00 | $15.00 | $0.007350 | $1,102.50 |
Claude 3 Opus(Anthropic)Powerful | $15.00 | $75.00 | $0.0367 | $5,512.50 |
Click any row to select that model.
Mengapa prompt sistem mendominasi tagihan
Prompt sistem dikirim lengkap pada setiap permintaan. Biayanya tidak bergantung pada seberapa berguna, tetapi pada berapa banyak permintaan yang Anda buat.
Pada volume tinggi, memangkas beberapa ratus token dari prompt sistem memberi penghematan bulanan yang signifikan.
- Biaya prompt sistem = token × permintaan per hari × hari.
- Token output 3-6× lebih mahal daripada token input.
- Cache prompt menurunkan biaya itu 75-90 % saat berlaku.
Memisahkan pesan pengguna dan konteks
Pisahkan konteks tetap dari yang berubah tiap permintaan. Hanya bagian tetap yang bisa di-cache.
- Ukur token prompt sistem dan pesan pengguna secara terpisah.
- Jumlahkan token input yang diperkirakan per permintaan.
- Tambahkan token output yang diharapkan per jawaban.
- Kalikan dengan volume permintaan untuk total periode.
Memilih model dan memproyeksikan pertumbuhan
Bandingkan biaya total konfigurasi Anda antar model sebelum memutuskan. Model termurah yang memenuhi syarat kualitas hampir selalu pilihan terbaik.
- Mulai dari model paling hemat dan naik hanya bila kualitas kurang.
- Modelkan pertumbuhan bulanan agar anggaran tidak kurang.
- Sisakan model frontier untuk penalaran kompleks.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan pengeluaran API untuk menjalankan konfigurasi prompt tertentu - termasuk prompt sistem, pesan pengguna, dan output yang diharapkan - pada volume permintaan dan periode tertentu. Alat ini membantu developer dan tim produk mengetahui biaya API LLM sebelum meluncurkan, merencanakan tingkat harga SaaS AI, dan membandingkan model mana yang memberi rasio biaya-kualitas terbaik.
Perkiraan kasar: 1 token ≈ 4 karakter, atau sekitar 0,75 kata dalam bahasa Inggris. Prompt sistem 500 kata sekitar 650-700 token. Pesan pengguna singkat 50 kata sekitar 65-70 token. Untuk hitungan presisi, gunakan tokenizer: Tiktoken dari OpenAI dan tokenizer Claude dari Anthropic tersedia sebagai open source. Alat Token Counter kami juga bisa memperkirakan token dari teks yang ditempel.
Prompt sistem ditagih penuh pada setiap permintaan API. Jika prompt sistem Anda 1.000 token dan Anda membuat 10.000 permintaan per hari, itu 10 juta token input hanya dari prompt sistem, setiap hari. Karena itu prompt sistem yang panjang dan bertele-tele membengkakkan biaya. Memangkas prompt sistem dan mengaktifkan cache prompt adalah dua optimasi dengan ROI tertinggi untuk sebagian besar aplikasi LLM produksi.
Tidak - kalkulator ini memakai tarif standar pay-as-you-go tanpa cache. Ini sengaja memberi biaya dasar skenario terburuk. Dalam praktiknya, penyedia seperti OpenAI, Anthropic, Google, dan xAI menawarkan cache prompt yang menurunkan biaya token input 75-90 % untuk konten statis berulang. Pakai alat ini untuk menetapkan dasar, lalu modelkan penghematan cache secara terpisah.
Gunakan tabel perbandingan antar model: tabel itu menunjukkan biaya total untuk konfigurasi Anda di semua model yang didukung. Mulai dari model termurah yang memenuhi standar kualitas Anda. Tugas seperti klasifikasi, ekstraksi, dan output terstruktur sering bekerja sangat baik pada model lebih kecil (GPT-4o mini, Claude 3.5 Haiku, Gemini Flash, Mistral Small). Sisakan model frontier mahal untuk tugas yang benar-benar butuh penalaran mendalam.
Kolom itu memodelkan pertumbuhan volume permintaan sepanjang periode proyeksi. Jika Anda memasukkan 20 %, kalkulator mengasumsikan jumlah permintaan harian Anda naik 20 % setiap bulan. Untuk proyeksi tahunan, digunakan interpolasi linier antara volume awal dan volume akhir yang diproyeksikan. Setel 0 untuk proyeksi tetap.
Menghasilkan token membuat model menjalankan forward pass autoregresif penuh untuk setiap token - jauh lebih banyak komputasi daripada membaca token input. Karena itu generasi output lebih mahal dan dihargai dengan premi 3-6× atas token input di sebagian besar penyedia. Ini sebabnya aplikasi dengan jawaban panjang punya profil biaya berbeda dari klasifikator beroutput pendek.
Ya. Kalkulator ini berjalan seluruhnya di sisi klien di browser Anda. Tidak ada jumlah token, konfigurasi prompt, estimasi biaya, atau pilihan model yang dikirim ke server mana pun. Semua dihitung lokal di perangkat Anda dan tidak disimpan. Data perencanaan Anda 100 % privat dan aman.