Kalkulator Biaya Inferensi
Estimasi gratis dan online pengeluaran inferensi LLM dari permintaan, latensi, dan volume token. Modelkan diskon cache prompt, penghematan Batch API, overhead percobaan ulang, dan kapasitas throughput bersamaan — lalu bandingkan biaya dan latensi di 14 model. Berjalan 100 % di browser Anda.
Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.
Real-time user-facing chat with sub-2s latency SLA
Token Sizes per Request
Request Volume & Latency
Cost Optimizations
Projected Monthly Inference Cost
Cost / Request
$0.000330
Cost / 1K Req
$0.3300
Est. Latency
3.8s
Max RPS
13.3
Per-Request Cost Breakdown
Model Cost & Latency Comparison
Sorted by lowest monthly cost| Model | $/req | Monthly Cost | Latency | SLA |
|---|---|---|---|---|
Llama 3.1 8BBudget Groq/Together · 600 tok/s · TTFT 80ms | $0.00006800 | $41.62 | 663ms | ✓ Met |
Mistral Small 3.2Budget Mistral · 160 tok/s · TTFT 160ms | $0.000185 | $113.22 | 2.3s | ✗ Breach |
GPT-4o miniBudget Selected OpenAI · 100 tok/s · TTFT 250ms | $0.000330 | $201.96 | 3.8s | ✗ Breach |
DeepSeek-V3Budget DeepSeek · 90 tok/s · TTFT 300ms | $0.000601 | $367.81 | 4.2s | ✗ Breach |
Llama 3.3 70BBudget Groq/Togther · 250 tok/s · TTFT 120ms | $0.000749 | $458.08 | 1.5s | ✗ Breach |
Gemini 2.5 FlashBudget Google · 150 tok/s · TTFT 180ms | $0.001115 | $682.38 | 2.5s | ✗ Breach |
Grok 4.3 xAI · 80 tok/s · TTFT 350ms | $0.001875 | $1,147.50 | 4.7s | ✗ Breach |
Claude 3.5 HaikuBudget Anthropic · 130 tok/s · TTFT 200ms | $0.002040 | $1,248.48 | 2.9s | ✗ Breach |
o4-mini OpenAI · 50 tok/s · TTFT 600ms | $0.002420 | $1,481.04 | 7.6s | ✗ Breach |
Mistral Large 3 Mistral · 70 tok/s · TTFT 380ms | $0.003700 | $2,264.40 | 5.4s | ✗ Breach |
o3Capable OpenAI · 45 tok/s · TTFT 700ms | $0.004400 | $2,692.80 | 8.5s | ✗ Breach |
Gemini 2.5 Pro Google · 65 tok/s · TTFT 450ms | $0.004500 | $2,754.00 | 5.8s | ✗ Breach |
GPT-4oCapable OpenAI · 60 tok/s · TTFT 400ms | $0.005500 | $3,366.00 | 6.2s | ✗ Breach |
Claude Sonnet 4.6Capable Anthropic · 55 tok/s · TTFT 500ms | $0.007650 | $4,681.80 | 6.9s | ✗ Breach |
Apa saja isi biaya inferensi
Biaya inferensi bergantung pada jumlah permintaan, ukuran input dan output setiap permintaan, serta model yang dipilih. Kombinasi ketiga faktor ini benar-benar mengubah hasilnya.
Karena token output lebih mahal daripada token input, jawaban panjang dengan prompt pendek bisa lebih mahal daripada sebaliknya.
- Permintaan harian × biaya per permintaan = pengeluaran dasar harian.
- Token output lebih mahal: awasi panjang jawaban.
- Latensi target memengaruhi model yang mampu Anda bayar.
Diskon cache dan batch
Cache prompt dan Batch API adalah dua tuas utama untuk menekan tagihan tanpa menurunkan kualitas. Masing-masing cocok untuk pola trafik berbeda.
- Cache prompt: berguna bila system prompt atau konteks besar dan berulang.
- Batch API: sekitar 50 % diskon untuk pekerjaan asinkron.
- Percobaan ulang: menambah volume dan total biaya secara proporsional.
Memeriksa SLA latensi
Biaya murah tak berguna jika pengalaman memburuk. Latensi estimasi dihitung dari TTFT ditambah waktu generasi token output.
- Tentukan TTFT dan kecepatan generasi model yang dinilai.
- Hitung latensi ujung ke ujung dengan ukuran output tipikal Anda.
- Bandingkan hasilnya dengan target SLA Anda.
- Jika gagal, ganti ke model lebih cepat atau kurangi panjang output.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan berapa biaya menjalankan permintaan LLM langsung pada skala tertentu. Alat ini memakai jumlah token input dan output, volume permintaan harian, serta pilihan model untuk memproyeksikan biaya per permintaan dan total harian, bulanan, atau tahunan. Alat kami juga memodelkan kepatuhan SLA latensi, kapasitas throughput, cache prompt, diskon Batch API, dan overhead percobaan ulang — semuanya lokal di browser tanpa pendaftaran.
Biaya pelatihan adalah pengeluaran sekali untuk membangun atau menyempurnakan model memakai komputasi GPU. Biaya inferensi adalah pengeluaran berulang per permintaan yang Anda bayar setiap kali pengguna atau pipeline mengirim prompt dan menerima jawaban. Di sebagian besar aplikasi produksi, inferensi mendominasi pengeluaran AI berkelanjutan — skalanya mengikuti basis pengguna dan volume permintaan Anda.
Ya. Kalkulator berjalan sepenuhnya di sisi klien di browser Anda memakai JavaScript. Ukuran token, volume permintaan, target latensi, dan proyeksi biaya diproses lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun atau disimpan. Data Anda tetap 100 % privat selama sesi.
Latensi ujung ke ujung diestimasi sebagai: waktu ke token pertama (TTFT) + (token output ÷ kecepatan generasi dalam token/detik). Misalnya, model dengan TTFT 300 ms yang menghasilkan 500 token pada 100 token/detik memiliki latensi estimasi 300 ms + 5.000 ms = 5,3 detik. Nilai TTFT dan kecepatan adalah median representatif; nilai nyata bervariasi menurut wilayah penyedia, beban server, dan ukuran permintaan.
TTFT adalah waktu antara mengirim permintaan dan menerima token pertama jawaban. Ini menentukan seberapa cepat aplikasi Anda mulai menampilkan output ke pengguna. TTFT rendah (di bawah 200 ms) krusial untuk aplikasi chat interaktif. Model yang lebih kecil dan lebih terkuantisasi biasanya punya TTFT lebih rendah daripada model frontier besar.
Cache prompt menyimpan status atensi KV dari prefiks prompt yang berulang, sehingga permintaan berikutnya dengan prefiks sama ditagih sekitar 25 % dari tarif input standar. Ini sangat efektif ketika system prompt atau konteks dokumen Anda besar dan dipakai bersama oleh banyak permintaan.
Gunakan Batch API untuk beban yang tidak sensitif latensi: ringkasan dokumen massal, pengayaan data offline, klasifikasi skala besar, pembuatan laporan malam. Batch API menagih sekitar 50 % dari tarif real-time standar. Inferensi real-time tetap diperlukan untuk fitur interaktif apa pun yang dilihat pengguna.
Tingkat 2-5 % umum untuk beban API LLM produksi, mencakup error batas laju, timeout sementara, dan error 5xx dari penyedia. Aplikasi throughput tinggi yang sering memanggil mendekati batas bisa melihat tingkat 5-15 %. Tingkat percobaan ulang menambah jumlah permintaan dan biaya secara proporsional.