Lompat ke konten
Aback Tools Logo

Kalkulator Biaya Prompt

Estimasi gratis dan online biaya menjalankan prompt dalam skala besar. Tentukan prompt sistem, pesan pengguna, dan ukuran token output, lalu atur volume permintaan harian untuk melihat proyeksi biaya API per hari, bulan, dan tahun. Bandingkan biaya di 13 penyedia LLM utama seketika. Cepat, privat, dan 100 % di browser.

Prompt Cost Calculator

Estimate the cost of running prompts at scale. Define your system prompt, user message, and output size - then set your request volume to see daily, monthly, and yearly API cost projections across all major models.

Support chatbot with system prompt + short user messages

Prompt Composition (per request)

tokens
tokens
tokens

Token Breakdown per Request

System: 800User: 150Output: 300Total: 1,250

Scale & Model

Input/1M: $0.15Output/1M: $0.60
req/day
% / mo

Projected Monthly Cost - GPT-4o mini

$48.38for 150,000 requests

Cost / Request

$0.000322

Cost / Day

$1.61

Input Token Cost

$21.38

Output Token Cost

$27.00

Cheapest option: Mistral Small (Mistral) would cost $27.75 monthly - saving $20.63 vs your selection.

Cost at Scale - All Periods

PeriodTotal RequestsInput CostOutput CostTotal Cost
Daily5,000$0.7125$0.9000$1.61
MonthlySelected150,000$21.38$27.00$48.38
Yearly1,825,000$260.06$328.50$588.56

Cross-Model Price Comparison

Sorted by lowest monthly cost
ModelIn/1MOut/1MCost/ReqMonthly Total
Mistral Small(Mistral)Budget
$0.10$0.30$0.000185$27.75
GPT-4o mini(OpenAI)Budget Active
$0.15$0.60$0.000322$48.37
DeepSeek-V3(DeepSeek)Budget
$0.27$1.10$0.000586$87.98
Gemini 2.5 Flash(Google)Budget
$0.30$2.50$0.001035$155.25
Grok 4.3(xAI)
$1.25$2.50$0.001937$290.63
Claude 3.5 Haiku(Anthropic)Budget
$0.80$4.00$0.001960$294.00
o4-mini(OpenAI)Budget
$1.10$4.40$0.002365$354.75
Mistral Large(Mistral)
$2.00$6.00$0.003700$555.00
Gemini 2.5 Pro(Google)
$1.25$10.00$0.004187$628.12
o3(OpenAI)
$2.00$8.00$0.004300$645.00
GPT-4o(OpenAI)
$2.50$10.00$0.005375$806.25
Claude Sonnet 4.6(Anthropic)Powerful
$3.00$15.00$0.007350$1,102.50
Claude 3 Opus(Anthropic)Powerful
$15.00$75.00$0.0367$5,512.50

Click any row to select that model.

Disclaimer: Estimates use standard Pay-As-You-Go rates. Token counts are approximations - actual tokenization varies by model and content. Prompt caching, batch discounts, and volume pricing are not included unless your provider plan applies them automatically. Always verify current rates with each provider before budgeting.

Mengapa prompt sistem mendominasi tagihan

Prompt sistem dikirim lengkap pada setiap permintaan. Biayanya tidak bergantung pada seberapa berguna, tetapi pada berapa banyak permintaan yang Anda buat.

Pada volume tinggi, memangkas beberapa ratus token dari prompt sistem memberi penghematan bulanan yang signifikan.

  • Biaya prompt sistem = token × permintaan per hari × hari.
  • Token output 3-6× lebih mahal daripada token input.
  • Cache prompt menurunkan biaya itu 75-90 % saat berlaku.

Memisahkan pesan pengguna dan konteks

Pisahkan konteks tetap dari yang berubah tiap permintaan. Hanya bagian tetap yang bisa di-cache.

  1. Ukur token prompt sistem dan pesan pengguna secara terpisah.
  2. Jumlahkan token input yang diperkirakan per permintaan.
  3. Tambahkan token output yang diharapkan per jawaban.
  4. Kalikan dengan volume permintaan untuk total periode.

Memilih model dan memproyeksikan pertumbuhan

Bandingkan biaya total konfigurasi Anda antar model sebelum memutuskan. Model termurah yang memenuhi syarat kualitas hampir selalu pilihan terbaik.

  • Mulai dari model paling hemat dan naik hanya bila kualitas kurang.
  • Modelkan pertumbuhan bulanan agar anggaran tidak kurang.
  • Sisakan model frontier untuk penalaran kompleks.

Pertanyaan yang Sering Diajukan

Alat ini memperkirakan pengeluaran API untuk menjalankan konfigurasi prompt tertentu - termasuk prompt sistem, pesan pengguna, dan output yang diharapkan - pada volume permintaan dan periode tertentu. Alat ini membantu developer dan tim produk mengetahui biaya API LLM sebelum meluncurkan, merencanakan tingkat harga SaaS AI, dan membandingkan model mana yang memberi rasio biaya-kualitas terbaik.

Perkiraan kasar: 1 token ≈ 4 karakter, atau sekitar 0,75 kata dalam bahasa Inggris. Prompt sistem 500 kata sekitar 650-700 token. Pesan pengguna singkat 50 kata sekitar 65-70 token. Untuk hitungan presisi, gunakan tokenizer: Tiktoken dari OpenAI dan tokenizer Claude dari Anthropic tersedia sebagai open source. Alat Token Counter kami juga bisa memperkirakan token dari teks yang ditempel.

Prompt sistem ditagih penuh pada setiap permintaan API. Jika prompt sistem Anda 1.000 token dan Anda membuat 10.000 permintaan per hari, itu 10 juta token input hanya dari prompt sistem, setiap hari. Karena itu prompt sistem yang panjang dan bertele-tele membengkakkan biaya. Memangkas prompt sistem dan mengaktifkan cache prompt adalah dua optimasi dengan ROI tertinggi untuk sebagian besar aplikasi LLM produksi.

Tidak - kalkulator ini memakai tarif standar pay-as-you-go tanpa cache. Ini sengaja memberi biaya dasar skenario terburuk. Dalam praktiknya, penyedia seperti OpenAI, Anthropic, Google, dan xAI menawarkan cache prompt yang menurunkan biaya token input 75-90 % untuk konten statis berulang. Pakai alat ini untuk menetapkan dasar, lalu modelkan penghematan cache secara terpisah.

Gunakan tabel perbandingan antar model: tabel itu menunjukkan biaya total untuk konfigurasi Anda di semua model yang didukung. Mulai dari model termurah yang memenuhi standar kualitas Anda. Tugas seperti klasifikasi, ekstraksi, dan output terstruktur sering bekerja sangat baik pada model lebih kecil (GPT-4o mini, Claude 3.5 Haiku, Gemini Flash, Mistral Small). Sisakan model frontier mahal untuk tugas yang benar-benar butuh penalaran mendalam.

Kolom itu memodelkan pertumbuhan volume permintaan sepanjang periode proyeksi. Jika Anda memasukkan 20 %, kalkulator mengasumsikan jumlah permintaan harian Anda naik 20 % setiap bulan. Untuk proyeksi tahunan, digunakan interpolasi linier antara volume awal dan volume akhir yang diproyeksikan. Setel 0 untuk proyeksi tetap.

Menghasilkan token membuat model menjalankan forward pass autoregresif penuh untuk setiap token - jauh lebih banyak komputasi daripada membaca token input. Karena itu generasi output lebih mahal dan dihargai dengan premi 3-6× atas token input di sebagian besar penyedia. Ini sebabnya aplikasi dengan jawaban panjang punya profil biaya berbeda dari klasifikator beroutput pendek.

Ya. Kalkulator ini berjalan seluruhnya di sisi klien di browser Anda. Tidak ada jumlah token, konfigurasi prompt, estimasi biaya, atau pilihan model yang dikirim ke server mana pun. Semua dihitung lokal di perangkat Anda dan tidak disimpan. Data perencanaan Anda 100 % privat dan aman.