Lompat ke konten
Aback Tools Logo

Apa Itu Kalkulator Harga per Kueri? Panduan Biaya API LLM

Pelajari cara kalkulator harga per kueri memperkirakan biaya API LLM: token, harga masukan dan keluaran, perbandingan model, serta strategi untuk menekan tagihan AI hingga 30-80 %.

DH
Tips & Best Practices11 menit baca2,550 kata

Setiap panggilan API ke GPT, Claude, Gemini, atau model bahasa besar lainnya punya biaya yang diukur dalam token - dan biaya itu berlipat cepat saat Anda menskalakan. Kalkulator harga per kueri menerjemahkan jumlah token menjadi rupiah atau dolar sehingga Anda bisa menyusun anggaran dengan akurat, memilih tingkat model yang tepat, dan menemukan titik optimasi sebelum tagihan API bulanan menjadi kejutan.

$0,01-0,15Biaya khas per kueriBervariasi menurut model dan panjang
30-60 %Potensi penghematan tokenDengan kompresi masukan
~0,75Kata per tokenRata-rata teks bahasa Inggris

Apa itu kalkulator harga per kueri?

Kalkulator harga per kueri adalah alat yang memperkirakan biaya API satu panggilan ke model bahasa besar (LLM). Anda memasukkan jumlah token masukan (prompt, konteks, dan dokumen yang diambil), jumlah token keluaran yang diharapkan (respons model), dan model yang dituju. Kalkulator mengalikan masing-masing dengan tarif per token yang dipublikasikan penyedia dan mengembalikan biaya per kueri, plus proyeksi total bulanan berdasarkan volume panggilan yang Anda harapkan.

Tujuan utamanya adalah membuat biaya AI bisa diprediksi. Tanpa kalkulator, mudah meremehkan seberapa cepat biaya token menumpuk pada skala besar. Kueri seharga $0,012 terasa tidak berarti, tetapi dengan 10.000 panggilan per hari itu berarti $120 per hari, atau $3.600 per bulan, dari satu endpoint API saja. Kalkulator harga per kueri menunjukkan hal ini sebelum Anda melakukan deploy, bukan sesudahnya.

Apa yang ditampilkan kalkulator harga per kueri

  • Biaya per kueri - nilai persis satu panggilan API dengan jumlah token dan model yang Anda tentukan.
  • Proyeksi harian dan bulanan - menerapkan biaya per kueri pada volume panggilan yang diharapkan.
  • Rincian masukan dan keluaran - menunjukkan berapa bagian biaya dari prompt dan berapa dari respons, karena token keluaran lebih mahal.
  • Perbandingan model - sebagian kalkulator memungkinkan membandingkan biaya kueri yang sama pada beberapa model sekaligus.

Note

Kalkulator harga per kueri memakai daftar harga penyedia, yang bisa berbeda dari tagihan sebenarnya jika Anda punya diskon volume negosiasi, tarif API batch, atau token prompt yang di-cache. Selalu verifikasi di dasbor penagihan penyedia setelah aplikasi berjalan di produksi.

Cara kerja harga token LLM

Penyedia LLM menagih per token, yaitu satuan teks yang kira-kira setara 0,75 kata dalam bahasa Inggris (atau sekitar 4 karakter). Harga dinyatakan per juta token ($/M), terpisah untuk masukan dan keluaran. Token masukan mencakup semua yang Anda kirim: prompt sistem, riwayat percakapan, pesan pengguna, potongan dokumen hasil pengambilan dari saluran RAG, serta skema fungsi atau alat. Token keluaran adalah respons yang dihasilkan model.

Token masukan dan keluaran dihargai terpisah. Token keluaran 3-5 kali lebih mahal daripada token masukan karena pembuatan teks lebih berat secara komputasi dibandingkan pemrosesan konteks.

- Konvensi penagihan API LLM standar, 2024-2026

Mengapa token keluaran lebih mahal

Saat inferensi, memproses token masukan hanya butuh satu lintasan maju melalui model. Menghasilkan token keluaran membutuhkan loop autoregresif: model membuat satu token setiap kali, dan tiap langkah bergantung pada langkah sebelumnya. Proses berurutan ini jauh lebih berat di GPU per token, sehingga penyedia mengenakan premi besar untuk keluaran. Pada harga GPT-4o, masukan berbiaya $2,50/M dan keluaran $10,00/M - kelipatan 4. Ini punya implikasi praktis langsung: respons panjang dan bertele-tele jauh lebih mahal dibandingkan respons ringkas.

Bagaimana jumlah token dipetakan ke panjang prompt nyata

  • Prompt pendek + jawaban pendek (mis. "Klasifikasikan teks ini"): total ~50-200 token.
  • Pesan sistem + kueri pengguna dengan konteks: ~500-2.000 token masukan, 100-500 token keluaran.
  • Kueri RAG dengan potongan dokumen: ~2.000-8.000 token masukan, 300-1.000 token keluaran.
  • Alur agen dengan hasil alat dan riwayat: ~8.000-32.000 token masukan per panggilan.
  • Pembuatan panjang (artikel, kode): ~1.000-4.000 token masukan, 1.000-4.000 token keluaran.

Tip

Aturan 1 token ≈ 0,75 kata berlaku untuk teks bahasa Inggris. Kode dan JSON jauh lebih tidak efisien secara token karena karakter khusus, spasi, dan token berulang ditokenisasi dengan kepadatan lebih rendah. Esai bahasa Inggris 1.000 kata memakai sekitar 1.300 token; 1.000 karakter JSON biasanya memakai 300-500 token, bukan ~250 seperti yang mungkin Anda perkirakan dari rasio bahasa Inggris.

Cara memperkirakan biaya kueri Anda

Memperkirakan biaya kueri secara akurat menuntut tiga angka: rata-rata jumlah token masukan per panggilan, rata-rata jumlah token keluaran per panggilan, dan volume panggilan harian Anda. Dua yang pertama paling baik diukur secara empiris dengan penghitung token dari penyedia atau kolom `usage` pada respons API - bukan diperkirakan dari jumlah kata.

Langkah 1 - Ukur pemakaian token nyata saat pengembangan

Setiap respons API LLM menyertakan objek `usage` dengan `prompt_tokens`, `completion_tokens`, dan `total_tokens`. Catat data ini selama pengembangan pada sampel representatif 50-100 kueri nyata. Hitung rata-rata dan persentil ke-95 untuk masukan maupun keluaran. Untuk perencanaan biaya, gunakan persentil ke-95 masukan dan rata-rata keluaran: ini memperhitungkan konteks besar yang tidak biasa tanpa melebih-lebihkan panggilan tipikal.

Langkah 2 - Perkirakan volume bulanan

Untuk aplikasi produksi, perkirakan pengguna aktif harian × rata-rata kueri per sesi × panggilan API per kueri. Chatbot dengan 1.000 pengguna harian, 5 pesan per sesi, dan 1 panggilan API per pesan menghasilkan 5.000 panggilan per hari. Kalikan biaya per panggilan dengan volume harian, lalu dengan 30 untuk proyeksi bulanan. Sisakan margin 30-50 % untuk lonjakan trafik dan iterasi rekayasa prompt.

Langkah 3 - Bandingkan antar tingkat model

Jalankan jumlah token yang sama pada beberapa tingkat model untuk mengidentifikasi di mana syarat kualitas memungkinkan model lebih murah. Banyak tugas - klasifikasi, ekstraksi entitas, peringkasan sederhana, jawaban FAQ - mencapai kualitas memadai dengan model yang lebih kecil dan murah. Menyisakan model terdepan (kelas GPT-4, kelas Claude 3.5 Sonnet) hanya untuk sebagian tugas yang benar-benar membutuhkannya dan mengarahkan tugas sederhana ke model lebih murah biasanya adalah penghematan paling berdampak.

Konverter JSON ke TOON

Konversi JSON ke format ringkas TOON dan kurangi pemakaian token LLM hingga 30-60 % - langsung memangkas biaya token masukan setiap kueri API yang menyertakan data JSON terstruktur.

Open tool

Perbandingan biaya antar model LLM utama

Harga model sering berubah - penyedia menurunkannya secara signifikan seiring persaingan yang makin ketat. Tabel di bawah menunjukkan kisaran harga yang representatif pada pertengahan 2026 untuk menggambarkan struktur biayanya. Selalu verifikasi harga terkini di halaman harga resmi tiap penyedia sebelum menyusun proyeksi biaya produksi.

Tingkat modelMasukan ($/M token)Keluaran ($/M token)Paling cocok untuk
Kelas GPT-4o Mini$0,15-0,50$0,60-2,00Klasifikasi, ekstraksi
Kelas Gemini Flash$0,10-0,35$0,40-1,50Peringkasan volume tinggi
Kelas Claude Haiku$0,25-0,80$1,25-4,00Keluaran terstruktur cepat
Kelas GPT-4o$2,50-5,00$10-20Penalaran kompleks, kode
Kelas Claude Sonnet$3,00-15,00$15-75Analisis, konteks panjang
Kelas o1 / penalaran$15-60$60-240Logika bertahap, matematika

Perbedaan biaya antara tingkat termurah dan termahal mencapai dua orde besaran. Aplikasi dengan 10.000 kueri per hari memakai model kelas o1 berbiaya sekitar $60-240 per hari; aplikasi yang sama dengan GPT-4o Mini berbiaya $1,50-20 per hari. Keputusan perutean berdasarkan kompleksitas tugas - memakai pengklasifikasi kueri untuk mengarahkan tiap panggilan ke tingkat model yang sesuai - dapat menekan total pengeluaran API hingga 60-80 % pada saluran dengan kompleksitas tugas campuran.


Ukuran jendela konteks versus biaya

Jendela konteks yang lebih besar memungkinkan lebih banyak informasi per kueri, tetapi makin banyak token dalam prompt berarti biaya masukan makin tinggi. Jendela konteks 100.000 token baru layak dipakai jika konteks tambahan itu benar-benar meningkatkan kualitas respons untuk tugas tersebut. Pada sebagian besar aplikasi retrieval-augmented generation (RAG), 2.000-4.000 token konteks hasil pengambilan menghasilkan respons hampir sebaik 20.000 token dengan biaya masukan 5-10 kali lebih rendah. Selalu ukur kualitas versus panjang konteks sebelum menetapkan prompt besar di produksi.

Note

Penyedia sering memberi harga diskon untuk **token prompt yang di-cache** - bagian prompt yang tetap sama antar panggilan (prompt sistem, contoh few-shot, instruksi statis). Cache prompt OpenAI menurunkan biaya token masukan tersebut sebesar 50 %; cache prompt Anthropic menurunkannya 90 %. Untuk aplikasi dengan prompt sistem besar dan tetap, mengaktifkan cache prompt bisa memangkas biaya masukan secara signifikan.

Strategi menekan biaya kueri

Optimasi biaya kueri punya dua pengungkit: mengurangi token per kueri dan menurunkan harga per token. Strategi berikut menyentuh keduanya dan disusun kasar menurut tingkat usaha penerapannya, dari paling rendah ke paling tinggi.

  • Kompres data masukan sebelum disisipkan - konversi payload JSON, CSV, atau YAML ke format TOON sebelum dimasukkan ke prompt. Konverter JSON ke TOON mengurangi jumlah token 30-60 % tanpa kehilangan informasi.
  • Pakai model termurah yang memenuhi syarat kualitas - uji setiap jenis tugas pada tingkat model lebih kecil sebelum menganggap butuh model terdepan. Banyak tugas ekstraksi, klasifikasi, dan peringkasan berjalan baik di GPT-4o Mini atau Gemini Flash.
  • Pendekkan dan rapikan prompt sistem - audit prompt sistem Anda untuk instruksi berulang, contoh format yang panjang, dan catatan berulang. Setiap token yang dihapus menghemat uang di setiap panggilan API.
  • Batasi panjang keluaran dengan max_tokens - minta model menjawab ringkas dan tetapkan plafon max_tokens yang tegas. Token keluaran 3-5 kali token masukan, jadi menekan respons bertele-tele langsung memangkas bagian tagihan yang paling mahal.
  • Aktifkan cache prompt - gunakan cache bawaan penyedia untuk prompt sistem statis dan contoh few-shot. Token yang di-cache berbiaya 50-90 % lebih murah daripada yang tidak di-cache pada OpenAI dan Anthropic.
  • Cache respons kueri umum - untuk kueri deterministik atau hampir deterministik, simpan respons LLM dan sajikan untuk masukan identik yang berulang tanpa melakukan panggilan API.

Kompresi token: jalur tercepat menuju penghematan

Untuk aplikasi yang mengirim data terstruktur ke LLM - katalog produk, data pengguna, ekspor analitik, respons API - kompresi token masukan menawarkan penghematan tercepat dan paling konsisten. Mengonversi payload JSON 2.000 token ke format TOON menyusutkannya menjadi sekitar 800-1.400 token. Pada tarif $3,00/M token masukan dan 50.000 kueri harian, satu perubahan itu menghemat $0,09-0,18 per hari: sekitar $33-66 per bulan tanpa dampak pada kualitas. Untuk data CSV, Konverter CSV ke TOON mencapai penghematan token 40-60 % pada kumpulan data tabular, dan Konverter YAML ke TOON menangani konfigurasi dan data terstruktur dalam format YAML.

Tip

Validasi keluaran LLM dengan [Validator Guardrail JSON untuk Keluaran LLM](/tools/data/converters/llm-output-json-guardrail-validator) sebelum memicu loop percobaan ulang yang mahal. Panggilan keluaran terstruktur yang gagal dan harus diulang menggandakan biaya token kueri tersebut. Menangkap kesalahan parsing dan pelanggaran tipe sebelum mencapai lapisan validasi Anda menghilangkan token percobaan ulang yang terbuang.

Kapan biaya kueri menjadi masalah

Bagi pengembang perorangan dan proyek kecil, biaya token jarang signifikan: $5-20 per bulan untuk eksperimen dan pengembangan. Masalah muncul ketika sebuah fitur menskalakan ke volume produksi, ketika rancangan prompt menyertakan payload konteks besar, atau ketika satu saluran merangkai beberapa panggilan API per interaksi pengguna. Inilah skenario tempat perhitungan harga per kueri menjadi krusial.

Saluran agen dan bertahap

Alur agen yang merangkai beberapa panggilan LLM - perencanaan, penggunaan alat, refleksi, peringkasan - bisa mengakumulasi 10.000-100.000 token dalam satu permintaan pengguna yang tampak sebagai satu interaksi. Setiap hasil panggilan alat dan giliran percakapan disisipkan ulang sebagai konteks untuk panggilan berikutnya, sehingga jumlah token tumbuh kuadratik seiring jumlah langkah. Untuk saluran seperti ini, memperkirakan biaya per permintaan pengguna menuntut mengalikan biaya per kueri dengan rata-rata jumlah panggilan LLM per eksekusi.

Aplikasi RAG dengan potongan dokumen besar

Saluran retrieval-augmented generation menyisipkan potongan dokumen hasil pengambilan ke setiap prompt. Jika strategi pemotongan menghasilkan potongan besar (1.000-4.000 token masing-masing) dan mengambil tiga sampai lima potongan per kueri, jumlah token masukan bisa mencapai 5.000-20.000 per panggilan bahkan sebelum pertanyaan pengguna dimasukkan. Mengompres potongan hasil pengambilan dengan format seperti TOON - atau memangkas ukurannya di saluran embedding - langsung menurunkan biaya per kueri tanpa mengubah kualitas pengambilan. Untuk latar belakang tentang posisi validasi keluaran terstruktur dalam saluran seperti ini, panduan Guardrails AI membahas lapisan validasi yang berada setelah pengambilan.

Warning

Berhati-hatilah dengan perkiraan jumlah token dari alat penghitung kata. Rasio kata-ke-token bahasa Inggris tidak berlaku untuk kode, JSON, SQL, atau XML - format ini ditokenisasi 1-2 token per kata, bukan 1,3 seperti biasanya. Gunakan pustaka `tiktoken` (untuk model OpenAI) atau API penghitung token penyedia Anda untuk mengukur jumlah token nyata pada sampel prompt asli, bukan memperkirakan dari jumlah karakter.

Konverter CSV ke TOON

Konversi kumpulan data CSV ke format ringkas TOON dengan penghematan token 40-60 % - cara tercepat menekan biaya token masukan kueri yang mengirim data tabular ke API LLM.

Open tool

Key takeaways

  • Kalkulator harga per kueri memperkirakan biaya panggilan API LLM dari token masukan, token keluaran, dan model - penting untuk menyusun anggaran sebelum menskalakan fitur AI ke produksi.
  • Harga LLM terbagi antara token masukan (prompt dan konteks Anda) dan token keluaran (respons), dengan keluaran 3-5 kali lebih mahal karena pembuatannya lebih berat secara komputasi.
  • Satu kueri seharga $0,012 menjadi $3.600 per bulan dengan 10.000 panggilan harian - selalu modelkan biaya pada volume produksi, bukan per kueri.
  • Memilih tingkat model termurah yang memenuhi syarat kualitas adalah pengungkit biaya terbesar: model terdepan 10-100 kali lebih mahal daripada model kecil untuk tugas yang sama-sama bisa ditangani.
  • Kompresi token - mengonversi payload JSON, CSV, atau YAML ke format TOON - menurunkan jumlah token masukan 30-60 % tanpa dampak kualitas, memakai Konverter JSON ke TOON atau Konverter CSV ke TOON.
  • Cache prompt (tersedia di OpenAI dan Anthropic) memangkas biaya token masukan yang di-cache 50-90 % untuk prompt sistem statis - aktifkan pada setiap aplikasi produksi dengan prompt sistem besar dan tetap.
  • Selalu ukur pemakaian token nyata dari kolom `usage` pada respons API, bukan memperkirakan dari jumlah kata: kode dan JSON jauh lebih tidak efisien secara token dibandingkan teks bahasa Inggris.

Pertanyaan yang sering diajukan

Kalkulator harga per kueri adalah alat yang memperkirakan biaya satu panggilan API ke LLM berdasarkan jumlah token masukan dan keluaran dalam permintaan. Anda memasukkan panjang prompt (token masukan), panjang respons yang diharapkan (token keluaran), dan memilih model; kalkulator mengalikan masing-masing dengan tarif per token yang dipublikasikan dan menghasilkan biaya per kueri. Sebagian besar juga menampilkan proyeksi biaya bulanan berdasarkan volume yang diharapkan, berguna untuk menyusun anggaran sebelum menskalakan fitur AI.

Harga API LLM didasarkan pada token, yaitu potongan teks yang kira-kira setara dengan 0,75 kata dalam bahasa Inggris. Penyedia menagih secara terpisah untuk token masukan (prompt Anda beserta konteks) dan token keluaran (respons model). Harga dinyatakan per juta token ($/M). Kueri dengan prompt 1.000 token dan respons 500 token pada tarif $3,00/M masukan dan $15,00/M keluaran berbiaya sekitar $0,003 + $0,0075 = $0,0105 per panggilan. Dengan 10.000 kueri harian, itu $105 per hari.

Prompt satu baris sederhana dengan jawaban singkat memakai sekitar 50-200 token secara total. Prompt dengan pesan sistem dan satu potongan dokumen untuk RAG biasanya memakai 1.000-4.000 token. Alur agen yang kompleks dengan hasil panggilan alat, riwayat percakapan, dan instruksi keluaran terstruktur bisa memakai 8.000-32.000 token per kueri. Token keluaran biasanya 10-30 % dari total pada sebagian besar tugas penyelesaian, tetapi bisa mendominasi pada tugas peringkasan, pembuatan kode, atau penulisan panjang.

Per 2026, opsi termurah untuk sebagian besar tugas adalah model Google Gemini Flash dan OpenAI GPT-4o Mini, keduanya di bawah $0,50/M token masukan, cocok untuk klasifikasi, ekstraksi, dan penyelesaian sederhana. Untuk tugas berat penalaran yang butuh kualitas kelas GPT-4, biayanya melonjak ke $2-15/M token masukan. Memilih tingkat model yang tepat untuk tugasnya adalah pengungkit terbesar penghematan biaya: memakai model terdepan untuk tugas yang bisa ditangani model kecil membuang anggaran 5-10 kali lipat.

Strategi paling efektif adalah: pilih model termurah yang memenuhi syarat kualitas; kompres data masukan untuk mengurangi jumlah token (mengonversi JSON atau CSV ke format TOON menghemat 30-60 % token); simpan respons dalam cache untuk kueri berulang atau hampir identik; pendekkan prompt sistem dengan menghapus instruksi yang berlebihan; batasi panjang keluaran dengan `max_tokens`; dan kelompokkan kueri yang tidak mendesak ke jendela waktu sepi, tempat sebagian penyedia memberi tarif diskon.

Mengurangi jumlah token masukan lewat kompresi format data - misalnya mengonversi payload JSON besar ke TOON sebelum disisipkan - langsung menurunkan biaya per kueri tanpa mengorbankan kualitas.

Token masukan adalah token dari semua yang Anda kirim ke model: prompt sistem, riwayat percakapan, pesan pengguna, potongan dokumen yang diambil, skema fungsi, dan konteks lain. Token keluaran adalah token yang dihasilkan model dalam responsnya. Token keluaran umumnya berharga 3-5 kali lebih mahal daripada token masukan karena proses pembuatan secara komputasi lebih berat daripada pemrosesan masukan. Artinya, respons panjang dan bertele-tele berbiaya jauh lebih besar daripada prompt panjang - alasan memakai batas `max_tokens` dan meminta model menjawab ringkas.

Paket gratis dari OpenAI, Anthropic, Google, dan penyedia lain biasanya mencakup sejumlah token atau panggilan API tertentu per bulan tanpa biaya, setelah itu berlaku tarif bayar sesuai pemakaian. Paket gratis cocok untuk pengembangan dan pengujian, tetapi umumnya tidak cukup untuk beban produksi dengan ribuan kueri harian. Sebagian penyedia menyediakan paket gratis berbatas laju tanpa batas waktu; sebagian lain menghanguskan kredit gratis setelah 90 hari terlepas dari pemakaian. Periksa syarat terbaru tiap penyedia karena sering berubah.

Ya, dan penghematannya berskala langsung dengan pemakaian. Mengonversi payload JSON 2.000 token ke format TOON menyusutkannya menjadi sekitar 800-1.400 token, tergantung struktur datanya. Pada tarif $3,00/M token masukan dan 50.000 kueri harian, satu optimasi itu menghemat antara $0,09 dan $0,18 per hari: sekitar $33-66 per bulan hanya dari satu perubahan. Untuk saluran yang mengirim payload data terstruktur besar ke LLM, kompresi token sering menjadi jalur tercepat menuju penghematan yang berarti tanpa mengganti model atau penyedia.

ShareXLinkedIn