Kalkulator Biaya Agen Suara
Estimasi total biaya infrastruktur agen suara AI — gratis dan 100 % privat di browser Anda. Modelkan kelima lapisan biaya: transkripsi STT (Deepgram, AssemblyAI, OpenAI Whisper), inferensi LLM (GPT-4o, Claude, Groq, DeepSeek), sintesis TTS (ElevenLabs, Cartesia, AWS Polly), transport teleponi (Twilio, Telnyx, LiveKit), dan orkestrasi platform (Vapi, Retell, Bland AI). Dapatkan biaya per panggilan, total bulanan, rincian lengkap per lapisan, dan analisis latensi yang menunjukkan apakah stack Anda memenuhi target ≤500 ms untuk percakapan alami.
Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.
Inbound support - average 4-minute calls, 500/day
Call Parameters
1. Speech-to-Text (STT)
2. LLM Inference
3. Text-to-Speech (TTS)
4. Telephony & Platform
Voice Agent Cost Summary
Cost / Call
$0.27
Cost / Min
$0.07
Monthly Cost
$4,061.04
Annual Cost
$48,732.48
Daily Cost
$135.37
Pipeline Latency
700ms
STT+LLM+TTS
Calls/Month
15,000
Call-Mins/Month
60,000
Per-Call Cost Breakdown
Pipeline Latency (Response Time to User)
Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.
Lima lapisan biaya agen suara
Setiap panggilan melewati lima komponen yang ditagih: transkripsi, penalaran LLM, sintesis suara, teleponi, dan orkestrasi.
LLM serta margin platform dan teleponi biasanya lebih berat daripada STT dan TTS.
- STT: ditagih per menit audio yang ditranskripsi.
- LLM: ditagih per token input dan output tiap giliran.
- TTS: ditagih per karakter yang disintesis.
- Teleponi: ditagih per menit koneksi.
- Platform: margin per menit atas orkestrasi.
Latensi: batas praktis
Di bawah 500 ms latensi total, percakapan terasa alami. Di atas 1.000 ms, pemakai merasakan jeda yang mengganggu.
- TTFT LLM: komponen paling bervariasi.
- Penyedia STT dengan latensi 180-300 ms.
- Suara TTS yang mulai berbunyi di bawah 100 ms.
Mengoptimalkan biaya tanpa merusak pengalaman
Tujuannya menurunkan biaya per menit sambil menjaga latensi percakapan. Mengganti penyedia pada lapisan besar memberi penghematan terbesar.
- Estimasi durasi rata-rata dan volume panggilan bulanan.
- Pilih penyedia per lapisan sesuai biaya dan latensi.
- Tinjau rincian untuk melihat lapisan mana yang mendominasi tagihan.
- Kecilkan model LLM atau hapus lapisan platform bila latensi memungkinkan.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan total biaya infrastruktur menjalankan agen suara AI dengan memodelkan semua komponen yang ditagih: transkripsi STT, inferensi LLM, sintesis TTS, transport teleponi, dan biaya orkestrasi platform opsional. Kalkulator kami berjalan 100 % di browser, tanpa pendaftaran.
Agen suara tipikal berbiaya US$ 0,05-0,25 per menit. Stack yang dioptimalkan biaya (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) bisa serendah US$ 0,01-0,02/menit. Stack premium (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) bisa melebihi US$ 0,20/menit. Tuas biaya terbesar adalah model LLM serta margin platform dan teleponi.
Stack tercepat pada 2025 mencapai 400-500 ms latensi total memakai Deepgram Nova-3 (180 ms STT), Groq Llama 3.1 70B (150 ms TTFT), dan ElevenLabs Flash v2.5 (75 ms audio pertama). Stack dengan OpenAI Whisper + GPT-4o + OpenAI TTS biasanya 1.200-1.800 ms, terasa jelas lambat bagi penelepon.
Teleponi (PSTN) menghubungkan nomor telepon biasa lewat operator seperti Twilio atau Telnyx — penelepon menekan nomor reguler. WebRTC mengirim suara lewat aplikasi atau browser tanpa operator. PSTN menambah US$ 0,002-0,0085/menit tetapi menjangkau telepon apa pun. WebRTC menghilangkan biaya operator tetapi mengharuskan pemakai memakai aplikasi atau antarmuka web.
Groq memakai hardware LPU yang dirancang untuk generasi token berurutan, mencapai waktu ke token pertama 100-200 ms pada model 70B versus 400-700 ms pada GPT-4o. Untuk suara, di mana setiap 100 ms berarti, ini signifikan. Konsekuensinya, Groq melayani model open-weight (Llama, Mixtral).
Itu platform orkestrasi agen suara yang menangani routing panggilan, deteksi giliran bicara, penanganan interupsi, dan streaming audio. Mereka menagih US$ 0,05-0,09/menit di atas biaya komponen sebagai imbalan menghilangkan kompleksitas rekayasa. Membangun stack sendiri menghindari margin itu tetapi butuh investasi engineering besar.
Penghematan terbesar berasal dari: memindahkan teleponi dari Twilio ke Telnyx (~US$ 0,006/menit), menghapus atau self-host lapisan platform (US$ 0,05-0,09/menit), memakai LLM lebih kecil untuk tugas sederhana, dan menegosiasikan diskon volume di 10 juta+ menit/bulan. Dalam skala, platform dan teleponi mendominasi, bukan STT atau LLM.
Ya. Alat ini berjalan 100 % di browser Anda. Pilihan penyedia, volume panggilan, dan semua hasil diproses lokal dan tidak pernah dikirim ke server mana pun. Tidak perlu akun dan tidak ada data yang disimpan. Perencanaan infrastruktur Anda tetap sepenuhnya privat.