Calculateur de coûts d'agents vocaux
Estimez le coût d'infrastructure complet des agents vocaux IA - gratuit et 100 % privé dans votre navigateur. Modélisez les cinq couches : STT (Deepgram, AssemblyAI, OpenAI Whisper), inférence LLM (GPT-4o, Claude, Groq, DeepSeek), synthèse TTS (ElevenLabs, Cartesia, AWS Polly), transport téléphonique (Twilio, Telnyx, LiveKit) et orchestration de plateforme (Vapi, Retell, Bland AI). Obtenez des coûts par appel, des totaux mensuels, une répartition par couche et une analyse de latence indiquant si votre stack respecte la cible ≤500 ms.
Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.
Inbound support - average 4-minute calls, 500/day
Call Parameters
1. Speech-to-Text (STT)
2. LLM Inference
3. Text-to-Speech (TTS)
4. Telephony & Platform
Voice Agent Cost Summary
Cost / Call
$0.27
Cost / Min
$0.07
Monthly Cost
$4,061.04
Annual Cost
$48,732.48
Daily Cost
$135.37
Pipeline Latency
700ms
STT+LLM+TTS
Calls/Month
15,000
Call-Mins/Month
60,000
Per-Call Cost Breakdown
Pipeline Latency (Response Time to User)
Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.
Les cinq couches de coût d'un agent vocal
Chaque appel traverse cinq composants facturables : transcription, raisonnement du LLM, synthèse vocale, téléphonie et orchestration.
Le LLM et la marge plateforme/téléphonie pèsent souvent plus que le STT et le TTS.
- STT : facturé à la minute d'audio transcrit.
- LLM : facturé aux tokens d'entrée et de sortie de chaque tour.
- TTS : facturé au caractère synthétisé.
- Téléphonie : facturée à la minute de connexion.
- Plateforme : marge par minute sur l'orchestration.
Latence : la limite pratique
En dessous de 500 ms de latence totale, la conversation paraît naturelle. Au-delà de 1 000 ms, l'interlocuteur perçoit des pauses gênantes.
- TTFT du LLM : le composant le plus variable.
- Fournisseurs STT à 180-300 ms de latence.
- Voix TTS qui démarrent en moins de 100 ms.
Optimiser le coût sans casser l'expérience
L'objectif est de baisser le coût par minute tout en gardant une latence conversationnelle. Changer de fournisseur sur les grosses couches apporte le plus d'économies.
- Estimez la durée moyenne et le volume mensuel d'appels.
- Choisissez le fournisseur par couche selon coût et latence.
- Consultez la répartition pour voir quelle couche domine.
- Réduisez le modèle LLM ou retirez la couche plateforme si la latence le permet.
Foire aux questions
Il estime le coût d'infrastructure total d'un agent vocal IA en modélisant tous les composants facturables : transcription STT, inférence LLM, synthèse TTS, transport téléphonique et frais d'orchestration de plateforme. Notre calculateur fonctionne 100 % dans votre navigateur, sans inscription.
Un agent vocal typique coûte 0,05-0,25 $ par minute. Un stack optimisé (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) descend à 0,01-0,02 $/min. Un stack premium (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) peut dépasser 0,20 $/min. Les plus gros leviers sont le modèle LLM et la marge plateforme/téléphonie.
Les stacks les plus rapides en 2025 atteignent 400-500 ms de latence totale avec Deepgram Nova-3 (180 ms STT), Groq Llama 3.1 70B (150 ms TTFT) et ElevenLabs Flash v2.5 (75 ms premier audio). Les stacks OpenAI Whisper + GPT-4o + OpenAI TTS tournent plutôt à 1 200-1 800 ms, ce qui sonne nettement lent pour l'appelant.
La téléphonie (PSTN) relie des numéros classiques via des opérateurs comme Twilio ou Telnyx. WebRTC délivre la voix via des apps ou navigateurs sans opérateur. Le PSTN ajoute 0,002-0,0085 $/min mais joint n'importe quel téléphone. WebRTC supprime le coût opérateur mais exige que l'appelant utilise une app ou une interface web.
Groq utilise du matériel LPU conçu pour la génération séquentielle de tokens, atteignant un time-to-first-token de 100-200 ms sur des modèles 70B contre 400-700 ms pour GPT-4o. En voix, où chaque 100 ms compte, c'est significatif. En contrepartie, Groq sert des modèles open-weight (Llama, Mixtral).
Ce sont des plateformes d'orchestration d'agents vocaux qui gèrent routage d'appels, détection de tours, gestion des interruptions et streaming audio. Elles facturent 0,05-0,09 $/min au-dessus des coûts de composants en échange d'une complexité d'ingénierie éliminée. Construire un stack maison évite cette marge mais demande un investissement d'ingénierie important.
Les principaux gains viennent de : passer la téléphonie de Twilio à Telnyx (~0,006 $/min), supprimer ou auto-héberger la couche plateforme (0,05-0,09 $/min), utiliser un LLM plus petit pour les tâches simples et négocier des remises volume au-delà de 10 M minutes/mois. À l'échelle, plateforme et téléphonie dominent, pas le STT ni le LLM.
Oui. Il fonctionne 100 % dans votre navigateur. Choix de fournisseurs, volume d'appels et résultats sont traités localement et jamais transmis à un serveur. Aucun compte requis, aucune donnée stockée. Votre planification d'infrastructure reste totalement privée.