Aller au contenu
Aback Tools Logo

Calculateur de coûts d'agents vocaux

Estimez le coût d'infrastructure complet des agents vocaux IA - gratuit et 100 % privé dans votre navigateur. Modélisez les cinq couches : STT (Deepgram, AssemblyAI, OpenAI Whisper), inférence LLM (GPT-4o, Claude, Groq, DeepSeek), synthèse TTS (ElevenLabs, Cartesia, AWS Polly), transport téléphonique (Twilio, Telnyx, LiveKit) et orchestration de plateforme (Vapi, Retell, Bland AI). Obtenez des coûts par appel, des totaux mensuels, une répartition par couche et une analyse de latence indiquant si votre stack respecte la cible ≤500 ms.

Voice Agent Cost Calculator

Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.

Inbound support - average 4-minute calls, 500/day

Call Parameters

seconds
calls/day
4.0 min/call · 15,000 calls/month · 60,000 call-minutes/month

1. Speech-to-Text (STT)

Rate: $0.0043/minLatency: ~200msBest real-time latency for voice agents

2. LLM Inference

tok
tok
turns
In: $0.15/MOut: $0.6/MTTFT: ~300ms

3. Text-to-Speech (TTS)

chars
Rate: $15/M charsLatency: ~200msGreat balance of quality and speed

4. Telephony & Platform

Voice Agent Cost Summary

Cost / Call

$0.27

Cost / Min

$0.07

Monthly Cost

$4,061.04

Annual Cost

$48,732.48

Daily Cost

$135.37

Pipeline Latency

700ms

STT+LLM+TTS

Calls/Month

15,000

Call-Mins/Month

60,000

Per-Call Cost Breakdown

Speech-to-Text (STT)Deepgram Nova-2
$0.02(6%)
Rate: $0.0043/min
LLM InferenceOpenAI GPT-4o Mini
$0.0015(1%)
Rate: $0.15/$0.6/M tok
Text-to-Speech (TTS)ElevenLabs Turbo v2.5
$0.02(7%)
Rate: $15/M chars
Telephony / TransportTwilio Voice
$0.03(13%)
Rate: $0.0085/min
Platform / OrchestrationVapi
$0.20(74%)
Rate: $0.05/min
Total Per Call$0.27

Pipeline Latency (Response Time to User)

STT (transcription delay)200ms
LLM (time to first token)300ms
TTS (first audio byte)200ms
Total Pipeline Latency700ms ⚠️ Acceptable

Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.

Disclaimer: Prices reflect publicly available standard rates and are indicative only. Actual costs depend on volume discounts, contracted pricing, audio quality, silence trimming, and real-world token distributions. Latency figures are approximate first-token benchmarks - real pipeline latency depends on network, concurrency, and model load. All calculations run locally in your browser; no data is sent to any server.

Les cinq couches de coût d'un agent vocal

Chaque appel traverse cinq composants facturables : transcription, raisonnement du LLM, synthèse vocale, téléphonie et orchestration.

Le LLM et la marge plateforme/téléphonie pèsent souvent plus que le STT et le TTS.

  • STT : facturé à la minute d'audio transcrit.
  • LLM : facturé aux tokens d'entrée et de sortie de chaque tour.
  • TTS : facturé au caractère synthétisé.
  • Téléphonie : facturée à la minute de connexion.
  • Plateforme : marge par minute sur l'orchestration.

Latence : la limite pratique

En dessous de 500 ms de latence totale, la conversation paraît naturelle. Au-delà de 1 000 ms, l'interlocuteur perçoit des pauses gênantes.

  • TTFT du LLM : le composant le plus variable.
  • Fournisseurs STT à 180-300 ms de latence.
  • Voix TTS qui démarrent en moins de 100 ms.

Optimiser le coût sans casser l'expérience

L'objectif est de baisser le coût par minute tout en gardant une latence conversationnelle. Changer de fournisseur sur les grosses couches apporte le plus d'économies.

  1. Estimez la durée moyenne et le volume mensuel d'appels.
  2. Choisissez le fournisseur par couche selon coût et latence.
  3. Consultez la répartition pour voir quelle couche domine.
  4. Réduisez le modèle LLM ou retirez la couche plateforme si la latence le permet.

Foire aux questions

Il estime le coût d'infrastructure total d'un agent vocal IA en modélisant tous les composants facturables : transcription STT, inférence LLM, synthèse TTS, transport téléphonique et frais d'orchestration de plateforme. Notre calculateur fonctionne 100 % dans votre navigateur, sans inscription.

Un agent vocal typique coûte 0,05-0,25 $ par minute. Un stack optimisé (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) descend à 0,01-0,02 $/min. Un stack premium (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) peut dépasser 0,20 $/min. Les plus gros leviers sont le modèle LLM et la marge plateforme/téléphonie.

Les stacks les plus rapides en 2025 atteignent 400-500 ms de latence totale avec Deepgram Nova-3 (180 ms STT), Groq Llama 3.1 70B (150 ms TTFT) et ElevenLabs Flash v2.5 (75 ms premier audio). Les stacks OpenAI Whisper + GPT-4o + OpenAI TTS tournent plutôt à 1 200-1 800 ms, ce qui sonne nettement lent pour l'appelant.

La téléphonie (PSTN) relie des numéros classiques via des opérateurs comme Twilio ou Telnyx. WebRTC délivre la voix via des apps ou navigateurs sans opérateur. Le PSTN ajoute 0,002-0,0085 $/min mais joint n'importe quel téléphone. WebRTC supprime le coût opérateur mais exige que l'appelant utilise une app ou une interface web.

Groq utilise du matériel LPU conçu pour la génération séquentielle de tokens, atteignant un time-to-first-token de 100-200 ms sur des modèles 70B contre 400-700 ms pour GPT-4o. En voix, où chaque 100 ms compte, c'est significatif. En contrepartie, Groq sert des modèles open-weight (Llama, Mixtral).

Ce sont des plateformes d'orchestration d'agents vocaux qui gèrent routage d'appels, détection de tours, gestion des interruptions et streaming audio. Elles facturent 0,05-0,09 $/min au-dessus des coûts de composants en échange d'une complexité d'ingénierie éliminée. Construire un stack maison évite cette marge mais demande un investissement d'ingénierie important.

Les principaux gains viennent de : passer la téléphonie de Twilio à Telnyx (~0,006 $/min), supprimer ou auto-héberger la couche plateforme (0,05-0,09 $/min), utiliser un LLM plus petit pour les tâches simples et négocier des remises volume au-delà de 10 M minutes/mois. À l'échelle, plateforme et téléphonie dominent, pas le STT ni le LLM.

Oui. Il fonctionne 100 % dans votre navigateur. Choix de fournisseurs, volume d'appels et résultats sont traités localement et jamais transmis à un serveur. Aucun compte requis, aucune donnée stockée. Votre planification d'infrastructure reste totalement privée.