Calculadora de costes de agentes de voz
Estima el coste completo de infraestructura de agentes de voz de IA, gratis y 100 % privado en tu navegador. Modela las cinco capas de coste: transcripción STT (Deepgram, AssemblyAI, OpenAI Whisper), inferencia LLM (GPT-4o, Claude, Groq, DeepSeek), síntesis TTS (ElevenLabs, Cartesia, AWS Polly), transporte de telefonía (Twilio, Telnyx, LiveKit) y orquestación de plataforma (Vapi, Retell, Bland AI). Obtén costes por llamada, totales mensuales, un desglose completo por capa y un análisis de latencia que indica si tu stack cumple el objetivo de ≤500 ms para una conversación natural.
Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.
Inbound support - average 4-minute calls, 500/day
Call Parameters
1. Speech-to-Text (STT)
2. LLM Inference
3. Text-to-Speech (TTS)
4. Telephony & Platform
Voice Agent Cost Summary
Cost / Call
$0.27
Cost / Min
$0.07
Monthly Cost
$4,061.04
Annual Cost
$48,732.48
Daily Cost
$135.37
Pipeline Latency
700ms
STT+LLM+TTS
Calls/Month
15,000
Call-Mins/Month
60,000
Per-Call Cost Breakdown
Pipeline Latency (Response Time to User)
Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.
Las cinco capas de coste de un agente de voz
Cada llamada pasa por cinco componentes facturables: transcripción, razonamiento del LLM, síntesis de voz, telefonía y orquestación.
El LLM y el margen de plataforma y telefonía suelen pesar más que el STT y el TTS.
- STT: se cobra por minuto de audio transcrito.
- LLM: se cobra por tokens de entrada y salida de cada turno.
- TTS: se cobra por carácter sintetizado.
- Telefonía: se cobra por minuto de conexión.
- Plataforma: margen por minuto sobre la orquestación.
Latencia: el límite práctico
Por debajo de 500 ms de latencia total la conversación se siente natural. Por encima de 1 000 ms, el interlocutor percibe pausas incómodas.
- TTFT del LLM: el componente que más varía.
- Proveedores de STT con 180-300 ms de latencia.
- Voces TTS que empiezan a sonar en menos de 100 ms.
Optimizar el coste sin romper la experiencia
El objetivo es bajar el coste por minuto manteniendo una latencia conversacional. Cambiar de proveedor en las capas grandes suele dar el mayor ahorro.
- Estima la duración media y el volumen mensual de llamadas.
- Elige proveedor por capa según coste y latencia.
- Revisa el desglose para ver qué capa domina tu factura.
- Reduce el modelo LLM o quita la capa de plataforma si la latencia lo permite.
Preguntas frecuentes
Estima el coste total de infraestructura de ejecutar un agente de voz de IA modelando todos los componentes facturables: transcripción de voz a texto (STT), inferencia LLM, síntesis de texto a voz (TTS), transporte de telefonía y tarifas opcionales de orquestación de plataforma. Nuestra calculadora funciona 100 % en tu navegador y no requiere registro.
Un agente de voz típico cuesta entre 0,05 y 0,25 $ por minuto. Un stack optimizado en coste (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) puede bajar a 0,01-0,02 $/min. Un stack premium (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) puede superar los 0,20 $/min. Las mayores palancas de coste son el modelo LLM y el margen de la plataforma y la telefonía.
Los stacks más rápidos en 2025 logran 400-500 ms de latencia total usando Deepgram Nova-3 (180 ms de STT), Groq Llama 3.1 70B (150 ms de TTFT) y ElevenLabs Flash v2.5 (75 ms hasta el primer audio). Los stacks con OpenAI Whisper + GPT-4o + OpenAI TTS suelen ir de 1 200 a 1 800 ms, algo que suena notablemente lento para quien llama.
La telefonía (PSTN) conecta con números de teléfono normales mediante operadores como Twilio o Telnyx: quien llama marca un número estándar. WebRTC entrega voz a través de apps o navegadores sin necesidad de operador. La PSTN añade 0,002-0,0085 $/min pero llega a cualquier teléfono. WebRTC elimina el coste de operador, pero exige que el interlocutor use una app o interfaz web.
Groq usa hardware LPU diseñado específicamente para la generación secuencial de tokens, logrando un tiempo hasta el primer token de 100-200 ms en modelos de 70B frente a 400-700 ms de GPT-4o. En voz, donde cada 100 ms cuenta, es significativo. La contrapartida es que Groq sirve modelos abiertos (Llama, Mixtral) en lugar de modelos frontera propietarios.
Son plataformas de orquestación de agentes de voz que gestionan enrutado de llamadas, detección de turnos, manejo de interrupciones y streaming de audio. Cobran 0,05-0,09 $/min por encima del coste de los componentes a cambio de eliminar complejidad de ingeniería. Construir un stack propio evita ese margen, pero exige una inversión de ingeniería considerable.
Los mayores ahorros vienen de: cambiar la telefonía de Twilio a Telnyx (ahorra ~0,006 $/min), eliminar o autoalojar la capa de plataforma (ahorra 0,05-0,09 $/min), usar un LLM más pequeño para tareas simples y negociar descuentos por volumen a partir de 10 millones de minutos/mes. A escala, la plataforma y la telefonía suelen ser el mayor coste, no el STT ni el LLM.
Sí. La calculadora funciona 100 % en tu navegador. Las selecciones de proveedores, el volumen de llamadas y todos los resultados se procesan localmente y nunca se transmiten a ningún servidor. No requiere cuenta y no se almacena ningún dato. Tu planificación de infraestructura permanece totalmente privada.