Calculadora de custos de agentes de voz
Estime o custo completo de infraestrutura de agentes de voz de IA — grátis e 100 % privado no seu navegador. Modele as cinco camadas de custo: transcrição STT (Deepgram, AssemblyAI, OpenAI Whisper), inferência LLM (GPT-4o, Claude, Groq, DeepSeek), síntese TTS (ElevenLabs, Cartesia, AWS Polly), transporte de telefonia (Twilio, Telnyx, LiveKit) e orquestração de plataforma (Vapi, Retell, Bland AI). Obtenha custos por chamada, totais mensais, um detalhamento completo por camada e uma análise de latência indicando se seu stack atende a meta de ≤500 ms para conversa natural.
Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.
Inbound support - average 4-minute calls, 500/day
Call Parameters
1. Speech-to-Text (STT)
2. LLM Inference
3. Text-to-Speech (TTS)
4. Telephony & Platform
Voice Agent Cost Summary
Cost / Call
$0.27
Cost / Min
$0.07
Monthly Cost
$4,061.04
Annual Cost
$48,732.48
Daily Cost
$135.37
Pipeline Latency
700ms
STT+LLM+TTS
Calls/Month
15,000
Call-Mins/Month
60,000
Per-Call Cost Breakdown
Pipeline Latency (Response Time to User)
Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.
As cinco camadas de custo de um agente de voz
Cada chamada passa por cinco componentes cobráveis: transcrição, raciocínio do LLM, síntese de voz, telefonia e orquestração.
O LLM e a margem de plataforma/telefonia costumam pesar mais que o STT e o TTS.
- STT: cobrado por minuto de áudio transcrito.
- LLM: cobrado por tokens de entrada e saída de cada turno.
- TTS: cobrado por caractere sintetizado.
- Telefonia: cobrada por minuto de conexão.
- Plataforma: margem por minuto sobre a orquestração.
Latência: o limite prático
Abaixo de 500 ms de latência total, a conversa soa natural. Acima de 1.000 ms, a pessoa percebe pausas desconfortáveis.
- TTFT do LLM: o componente mais variável.
- Provedores de STT com 180-300 ms de latência.
- Vozes TTS que iniciam em menos de 100 ms.
Otimizar custo sem quebrar a experiência
O objetivo é reduzir o custo por minuto mantendo latência conversacional. Trocar de provedor nas camadas grandes traz a maior economia.
- Estime a duração média e o volume mensal de chamadas.
- Escolha provedor por camada conforme custo e latência.
- Veja o detalhamento para saber qual camada domina a fatura.
- Reduza o modelo LLM ou remova a camada de plataforma se a latência permitir.
Perguntas frequentes
Ela estima o custo total de infraestrutura de rodar um agente de voz de IA modelando todos os componentes cobráveis: transcrição STT, inferência LLM, síntese TTS, transporte de telefonia e taxas opcionais de orquestração de plataforma. Nossa calculadora roda 100 % no navegador, sem cadastro.
Um agente de voz típico custa US$ 0,05-0,25 por minuto. Um stack otimizado para custo (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) pode chegar a US$ 0,01-0,02/min. Um stack premium (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) pode passar de US$ 0,20/min. As maiores alavancas são o modelo LLM e a margem de plataforma/telefonia.
Os stacks mais rápidos em 2025 atingem 400-500 ms de latência total usando Deepgram Nova-3 (180 ms de STT), Groq Llama 3.1 70B (150 ms de TTFT) e ElevenLabs Flash v2.5 (75 ms até o primeiro áudio). Stacks com OpenAI Whisper + GPT-4o + OpenAI TTS costumam rodar entre 1.200 e 1.800 ms, soando lento para quem liga.
A telefonia (PSTN) conecta a números comuns via operadoras como Twilio ou Telnyx — a pessoa disca um número normal. O WebRTC entrega voz por apps ou navegadores sem operadora. O PSTN adiciona US$ 0,002-0,0085/min, mas alcança qualquer telefone. O WebRTC elimina o custo da operadora, mas exige que quem liga use um app ou interface web.
O Groq usa hardware LPU projetado para geração sequencial de tokens, atingindo tempo até o primeiro token de 100-200 ms em modelos 70B contra 400-700 ms do GPT-4o. Em voz, onde cada 100 ms importa, isso é significativo. A contrapartida é que o Groq serve modelos open-weight (Llama, Mixtral).
São plataformas de orquestração de agentes de voz que cuidam de roteamento de chamadas, detecção de turno, tratamento de interrupções e streaming de áudio. Cobram US$ 0,05-0,09/min acima do custo dos componentes em troca de eliminar complexidade de engenharia. Montar um stack próprio evita essa margem, mas exige investimento de engenharia.
As maiores economias vêm de: trocar a telefonia de Twilio para Telnyx (~US$ 0,006/min), remover ou auto-hospedar a camada de plataforma (US$ 0,05-0,09/min), usar um LLM menor para tarefas simples e negociar descontos por volume acima de 10 milhões de minutos/mês. Em escala, plataforma e telefonia dominam, não o STT nem o LLM.
Sim. Ela roda 100 % no seu navegador. Escolhas de provedor, volume de chamadas e todos os resultados são processados localmente e nunca transmitidos a servidor algum. Não exige conta e não armazena dados. Seu planejamento de infraestrutura permanece totalmente privado.