Pular para o conteúdo
Aback Tools Logo

Calculadora de custos de agentes de voz

Estime o custo completo de infraestrutura de agentes de voz de IA — grátis e 100 % privado no seu navegador. Modele as cinco camadas de custo: transcrição STT (Deepgram, AssemblyAI, OpenAI Whisper), inferência LLM (GPT-4o, Claude, Groq, DeepSeek), síntese TTS (ElevenLabs, Cartesia, AWS Polly), transporte de telefonia (Twilio, Telnyx, LiveKit) e orquestração de plataforma (Vapi, Retell, Bland AI). Obtenha custos por chamada, totais mensais, um detalhamento completo por camada e uma análise de latência indicando se seu stack atende a meta de ≤500 ms para conversa natural.

Voice Agent Cost Calculator

Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.

Inbound support - average 4-minute calls, 500/day

Call Parameters

seconds
calls/day
4.0 min/call · 15,000 calls/month · 60,000 call-minutes/month

1. Speech-to-Text (STT)

Rate: $0.0043/minLatency: ~200msBest real-time latency for voice agents

2. LLM Inference

tok
tok
turns
In: $0.15/MOut: $0.6/MTTFT: ~300ms

3. Text-to-Speech (TTS)

chars
Rate: $15/M charsLatency: ~200msGreat balance of quality and speed

4. Telephony & Platform

Voice Agent Cost Summary

Cost / Call

$0.27

Cost / Min

$0.07

Monthly Cost

$4,061.04

Annual Cost

$48,732.48

Daily Cost

$135.37

Pipeline Latency

700ms

STT+LLM+TTS

Calls/Month

15,000

Call-Mins/Month

60,000

Per-Call Cost Breakdown

Speech-to-Text (STT)Deepgram Nova-2
$0.02(6%)
Rate: $0.0043/min
LLM InferenceOpenAI GPT-4o Mini
$0.0015(1%)
Rate: $0.15/$0.6/M tok
Text-to-Speech (TTS)ElevenLabs Turbo v2.5
$0.02(7%)
Rate: $15/M chars
Telephony / TransportTwilio Voice
$0.03(13%)
Rate: $0.0085/min
Platform / OrchestrationVapi
$0.20(74%)
Rate: $0.05/min
Total Per Call$0.27

Pipeline Latency (Response Time to User)

STT (transcription delay)200ms
LLM (time to first token)300ms
TTS (first audio byte)200ms
Total Pipeline Latency700ms ⚠️ Acceptable

Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.

Disclaimer: Prices reflect publicly available standard rates and are indicative only. Actual costs depend on volume discounts, contracted pricing, audio quality, silence trimming, and real-world token distributions. Latency figures are approximate first-token benchmarks - real pipeline latency depends on network, concurrency, and model load. All calculations run locally in your browser; no data is sent to any server.

As cinco camadas de custo de um agente de voz

Cada chamada passa por cinco componentes cobráveis: transcrição, raciocínio do LLM, síntese de voz, telefonia e orquestração.

O LLM e a margem de plataforma/telefonia costumam pesar mais que o STT e o TTS.

  • STT: cobrado por minuto de áudio transcrito.
  • LLM: cobrado por tokens de entrada e saída de cada turno.
  • TTS: cobrado por caractere sintetizado.
  • Telefonia: cobrada por minuto de conexão.
  • Plataforma: margem por minuto sobre a orquestração.

Latência: o limite prático

Abaixo de 500 ms de latência total, a conversa soa natural. Acima de 1.000 ms, a pessoa percebe pausas desconfortáveis.

  • TTFT do LLM: o componente mais variável.
  • Provedores de STT com 180-300 ms de latência.
  • Vozes TTS que iniciam em menos de 100 ms.

Otimizar custo sem quebrar a experiência

O objetivo é reduzir o custo por minuto mantendo latência conversacional. Trocar de provedor nas camadas grandes traz a maior economia.

  1. Estime a duração média e o volume mensal de chamadas.
  2. Escolha provedor por camada conforme custo e latência.
  3. Veja o detalhamento para saber qual camada domina a fatura.
  4. Reduza o modelo LLM ou remova a camada de plataforma se a latência permitir.

Perguntas frequentes

Ela estima o custo total de infraestrutura de rodar um agente de voz de IA modelando todos os componentes cobráveis: transcrição STT, inferência LLM, síntese TTS, transporte de telefonia e taxas opcionais de orquestração de plataforma. Nossa calculadora roda 100 % no navegador, sem cadastro.

Um agente de voz típico custa US$ 0,05-0,25 por minuto. Um stack otimizado para custo (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) pode chegar a US$ 0,01-0,02/min. Um stack premium (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) pode passar de US$ 0,20/min. As maiores alavancas são o modelo LLM e a margem de plataforma/telefonia.

Os stacks mais rápidos em 2025 atingem 400-500 ms de latência total usando Deepgram Nova-3 (180 ms de STT), Groq Llama 3.1 70B (150 ms de TTFT) e ElevenLabs Flash v2.5 (75 ms até o primeiro áudio). Stacks com OpenAI Whisper + GPT-4o + OpenAI TTS costumam rodar entre 1.200 e 1.800 ms, soando lento para quem liga.

A telefonia (PSTN) conecta a números comuns via operadoras como Twilio ou Telnyx — a pessoa disca um número normal. O WebRTC entrega voz por apps ou navegadores sem operadora. O PSTN adiciona US$ 0,002-0,0085/min, mas alcança qualquer telefone. O WebRTC elimina o custo da operadora, mas exige que quem liga use um app ou interface web.

O Groq usa hardware LPU projetado para geração sequencial de tokens, atingindo tempo até o primeiro token de 100-200 ms em modelos 70B contra 400-700 ms do GPT-4o. Em voz, onde cada 100 ms importa, isso é significativo. A contrapartida é que o Groq serve modelos open-weight (Llama, Mixtral).

São plataformas de orquestração de agentes de voz que cuidam de roteamento de chamadas, detecção de turno, tratamento de interrupções e streaming de áudio. Cobram US$ 0,05-0,09/min acima do custo dos componentes em troca de eliminar complexidade de engenharia. Montar um stack próprio evita essa margem, mas exige investimento de engenharia.

As maiores economias vêm de: trocar a telefonia de Twilio para Telnyx (~US$ 0,006/min), remover ou auto-hospedar a camada de plataforma (US$ 0,05-0,09/min), usar um LLM menor para tarefas simples e negociar descontos por volume acima de 10 milhões de minutos/mês. Em escala, plataforma e telefonia dominam, não o STT nem o LLM.

Sim. Ela roda 100 % no seu navegador. Escolhas de provedor, volume de chamadas e todos os resultados são processados localmente e nunca transmitidos a servidor algum. Não exige conta e não armazena dados. Seu planejamento de infraestrutura permanece totalmente privado.