Калькулятор стоимости голосовых агентов
Оцените полную стоимость инфраструктуры ИИ-голосовых агентов — бесплатно и на 100 % приватно в браузере. Смоделируйте пять слоёв затрат: транскрипция STT (Deepgram, AssemblyAI, OpenAI Whisper), инференс LLM (GPT-4o, Claude, Groq, DeepSeek), синтез TTS (ElevenLabs, Cartesia, AWS Polly), телефонный транспорт (Twilio, Telnyx, LiveKit) и оркестрация платформы (Vapi, Retell, Bland AI). Получите стоимость за вызов, месячные суммы, полную разбивку по слоям и анализ задержки — укладывается ли стек в цель ≤500 мс.
Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.
Inbound support - average 4-minute calls, 500/day
Call Parameters
1. Speech-to-Text (STT)
2. LLM Inference
3. Text-to-Speech (TTS)
4. Telephony & Platform
Voice Agent Cost Summary
Cost / Call
$0.27
Cost / Min
$0.07
Monthly Cost
$4,061.04
Annual Cost
$48,732.48
Daily Cost
$135.37
Pipeline Latency
700ms
STT+LLM+TTS
Calls/Month
15,000
Call-Mins/Month
60,000
Per-Call Cost Breakdown
Pipeline Latency (Response Time to User)
Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.
Пять слоёв затрат голосового агента
Каждый звонок проходит через пять тарифицируемых компонентов: транскрипцию, рассуждение LLM, синтез речи, телефонию и оркестрацию.
LLM и наценка платформы и телефонии обычно весят больше, чем STT и TTS.
- STT: плата за минуту транскрибированного аудио.
- LLM: плата за входные и выходные токены каждой реплики.
- TTS: плата за синтезированный символ.
- Телефония: плата за минуту соединения.
- Платформа: наценка за минуту оркестрации.
Задержка: практический предел
Ниже 500 мс суммарной задержки разговор ощущается естественным. Выше 1000 мс человек замечает неловкие паузы.
- TTFT у LLM: самый вариативный компонент.
- STT-провайдеры с задержкой 180–300 мс.
- Голоса TTS, начинающие звучать менее чем за 100 мс.
Оптимизация затрат без потери качества
Цель — снизить цену за минуту, сохранив разговорную задержку. Смена провайдера на крупных слоях даёт наибольшую экономию.
- Оцените среднюю длительность и месячный объём звонков.
- Выберите провайдера по каждому слою с учётом цены и задержки.
- Посмотрите разбивку, какой слой доминирует в счёте.
- Уменьшите LLM или уберите слой платформы, если задержка позволяет.
Часто задаваемые вопросы
Он оценивает полную стоимость инфраструктуры ИИ-голосового агента, моделируя все тарифицируемые компоненты: транскрипцию STT, инференс LLM, синтез TTS, телефонный транспорт и опциональные сборы за оркестрацию платформы. Калькулятор работает на 100 % в браузере без регистрации.
Типичный голосовой агент стоит 0,05–0,25 $ за минуту. Оптимизированный стек (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) может стоить 0,01–0,02 $/мин. Премиальный стек (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) превышает 0,20 $/мин. Главные рычаги — модель LLM и наценка платформы и телефонии.
Самые быстрые стеки 2025 года дают 400–500 мс суммарной задержки: Deepgram Nova-3 (180 мс STT), Groq Llama 3.1 70B (150 мс TTFT) и ElevenLabs Flash v2.5 (75 мс до первого аудио). Стеки OpenAI Whisper + GPT-4o + OpenAI TTS обычно 1 200–1 800 мс, что звучит заметно медленно для звонящего.
Телефония (PSTN) подключает обычные номера через операторов вроде Twilio или Telnyx — человек звонит на обычный номер. WebRTC передаёт голос через приложения или браузеры без оператора. PSTN добавляет 0,002–0,0085 $/мин, но доступен любому телефону. WebRTC убирает затраты оператора, но требует приложения или веб-интерфейса.
Groq использует аппаратуру LPU, созданную для последовательной генерации токенов, достигая времени до первого токена 100–200 мс на моделях 70B против 400–700 мс у GPT-4o. Для голоса, где важны каждые 100 мс, это существенно. Минус — Groq обслуживает открытые модели (Llama, Mixtral).
Это платформы оркестрации голосовых агентов, которые берут на себя маршрутизацию звонков, определение реплик, обработку перебиваний и потоковое аудио. Они берут 0,05–0,09 $/мин сверх затрат на компоненты в обмен на снятие инженерной сложности. Свой стек избегает этой наценки, но требует серьёзных вложений в разработку.
Основная экономия: сменить телефонию с Twilio на Telnyx (~0,006 $/мин), убрать или развернуть у себя слой платформы (0,05–0,09 $/мин), использовать меньшую LLM для простых задач и договориться о скидках при 10+ млн минут в месяц. В масштабе доминируют платформа и телефония, а не STT или LLM.
Да. Он работает на 100 % в браузере. Выбор провайдеров, объём звонков и все результаты обрабатываются локально и никогда не передаются на сервер. Аккаунт не требуется, данные не сохраняются. Планирование инфраструктуры остаётся полностью приватным.