Voice-Agent-Kostenrechner
Schätzen Sie die vollständigen Infrastrukturkosten von KI-Voice-Agents – kostenlos und 100 % privat im Browser. Modellieren Sie alle fünf Kostenebenen: STT-Transkription (Deepgram, AssemblyAI, OpenAI Whisper), LLM-Inferenz (GPT-4o, Claude, Groq, DeepSeek), TTS-Synthese (ElevenLabs, Cartesia, AWS Polly), Telefonietransport (Twilio, Telnyx, LiveKit) und Plattform-Orchestrierung (Vapi, Retell, Bland AI). Erhalten Sie Kosten pro Anruf, Monatssummen, eine vollständige Aufschlüsselung nach Ebene und eine Latenzanalyse, ob Ihr Stack die ≤500-ms-Zielvorgabe erreicht.
Estimate the full per-minute and per-call cost of AI voice agents. Model every layer of the voice stack - STT transcription, LLM inference, TTS synthesis, telephony transport, and platform orchestration - with real provider pricing. Runs 100% locally in your browser.
Inbound support - average 4-minute calls, 500/day
Call Parameters
1. Speech-to-Text (STT)
2. LLM Inference
3. Text-to-Speech (TTS)
4. Telephony & Platform
Voice Agent Cost Summary
Cost / Call
$0.27
Cost / Min
$0.07
Monthly Cost
$4,061.04
Annual Cost
$48,732.48
Daily Cost
$135.37
Pipeline Latency
700ms
STT+LLM+TTS
Calls/Month
15,000
Call-Mins/Month
60,000
Per-Call Cost Breakdown
Pipeline Latency (Response Time to User)
Target ≤500ms for natural conversation. >900ms causes noticeable pauses that hurt caller experience.
Die fünf Kostenebenen eines Voice-Agents
Jeder Anruf durchläuft fünf abrechenbare Komponenten: Transkription, LLM-Reasoning, Sprachsynthese, Telefonie und Orchestrierung.
LLM sowie Plattform- und Telefoniemarge wiegen meist schwerer als STT und TTS.
- STT: Abrechnung pro Minute transkribierten Audios.
- LLM: Abrechnung pro Ein- und Ausgabe-Token je Turn.
- TTS: Abrechnung pro synthetisiertem Zeichen.
- Telefonie: Abrechnung pro Verbindungsminute.
- Plattform: Marge pro Minute für die Orchestrierung.
Latenz: die praktische Grenze
Unter 500 ms Gesamtlatenz wirkt das Gespräch natürlich. Über 1.000 ms nehmen Anrufer unangenehme Pausen wahr.
- LLM-TTFT: die Komponente mit der größten Varianz.
- STT-Anbieter mit 180-300 ms Latenz.
- TTS-Stimmen, die in unter 100 ms starten.
Kosten senken, ohne das Erlebnis zu brechen
Ziel ist ein niedrigerer Minutenpreis bei conversationstauglicher Latenz. Anbieterwechsel in den großen Ebenen bringt die größten Einsparungen.
- Schätzen Sie durchschnittliche Dauer und Monatsvolumen der Anrufe.
- Wählen Sie pro Ebene Anbieter nach Kosten und Latenz.
- Prüfen Sie die Aufschlüsselung, welche Ebene dominiert.
- LLM verkleinern oder Plattformebene entfernen, wenn die Latenz es erlaubt.
Häufig gestellte Fragen
Er schätzt die gesamten Infrastrukturkosten eines KI-Voice-Agents, indem er alle abrechenbaren Komponenten modelliert: STT-Transkription, LLM-Inferenz, TTS-Synthese, Telefonietransport und optionale Plattform-Orchestrierungsgebühren. Unser Rechner läuft 100 % im Browser, ohne Registrierung.
Ein typischer Voice-Agent kostet 0,05-0,25 $ pro Minute. Ein kostenoptimierter Stack (AssemblyAI Nano + Groq Llama + AWS Polly + Telnyx) kann bis auf 0,01-0,02 $/min sinken. Ein Premium-Stack (Deepgram Nova-3 + GPT-4o + ElevenLabs Flash + Twilio + Vapi) kann 0,20 $/min übersteigen. Die größten Hebel sind das LLM-Modell und die Plattform-/Telefoniemarge.
Die schnellsten Stacks 2025 erreichen 400-500 ms Gesamtlatenz mit Deepgram Nova-3 (180 ms STT), Groq Llama 3.1 70B (150 ms TTFT) und ElevenLabs Flash v2.5 (75 ms erstes Audio). Stacks mit OpenAI Whisper + GPT-4o + OpenAI TTS liegen bei 1.200-1.800 ms, was für Anrufer deutlich langsam klingt.
Telefonie (PSTN) verbindet reguläre Rufnummern über Carrier wie Twilio oder Telnyx. WebRTC liefert Sprache über Apps oder Browser ohne Carrier. PSTN kostet zusätzlich 0,002-0,0085 $/min, erreicht aber jedes Telefon. WebRTC spart Carrierkosten, erfordert aber eine App oder Weboberfläche beim Anrufer.
Groq nutzt speziell für sequenzielle Token-Generierung gebaute LPU-Hardware und erreicht 100-200 ms Time-to-First-Token bei 70B-Modellen gegenüber 400-700 ms bei GPT-4o. Bei Voice, wo jede 100 ms zählt, ist das erheblich. Der Nachteil: Groq bedient Open-Weight-Modelle (Llama, Mixtral).
Es sind Orchestrierungsplattformen für Voice-Agents, die Call-Routing, Turn-Detection, Interrupt-Behandlung und Audio-Streaming übernehmen. Sie berechnen 0,05-0,09 $/min zusätzlich zu den Komponentenkosten und ersparen Ingenieurskomplexität. Ein eigener Stack vermeidet diese Marge, erfordert aber erhebliche Engineering-Investitionen.
Die größten Einsparungen: Telefonie von Twilio auf Telnyx wechseln (~0,006 $/min), die Plattformebene entfernen oder selbst hosten (0,05-0,09 $/min), ein kleineres LLM für einfache Aufgaben nutzen und Mengenrabatte ab 10 Mio. Minuten/Monat verhandeln. Im Maßstab dominieren Plattform und Telefonie, nicht STT oder LLM.
Ja. Er läuft 100 % im Browser. Anbieterauswahl, Anrufvolumen und alle Ergebnisse werden lokal verarbeitet und nie an einen Server gesendet. Kein Konto nötig, keine Daten gespeichert. Ihre Infrastrukturplanung bleibt völlig privat.