Inferenzkostenrechner
Schätzen Sie LLM-Inferenzkosten aus Anfragen, Latenz und Token-Volumen kostenlos online. Modellieren Sie Prompt-Caching-Rabatte, Batch-API-Einsparungen, Retry-Overhead und gleichzeitige Durchsatzkapazität – und vergleichen Sie anschließend Kosten und Latenz über 14 Modelle. Läuft 100 % im Browser.
Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.
Real-time user-facing chat with sub-2s latency SLA
Token Sizes per Request
Request Volume & Latency
Cost Optimizations
Projected Monthly Inference Cost
Cost / Request
$0.000330
Cost / 1K Req
$0.3300
Est. Latency
3.8s
Max RPS
13.3
Per-Request Cost Breakdown
Model Cost & Latency Comparison
Sorted by lowest monthly cost| Model | $/req | Monthly Cost | Latency | SLA |
|---|---|---|---|---|
Llama 3.1 8BBudget Groq/Together · 600 tok/s · TTFT 80ms | $0.00006800 | $41.62 | 663ms | ✓ Met |
Mistral Small 3.2Budget Mistral · 160 tok/s · TTFT 160ms | $0.000185 | $113.22 | 2.3s | ✗ Breach |
GPT-4o miniBudget Selected OpenAI · 100 tok/s · TTFT 250ms | $0.000330 | $201.96 | 3.8s | ✗ Breach |
DeepSeek-V3Budget DeepSeek · 90 tok/s · TTFT 300ms | $0.000601 | $367.81 | 4.2s | ✗ Breach |
Llama 3.3 70BBudget Groq/Togther · 250 tok/s · TTFT 120ms | $0.000749 | $458.08 | 1.5s | ✗ Breach |
Gemini 2.5 FlashBudget Google · 150 tok/s · TTFT 180ms | $0.001115 | $682.38 | 2.5s | ✗ Breach |
Grok 4.3 xAI · 80 tok/s · TTFT 350ms | $0.001875 | $1,147.50 | 4.7s | ✗ Breach |
Claude 3.5 HaikuBudget Anthropic · 130 tok/s · TTFT 200ms | $0.002040 | $1,248.48 | 2.9s | ✗ Breach |
o4-mini OpenAI · 50 tok/s · TTFT 600ms | $0.002420 | $1,481.04 | 7.6s | ✗ Breach |
Mistral Large 3 Mistral · 70 tok/s · TTFT 380ms | $0.003700 | $2,264.40 | 5.4s | ✗ Breach |
o3Capable OpenAI · 45 tok/s · TTFT 700ms | $0.004400 | $2,692.80 | 8.5s | ✗ Breach |
Gemini 2.5 Pro Google · 65 tok/s · TTFT 450ms | $0.004500 | $2,754.00 | 5.8s | ✗ Breach |
GPT-4oCapable OpenAI · 60 tok/s · TTFT 400ms | $0.005500 | $3,366.00 | 6.2s | ✗ Breach |
Claude Sonnet 4.6Capable Anthropic · 55 tok/s · TTFT 500ms | $0.007650 | $4,681.80 | 6.9s | ✗ Breach |
Was die Inferenzkosten ausmacht
Die Inferenzkosten hängen von der Anzahl der Anfragen, der Eingabe- und Ausgabegröße jeder Anfrage und dem gewählten Modell ab. Die Kombination dieser drei Faktoren verändert das Ergebnis vollständig.
Da Ausgabe-Tokens teurer sind als Eingabe-Tokens, können eine lange Antwort bei kurzem Prompt mehr kosten als umgekehrt.
- Tägliche Anfragen × Kosten pro Anfrage = tägliche Grundausgabe.
- Teurere Ausgabe-Tokens: achten Sie auf die Antwortlänge.
- Die Ziel-Latenz bestimmt, welches Modell Sie sich leisten können.
Cache- und Batch-Rabatte
Prompt-Caching und Batch API sind die beiden wichtigsten Hebel, um die Rechnung ohne Qualitätsverlust zu senken. Jeder passt zu anderen Traffic-Mustern.
- Prompt-Caching: sinnvoll bei großem, wiederholtem System-Prompt oder Kontext.
- Batch API: rund 50 % Rabatt für asynchrone Jobs.
- Retries: erhöhen Volumen und Gesamtkosten proportional.
Latenz-SLA prüfen
Niedrige Kosten nützen nichts, wenn die Erfahrung leidet. Die geschätzte Latenz ergibt sich aus TTFT plus Generierungszeit der Ausgabe-Tokens.
- Definieren Sie TTFT und Generierungsgeschwindigkeit des geprüften Modells.
- Berechnen Sie die Ende-zu-Ende-Latenz mit Ihrer typischen Ausgabegröße.
- Vergleichen Sie das Ergebnis mit Ihrem SLA-Ziel.
- Bei Verfehlung: schnelleres Modell wählen oder Ausgabelänge reduzieren.
Häufig gestellte Fragen
Er schätzt, was Sie für Live-LLM-Anfragen in einem bestimmten Umfang zahlen. Er nutzt Ihre Ein- und Ausgabe-Token, das tägliche Anfragevolumen und die Modellwahl, um Kosten pro Anfrage sowie Tages-, Monats- oder Jahresgesamtwerte zu projizieren. Unser Tool modelliert zusätzlich Latenz-SLA-Einhaltung, Durchsatzkapazität, Prompt-Caching, Batch-API-Rabatte und Retry-Overhead – lokal im Browser, ohne Registrierung.
Trainingskosten sind eine einmalige Ausgabe, um ein Modell mit GPU-Compute zu erstellen oder zu optimieren. Inferenzkosten sind die wiederkehrende Ausgabe pro Anfrage, die Sie jedes Mal zahlen, wenn ein Nutzer oder eine Pipeline einen Prompt sendet und eine Antwort erhält. In den meisten Produktionsanwendungen dominieren die Inferenzkosten die laufenden KI-Ausgaben.
Ja. Der Rechner läuft vollständig clientseitig in Ihrem Browser mit JavaScript. Token-Größen, Anfragevolumen, Latenzziele und Kostenprojektionen werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server übertragen oder gespeichert. Ihre Daten bleiben während der gesamten Sitzung 100 % privat.
Die Ende-zu-Ende-Latenz wird geschätzt als: Time-to-First-Token (TTFT) + (Ausgabe-Tokens ÷ Generierungsgeschwindigkeit in Tokens/s). Ein Modell mit 300 ms TTFT, das 500 Ausgabe-Tokens mit 100 Tokens/s erzeugt, hat also eine geschätzte Latenz von 300 ms + 5.000 ms = 5,3 Sekunden. TTFT- und Geschwindigkeitswerte sind repräsentative Mediane.
TTFT ist die Zeit zwischen dem Senden einer Anfrage und dem Empfang des ersten Tokens der Antwort. Er bestimmt, wie schnell Ihre Anwendung Inhalte anzeigen kann. Niedriger TTFT (unter 200 ms) ist entscheidend für interaktive Chat-Anwendungen. Kleinere und stärker quantisierte Modelle haben meist niedrigeren TTFT als große Frontier-Modelle.
Prompt-Caching speichert den KV-Attention-Zustand eines wiederholten Prompt-Präfixes, sodass Folgeanfragen mit demselben Präfix mit etwa 25 % des Standard-Eingabetarifs berechnet werden. Das ist besonders wirksam, wenn Ihr System-Prompt oder Dokumentkontext groß und über viele Anfragen hinweg geteilt ist.
Nutzen Sie die Batch API für latenzunempfindliche Workloads: Massendokument-Zusammenfassung, Offline-Datenanreicherung, Klassifikation in großem Maßstab, nächtliche Berichtserstellung. Die Batch API berechnet etwa 50 % des Echtzeittarifs. Echtzeit-Inferenz ist für jede nutzerseitige interaktive Funktion erforderlich.
2-5 % sind typisch für LLM-API-Workloads in der Produktion und decken Rate-Limit-Fehler, temporäre Timeouts und 5xx-Fehler des Anbieters ab. Hochdurchsatzanwendungen nahe der Limits können 5-15 % erreichen. Die Retry-Rate erhöht Ihre Gesamtzahl an Anfragen und Kosten proportional.