Zum Inhalt springen
Aback Tools Logo

Inferenzkostenrechner

Schätzen Sie LLM-Inferenzkosten aus Anfragen, Latenz und Token-Volumen kostenlos online. Modellieren Sie Prompt-Caching-Rabatte, Batch-API-Einsparungen, Retry-Overhead und gleichzeitige Durchsatzkapazität – und vergleichen Sie anschließend Kosten und Latenz über 14 Modelle. Läuft 100 % im Browser.

Inference Cost Calculator

Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.

Real-time user-facing chat with sub-2s latency SLA

In/1M: $0.15Out/1M: $0.60TTFT: 250msSpeed: 100 tok/s

Token Sizes per Request

tokens
tokens
Total/req: 1,150 tokensIn cost: $0.000120Out cost: $0.000210

Request Volume & Latency

req/day
concurrent
ms

Cost Optimizations

%
%
%
⚠️ SLA Risk: Estimated P95 latency for GPT-4o mini is 3.8s - exceeds your 1.5s target. Consider a faster model or reduce output tokens.

Projected Monthly Inference Cost

$201.96for 612,000 requests

Cost / Request

$0.000330

Cost / 1K Req

$0.3300

Est. Latency

3.8s

Max RPS

13.3

Per-Request Cost Breakdown

Input (standard): $0.000120Input (cached): $0.00Output: $0.000210Retry overhead: $0.00000660

Model Cost & Latency Comparison

Sorted by lowest monthly cost
Model$/reqMonthly CostLatencySLA
Llama 3.1 8BBudget
Groq/Together · 600 tok/s · TTFT 80ms
$0.00006800$41.62663ms✓ Met
Mistral Small 3.2Budget
Mistral · 160 tok/s · TTFT 160ms
$0.000185$113.222.3s✗ Breach
GPT-4o miniBudget Selected
OpenAI · 100 tok/s · TTFT 250ms
$0.000330$201.963.8s✗ Breach
DeepSeek-V3Budget
DeepSeek · 90 tok/s · TTFT 300ms
$0.000601$367.814.2s✗ Breach
Llama 3.3 70BBudget
Groq/Togther · 250 tok/s · TTFT 120ms
$0.000749$458.081.5s✗ Breach
Gemini 2.5 FlashBudget
Google · 150 tok/s · TTFT 180ms
$0.001115$682.382.5s✗ Breach
Grok 4.3
xAI · 80 tok/s · TTFT 350ms
$0.001875$1,147.504.7s✗ Breach
Claude 3.5 HaikuBudget
Anthropic · 130 tok/s · TTFT 200ms
$0.002040$1,248.482.9s✗ Breach
o4-mini
OpenAI · 50 tok/s · TTFT 600ms
$0.002420$1,481.047.6s✗ Breach
Mistral Large 3
Mistral · 70 tok/s · TTFT 380ms
$0.003700$2,264.405.4s✗ Breach
o3Capable
OpenAI · 45 tok/s · TTFT 700ms
$0.004400$2,692.808.5s✗ Breach
Gemini 2.5 Pro
Google · 65 tok/s · TTFT 450ms
$0.004500$2,754.005.8s✗ Breach
GPT-4oCapable
OpenAI · 60 tok/s · TTFT 400ms
$0.005500$3,366.006.2s✗ Breach
Claude Sonnet 4.6Capable
Anthropic · 55 tok/s · TTFT 500ms
$0.007650$4,681.806.9s✗ Breach
Disclaimer:Pricing uses standard Pay-As-You-Go rates. Latency estimates are indicative medians - actual TTFT and throughput vary by region, load, and request size. Batch API discounts are typically ~50% but differ by provider. Always verify rates on each provider's official pricing page. All calculations run locally in your browser; no data is sent to any server.

Was die Inferenzkosten ausmacht

Die Inferenzkosten hängen von der Anzahl der Anfragen, der Eingabe- und Ausgabegröße jeder Anfrage und dem gewählten Modell ab. Die Kombination dieser drei Faktoren verändert das Ergebnis vollständig.

Da Ausgabe-Tokens teurer sind als Eingabe-Tokens, können eine lange Antwort bei kurzem Prompt mehr kosten als umgekehrt.

  • Tägliche Anfragen × Kosten pro Anfrage = tägliche Grundausgabe.
  • Teurere Ausgabe-Tokens: achten Sie auf die Antwortlänge.
  • Die Ziel-Latenz bestimmt, welches Modell Sie sich leisten können.

Cache- und Batch-Rabatte

Prompt-Caching und Batch API sind die beiden wichtigsten Hebel, um die Rechnung ohne Qualitätsverlust zu senken. Jeder passt zu anderen Traffic-Mustern.

  • Prompt-Caching: sinnvoll bei großem, wiederholtem System-Prompt oder Kontext.
  • Batch API: rund 50 % Rabatt für asynchrone Jobs.
  • Retries: erhöhen Volumen und Gesamtkosten proportional.

Latenz-SLA prüfen

Niedrige Kosten nützen nichts, wenn die Erfahrung leidet. Die geschätzte Latenz ergibt sich aus TTFT plus Generierungszeit der Ausgabe-Tokens.

  1. Definieren Sie TTFT und Generierungsgeschwindigkeit des geprüften Modells.
  2. Berechnen Sie die Ende-zu-Ende-Latenz mit Ihrer typischen Ausgabegröße.
  3. Vergleichen Sie das Ergebnis mit Ihrem SLA-Ziel.
  4. Bei Verfehlung: schnelleres Modell wählen oder Ausgabelänge reduzieren.

Häufig gestellte Fragen

Er schätzt, was Sie für Live-LLM-Anfragen in einem bestimmten Umfang zahlen. Er nutzt Ihre Ein- und Ausgabe-Token, das tägliche Anfragevolumen und die Modellwahl, um Kosten pro Anfrage sowie Tages-, Monats- oder Jahresgesamtwerte zu projizieren. Unser Tool modelliert zusätzlich Latenz-SLA-Einhaltung, Durchsatzkapazität, Prompt-Caching, Batch-API-Rabatte und Retry-Overhead – lokal im Browser, ohne Registrierung.

Trainingskosten sind eine einmalige Ausgabe, um ein Modell mit GPU-Compute zu erstellen oder zu optimieren. Inferenzkosten sind die wiederkehrende Ausgabe pro Anfrage, die Sie jedes Mal zahlen, wenn ein Nutzer oder eine Pipeline einen Prompt sendet und eine Antwort erhält. In den meisten Produktionsanwendungen dominieren die Inferenzkosten die laufenden KI-Ausgaben.

Ja. Der Rechner läuft vollständig clientseitig in Ihrem Browser mit JavaScript. Token-Größen, Anfragevolumen, Latenzziele und Kostenprojektionen werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server übertragen oder gespeichert. Ihre Daten bleiben während der gesamten Sitzung 100 % privat.

Die Ende-zu-Ende-Latenz wird geschätzt als: Time-to-First-Token (TTFT) + (Ausgabe-Tokens ÷ Generierungsgeschwindigkeit in Tokens/s). Ein Modell mit 300 ms TTFT, das 500 Ausgabe-Tokens mit 100 Tokens/s erzeugt, hat also eine geschätzte Latenz von 300 ms + 5.000 ms = 5,3 Sekunden. TTFT- und Geschwindigkeitswerte sind repräsentative Mediane.

TTFT ist die Zeit zwischen dem Senden einer Anfrage und dem Empfang des ersten Tokens der Antwort. Er bestimmt, wie schnell Ihre Anwendung Inhalte anzeigen kann. Niedriger TTFT (unter 200 ms) ist entscheidend für interaktive Chat-Anwendungen. Kleinere und stärker quantisierte Modelle haben meist niedrigeren TTFT als große Frontier-Modelle.

Prompt-Caching speichert den KV-Attention-Zustand eines wiederholten Prompt-Präfixes, sodass Folgeanfragen mit demselben Präfix mit etwa 25 % des Standard-Eingabetarifs berechnet werden. Das ist besonders wirksam, wenn Ihr System-Prompt oder Dokumentkontext groß und über viele Anfragen hinweg geteilt ist.

Nutzen Sie die Batch API für latenzunempfindliche Workloads: Massendokument-Zusammenfassung, Offline-Datenanreicherung, Klassifikation in großem Maßstab, nächtliche Berichtserstellung. Die Batch API berechnet etwa 50 % des Echtzeittarifs. Echtzeit-Inferenz ist für jede nutzerseitige interaktive Funktion erforderlich.

2-5 % sind typisch für LLM-API-Workloads in der Produktion und decken Rate-Limit-Fehler, temporäre Timeouts und 5xx-Fehler des Anbieters ab. Hochdurchsatzanwendungen nahe der Limits können 5-15 % erreichen. Die Retry-Rate erhöht Ihre Gesamtzahl an Anfragen und Kosten proportional.