Prompt-Kostenrechner
Schätzen Sie kostenlos online die Kosten, Prompts im Maßstab auszuführen. Definieren Sie System-Prompt, Nutzernachricht und Ausgabe-Token-Größen und legen Sie Ihr tägliches Anfragevolumen fest, um prognostizierte API-Kosten für Tag, Monat und Jahr zu sehen. Vergleichen Sie Kosten über 13 große LLM-Anbieter sofort. Schnell, privat und 100 % im Browser.
Estimate the cost of running prompts at scale. Define your system prompt, user message, and output size - then set your request volume to see daily, monthly, and yearly API cost projections across all major models.
Support chatbot with system prompt + short user messages
Prompt Composition (per request)
Token Breakdown per Request
Scale & Model
Projected Monthly Cost - GPT-4o mini
Cost / Request
$0.000322
Cost / Day
$1.61
Input Token Cost
$21.38
Output Token Cost
$27.00
Cost at Scale - All Periods
| Period | Total Requests | Input Cost | Output Cost | Total Cost |
|---|---|---|---|---|
| Daily | 5,000 | $0.7125 | $0.9000 | $1.61 |
| MonthlySelected | 150,000 | $21.38 | $27.00 | $48.38 |
| Yearly | 1,825,000 | $260.06 | $328.50 | $588.56 |
Cross-Model Price Comparison
Sorted by lowest monthly cost| Model | In/1M | Out/1M | Cost/Req | Monthly Total |
|---|---|---|---|---|
Mistral Small(Mistral)Budget | $0.10 | $0.30 | $0.000185 | $27.75 |
GPT-4o mini(OpenAI)Budget Active | $0.15 | $0.60 | $0.000322 | $48.37 |
DeepSeek-V3(DeepSeek)Budget | $0.27 | $1.10 | $0.000586 | $87.98 |
Gemini 2.5 Flash(Google)Budget | $0.30 | $2.50 | $0.001035 | $155.25 |
Grok 4.3(xAI) | $1.25 | $2.50 | $0.001937 | $290.63 |
Claude 3.5 Haiku(Anthropic)Budget | $0.80 | $4.00 | $0.001960 | $294.00 |
o4-mini(OpenAI)Budget | $1.10 | $4.40 | $0.002365 | $354.75 |
Mistral Large(Mistral) | $2.00 | $6.00 | $0.003700 | $555.00 |
Gemini 2.5 Pro(Google) | $1.25 | $10.00 | $0.004187 | $628.12 |
o3(OpenAI) | $2.00 | $8.00 | $0.004300 | $645.00 |
GPT-4o(OpenAI) | $2.50 | $10.00 | $0.005375 | $806.25 |
Claude Sonnet 4.6(Anthropic)Powerful | $3.00 | $15.00 | $0.007350 | $1,102.50 |
Claude 3 Opus(Anthropic)Powerful | $15.00 | $75.00 | $0.0367 | $5,512.50 |
Click any row to select that model.
Warum der System-Prompt die Rechnung dominiert
Der System-Prompt wird bei jeder Anfrage vollständig mitgesendet. Seine Kosten hängen nicht von seinem Nutzen ab, sondern von der Anzahl der Anfragen.
Bei hohem Volumen bringt das Kürzen einiger hundert Tokens im System-Prompt erhebliche monatliche Einsparungen.
- System-Prompt-Kosten = Tokens × Anfragen pro Tag × Tage.
- Ausgabe-Tokens kosten 3-6× mehr als Eingabe-Tokens.
- Prompt-Caching senkt diese Kosten um 75-90 %, wenn anwendbar.
Nutzernachricht und Kontext trennen
Trennen Sie festen Kontext von dem, was sich pro Anfrage ändert. Nur der feste Teil ist für Caching geeignet.
- Messen Sie die Tokens von System-Prompt und Nutzernachricht getrennt.
- Summieren Sie die erwarteten Eingabe-Tokens pro Anfrage.
- Addieren Sie die erwarteten Ausgabe-Tokens pro Antwort.
- Multiplizieren Sie mit dem Anfragevolumen für die Periodensumme.
Modell wählen und Wachstum projizieren
Vergleichen Sie die Gesamtkosten Ihrer exakten Konfiguration über die Modelle, bevor Sie sich festlegen. Das günstigste Modell, das Ihre Qualitätsanforderungen erfüllt, ist fast immer die beste Wahl.
- Beginnen Sie mit dem wirtschaftlichsten Modell und steigern Sie nur bei Qualitätsbedarf.
- Modellieren Sie das monatliche Wachstum, um das Budget nicht zu unterschätzen.
- Reservieren Sie Frontier-Modelle für komplexes Reasoning.
Häufig gestellte Fragen
Er schätzt die API-Ausgaben für eine bestimmte Prompt-Konfiguration – System-Prompt, Nutzernachricht und erwartete Ausgabe – bei einem gegebenen Anfragevolumen und Zeitraum. Er hilft Entwicklern und Produktteams, ihre LLM-API-Kosten vor dem Launch zu kennen, SaaS-Preisstufen zu planen und zu vergleichen, welches Modell das beste Kosten-Qualitäts-Verhältnis bietet.
Faustregel: 1 Token ≈ 4 Zeichen, etwa 0,75 Wörter im Englischen. Ein System-Prompt mit 500 Wörtern entspricht etwa 650-700 Tokens. Eine kurze Nutzernachricht mit 50 Wörtern liegt bei etwa 65-70 Tokens. Für exakte Werte nutzen Sie einen Tokenizer – OpenAIs Tiktoken und Anthropics Claude-Tokenizer sind Open Source. Unser Token-Counter-Tool kann ebenfalls Tokens aus eingefügtem Text schätzen.
Der System-Prompt wird bei jeder einzelnen API-Anfrage vollständig berechnet. Bei 1.000 Tokens und 10.000 Anfragen pro Tag sind das 10 Millionen Eingabe-Tokens allein aus dem System-Prompt – jeden Tag. Deshalb treiben lange, ausführliche System-Prompts die Kosten stark. Den System-Prompt kürzen und Prompt-Caching aktivieren sind die zwei Optimierungen mit dem besten ROI für die meisten Produktions-LLM-Apps.
Nein – der Rechner nutzt Standard-Pay-as-you-go-Tarife ohne Caching. Das liefert bewusst die Worst-Case-Basiskosten. In der Praxis bieten Anbieter wie OpenAI, Anthropic, Google und xAI Prompt-Caching, das die Eingabe-Token-Kosten für wiederholten statischen Inhalt um 75-90 % senkt. Nutzen Sie dieses Tool für Ihre Basis und modellieren Sie die Caching-Einsparungen separat.
Nutzen Sie die Modellvergleichstabelle: Sie zeigt die Gesamtkosten für Ihre exakte Konfiguration über alle unterstützten Modelle. Beginnen Sie mit dem günstigsten Modell, das Ihre Qualitätsanforderungen erfüllt. Aufgaben wie Klassifikation, Extraktion und strukturierte Ausgabe funktionieren oft hervorragend mit kleineren Modellen (GPT-4o mini, Claude 3.5 Haiku, Gemini Flash, Mistral Small). Reservieren Sie teure Frontier-Modelle für tiefes Reasoning.
Es modelliert das Wachstum des Anfragevolumens über den Prognosezeitraum. Bei 20 % nimmt der Rechner an, dass Ihre täglichen Anfragen monatlich um 20 % wachsen. Für eine Jahresprognose interpoliert er linear zwischen Start- und Endvolumen. Setzen Sie 0 für konstante Projektionen.
Die Token-Generierung erfordert für jedes Token einen vollständigen autoregressiven Forward-Pass – deutlich mehr Rechenaufwand als das Lesen von Eingabe-Tokens. Die Ausgabegenerierung wird bei den meisten Anbietern mit 3-6× Aufschlag auf Eingabe-Tokens berechnet. Deshalb haben Apps mit langen Antworten ein anderes Kostenprofil als Klassifikatoren mit kurzer Ausgabe.
Ja. Der Rechner läuft vollständig clientseitig im Browser. Keine Token-Zahlen, Prompt-Konfigurationen, Kostenschätzungen oder Modellauswahlen werden an einen Server gesendet. Alles wird lokal auf Ihrem Gerät berechnet und nie gespeichert. Ihre Planungsdaten sind 100 % privat und sicher.