AWS-Bedrock-Kostenrechner
Schätzen Sie die Inferenzkosten der Amazon-Bedrock-API für Anthropic Claude, Amazon Nova, Meta Llama, Mistral und Cohere. Berechnen Sie Kosten pro Anfrage, wenden Sie Batch-Inferenz- (50 % Rabatt) und Prompt-Caching-Rabatte an, vergleichen Sie Modellpreise direkt und projizieren Sie Tages-, Monats- oder Jahresausgaben – 100 % kostenlos und vollständig im Browser.
Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.
Prompt Token Counts
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0300
Input Token Cost
$0.0150
Output Token Cost
$0.0150
Model Comparison (Monthly Forecast)
| Model | Cost/Call | Monthly Total | Features |
|---|---|---|---|
Amazon Nova MicroBest Value Amazon · In: $0.035/M · Out: $0.140/M | $0.000315 | $9.45 | Std |
Amazon Nova LiteBest Value Amazon · In: $0.060/M · Out: $0.240/M | $0.000540 | $16.20 | Caching ✓ |
Mistral Small 3Best Value Mistral AI · In: $0.100/M · Out: $0.300/M | $0.000800 | $24.00 | Std |
Claude 3 HaikuBest Value Anthropic · In: $0.250/M · Out: $1.250/M | $0.002500 | $75.00 | Caching ✓ |
Cohere Command RBest Value Cohere · In: $0.500/M · Out: $1.500/M | $0.004000 | $120.00 | Std |
Meta Llama 3.3 70B InstructBest Value Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Meta Llama 3.1 70B Instruct Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Amazon Nova ProCapable Amazon · In: $0.800/M · Out: $3.200/M | $0.007200 | $216.00 | Caching ✓ |
Claude 3.5 HaikuBest Value Anthropic · In: $0.800/M · Out: $4.000/M | $0.008000 | $240.00 | Caching ✓ |
Mistral Large 2 (2411)Capable Mistral AI · In: $2.000/M · Out: $6.000/M | $0.0160 | $480.00 | Std |
Meta Llama 3.1 405B InstructCapable Meta · In: $2.650/M · Out: $3.500/M | $0.0168 | $502.50 | Std |
Cohere Command R+ Cohere · In: $2.500/M · Out: $10.000/M | $0.0225 | $675.00 | Std |
Claude Sonnet 4 (Latest)Capable Selected Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.7 SonnetCapable Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.5 Sonnet v2 Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3 OpusCapable Anthropic · In: $15.000/M · Out: $75.000/M | $0.1500 | $4,500.00 | Caching ✓ |
Was die Kosten pro Aufruf bei Bedrock bestimmt
Bei Bedrock entstehen Kosten nicht durch einen Pauschalpreis, sondern durch die Anzahl der Ein- und Ausgabe-Tokens pro Anfrage. Zwei Anwendungen mit gleich vielen Aufrufen können sehr unterschiedliche Rechnungen haben.
Geben Sie Ein- und Ausgabe-Tokens pro Anfrage, das Anfragevolumen und das gewählte Modell ein, um echte Kosten pro Aufruf und die Ausgabenprognose zu sehen.
- Ausgabe-Tokens kosten das 3- bis 10-Fache von Eingabe-Tokens: die Antwortlänge ist der direkteste Hebel.
- Batch-Inferenz gewährt 50 % Rabatt, wenn Echtzeitlatenz nicht nötig ist.
- Prompt-Caching senkt die Kosten des wiederholten Präfixes in langen statischen Kontexten um 75–90 %.
Modell und Abrechnungsart wählen
Das leistungsfähigste Modell ist selten für alle Aufgaben das wirtschaftlichste. Lasten nach Komplexität zu trennen spart meist mehr als jede technische Optimierung.
- Nova Micro und Nova Lite decken allgemeine Textaufgaben zu sehr niedrigen Kosten ab.
- Provisioned Throughput lohnt sich bei hohem, gleichmäßigem Verkehr: bis zu 40–60 % günstiger.
- PTU-Commitments laufen 1 oder 6 Monate – prüfen Sie die Volumenstabilität.
Die Prognose sinnvoll nutzen
Prognosen sind ein Planungswerkzeug, keine Rechnung. Vergleichen Sie sie mit der echten Rechnung des ersten Monats und passen Sie Token- und Volumenannahmen an.
- Messen Sie die tatsächlichen Ein- und Ausgabe-Tokens einer repräsentativen Anfrage.
- Tragen Sie das erwartete Tages-, Monats- oder Jahresvolumen ein.
- Wählen Sie Modell und Referenzregion für die prognostizierten Kosten.
- Wenden Sie Batch- oder Cache-Rabatte an und vergleichen Sie optimiertes mit Basisszenario.
Häufig gestellte Fragen
Es ist ein Online-Tool, das Ihre Amazon-Bedrock-API-Kosten anhand von Ein- und Ausgabe-Tokens, Modellwahl und Anfragevolumen schätzt. Es projiziert Kosten pro Aufruf und skaliert sie zu Tages-, Monats- oder Jahresprognosen. Unser Rechner läuft vollständig im Browser – es werden keine Daten hochgeladen oder gespeichert.
Der Rechner nutzt die On-Demand-Tokenpreise der Region us-east-1 (Nord-Virginia) von der offiziellen AWS-Bedrock-Preisseite. Reale Rechnungen können leicht abweichen – durch regionale Preisunterschiede, EDP-Commitment-Rabatte, Werbeguthaben, Modellversions-Updates oder Datenübertragungskosten bei Cross-Region-Inferenz.
On-Demand berechnet pro verbrauchtem Token ohne Vorabverpflichtung – ideal für variable, unvorhersehbare Lasten. Provisioned Throughput Units (PTUs) reservieren dedizierte Modellkapazität zu einem festen Stundensatz, meist 40–60 % günstiger bei gleichmäßig hohem Verkehr. PTU-Commitments erfordern eine Laufzeit von 1 oder 6 Monaten.
Sie verarbeitet API-Anfragen asynchron im Hintergrund und liefert Ergebnisse innerhalb von 24 Stunden. AWS gewährt einen pauschalen Rabatt von 50 % auf alle Ein- und Ausgabe-Tokenkosten gegenüber den On-Demand-Preisen. Ideal für Massendokumentenverarbeitung, nächtliche Auswertungen, Datensatzübersetzung und Lasten ohne Echtzeitbedarf.
Prompt-Caching speichert häufig wiederverwendete Inhalte (lange System-Prompts, RAG-Referenzdokumente, große Instruktionsblöcke) in der AWS-Infrastruktur. Bei Folgeaufrufen mit demselben Cache-Präfix wird dieser Teil 75–90 % günstiger als Standard-Eingabetoken abgerechnet. Besonders wirksam für Chatbot- oder Agent-Architekturen mit großem, statischem Systemkontext.
Ausgabe-Tokens werden sequenziell und autoregressiv erzeugt – jeder Token erfordert einen vollständigen Vorwärtsdurchlauf durch das Modell. Das ist rechenintensiver als die Verarbeitung von Eingabe-Tokens. Die meisten Bedrock-Modelle berechnen Ausgabe mit dem 3- bis 10-fachen Eingabepreis. Kurze Antworten sind der direkteste Weg zu niedrigeren Kosten pro Aufruf.
Für rein textbasierte Allzweck-Lasten sind Amazon Nova Micro und Amazon Nova Lite die wirtschaftlichsten Modelle auf AWS Bedrock – Nova Micro ab 0,035 $ pro Million Eingabe-Tokens. Für anspruchsvollere Aufgaben bieten Claude 3.5 Haiku oder Claude 3 Haiku ein hervorragendes Preis-Leistungs-Verhältnis. Nutzen Sie die Vergleichstabelle dieses Rechners.
Ja. Der Rechner läuft vollständig clientseitig im Browser. Tokenzahlen, Anfragevolumen, Modellauswahl und alle Kostenprognosen werden lokal auf Ihrem Gerät berechnet und nie an einen Server übertragen, gespeichert oder protokolliert. Ihre Budgetplanungsdaten bleiben vollständig privat.