Zum Inhalt springen
Aback Tools Logo

AWS-Bedrock-Kostenrechner

Schätzen Sie die Inferenzkosten der Amazon-Bedrock-API für Anthropic Claude, Amazon Nova, Meta Llama, Mistral und Cohere. Berechnen Sie Kosten pro Anfrage, wenden Sie Batch-Inferenz- (50 % Rabatt) und Prompt-Caching-Rabatte an, vergleichen Sie Modellpreise direkt und projizieren Sie Tages-, Monats- oder Jahresausgaben – 100 % kostenlos und vollständig im Browser.

AWS Bedrock Cost Calculator

Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.

Provider: AnthropicInput/1M: $3.000Output/1M: $15.000Cache/1M: $0.300Context: 1,000,000 tokens

Prompt Token Counts

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$900.00for 30,000 total requests

Cost per Single Call

$0.0300

Input Token Cost

$0.0150

Output Token Cost

$0.0150

Model Comparison (Monthly Forecast)

ModelCost/CallMonthly TotalFeatures
Amazon Nova MicroBest Value
Amazon · In: $0.035/M · Out: $0.140/M
$0.000315$9.45Std
Amazon Nova LiteBest Value
Amazon · In: $0.060/M · Out: $0.240/M
$0.000540$16.20Caching ✓
Mistral Small 3Best Value
Mistral AI · In: $0.100/M · Out: $0.300/M
$0.000800$24.00Std
Claude 3 HaikuBest Value
Anthropic · In: $0.250/M · Out: $1.250/M
$0.002500$75.00Caching ✓
Cohere Command RBest Value
Cohere · In: $0.500/M · Out: $1.500/M
$0.004000$120.00Std
Meta Llama 3.3 70B InstructBest Value
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Meta Llama 3.1 70B Instruct
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Amazon Nova ProCapable
Amazon · In: $0.800/M · Out: $3.200/M
$0.007200$216.00Caching ✓
Claude 3.5 HaikuBest Value
Anthropic · In: $0.800/M · Out: $4.000/M
$0.008000$240.00Caching ✓
Mistral Large 2 (2411)Capable
Mistral AI · In: $2.000/M · Out: $6.000/M
$0.0160$480.00Std
Meta Llama 3.1 405B InstructCapable
Meta · In: $2.650/M · Out: $3.500/M
$0.0168$502.50Std
Cohere Command R+
Cohere · In: $2.500/M · Out: $10.000/M
$0.0225$675.00Std
Claude Sonnet 4 (Latest)Capable Selected
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.7 SonnetCapable
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.5 Sonnet v2
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3 OpusCapable
Anthropic · In: $15.000/M · Out: $75.000/M
$0.1500$4,500.00Caching ✓
Disclaimer: Rates reflect US-East-1 (N. Virginia) on-demand pricing. Actual bills may vary by AWS region, EDP commitments, AWS Free Tier credits, or model version updates. Prompt caching discount depth varies by model (typically 75-90% off standard input rates). Always verify against the official AWS Bedrock pricing page before committing budget. All calculations run locally in your browser - no data is sent to any server.

Was die Kosten pro Aufruf bei Bedrock bestimmt

Bei Bedrock entstehen Kosten nicht durch einen Pauschalpreis, sondern durch die Anzahl der Ein- und Ausgabe-Tokens pro Anfrage. Zwei Anwendungen mit gleich vielen Aufrufen können sehr unterschiedliche Rechnungen haben.

Geben Sie Ein- und Ausgabe-Tokens pro Anfrage, das Anfragevolumen und das gewählte Modell ein, um echte Kosten pro Aufruf und die Ausgabenprognose zu sehen.

  • Ausgabe-Tokens kosten das 3- bis 10-Fache von Eingabe-Tokens: die Antwortlänge ist der direkteste Hebel.
  • Batch-Inferenz gewährt 50 % Rabatt, wenn Echtzeitlatenz nicht nötig ist.
  • Prompt-Caching senkt die Kosten des wiederholten Präfixes in langen statischen Kontexten um 75–90 %.

Modell und Abrechnungsart wählen

Das leistungsfähigste Modell ist selten für alle Aufgaben das wirtschaftlichste. Lasten nach Komplexität zu trennen spart meist mehr als jede technische Optimierung.

  • Nova Micro und Nova Lite decken allgemeine Textaufgaben zu sehr niedrigen Kosten ab.
  • Provisioned Throughput lohnt sich bei hohem, gleichmäßigem Verkehr: bis zu 40–60 % günstiger.
  • PTU-Commitments laufen 1 oder 6 Monate – prüfen Sie die Volumenstabilität.

Die Prognose sinnvoll nutzen

Prognosen sind ein Planungswerkzeug, keine Rechnung. Vergleichen Sie sie mit der echten Rechnung des ersten Monats und passen Sie Token- und Volumenannahmen an.

  1. Messen Sie die tatsächlichen Ein- und Ausgabe-Tokens einer repräsentativen Anfrage.
  2. Tragen Sie das erwartete Tages-, Monats- oder Jahresvolumen ein.
  3. Wählen Sie Modell und Referenzregion für die prognostizierten Kosten.
  4. Wenden Sie Batch- oder Cache-Rabatte an und vergleichen Sie optimiertes mit Basisszenario.

Häufig gestellte Fragen

Es ist ein Online-Tool, das Ihre Amazon-Bedrock-API-Kosten anhand von Ein- und Ausgabe-Tokens, Modellwahl und Anfragevolumen schätzt. Es projiziert Kosten pro Aufruf und skaliert sie zu Tages-, Monats- oder Jahresprognosen. Unser Rechner läuft vollständig im Browser – es werden keine Daten hochgeladen oder gespeichert.

Der Rechner nutzt die On-Demand-Tokenpreise der Region us-east-1 (Nord-Virginia) von der offiziellen AWS-Bedrock-Preisseite. Reale Rechnungen können leicht abweichen – durch regionale Preisunterschiede, EDP-Commitment-Rabatte, Werbeguthaben, Modellversions-Updates oder Datenübertragungskosten bei Cross-Region-Inferenz.

On-Demand berechnet pro verbrauchtem Token ohne Vorabverpflichtung – ideal für variable, unvorhersehbare Lasten. Provisioned Throughput Units (PTUs) reservieren dedizierte Modellkapazität zu einem festen Stundensatz, meist 40–60 % günstiger bei gleichmäßig hohem Verkehr. PTU-Commitments erfordern eine Laufzeit von 1 oder 6 Monaten.

Sie verarbeitet API-Anfragen asynchron im Hintergrund und liefert Ergebnisse innerhalb von 24 Stunden. AWS gewährt einen pauschalen Rabatt von 50 % auf alle Ein- und Ausgabe-Tokenkosten gegenüber den On-Demand-Preisen. Ideal für Massendokumentenverarbeitung, nächtliche Auswertungen, Datensatzübersetzung und Lasten ohne Echtzeitbedarf.

Prompt-Caching speichert häufig wiederverwendete Inhalte (lange System-Prompts, RAG-Referenzdokumente, große Instruktionsblöcke) in der AWS-Infrastruktur. Bei Folgeaufrufen mit demselben Cache-Präfix wird dieser Teil 75–90 % günstiger als Standard-Eingabetoken abgerechnet. Besonders wirksam für Chatbot- oder Agent-Architekturen mit großem, statischem Systemkontext.

Ausgabe-Tokens werden sequenziell und autoregressiv erzeugt – jeder Token erfordert einen vollständigen Vorwärtsdurchlauf durch das Modell. Das ist rechenintensiver als die Verarbeitung von Eingabe-Tokens. Die meisten Bedrock-Modelle berechnen Ausgabe mit dem 3- bis 10-fachen Eingabepreis. Kurze Antworten sind der direkteste Weg zu niedrigeren Kosten pro Aufruf.

Für rein textbasierte Allzweck-Lasten sind Amazon Nova Micro und Amazon Nova Lite die wirtschaftlichsten Modelle auf AWS Bedrock – Nova Micro ab 0,035 $ pro Million Eingabe-Tokens. Für anspruchsvollere Aufgaben bieten Claude 3.5 Haiku oder Claude 3 Haiku ein hervorragendes Preis-Leistungs-Verhältnis. Nutzen Sie die Vergleichstabelle dieses Rechners.

Ja. Der Rechner läuft vollständig clientseitig im Browser. Tokenzahlen, Anfragevolumen, Modellauswahl und alle Kostenprognosen werden lokal auf Ihrem Gerät berechnet und nie an einen Server übertragen, gespeichert oder protokolliert. Ihre Budgetplanungsdaten bleiben vollständig privat.