Aller au contenu
Aback Tools Logo

Calculateur de coûts AWS Bedrock

Estimez les coûts d'inférence de l'API Amazon Bedrock pour les modèles Anthropic Claude, Amazon Nova, Meta Llama, Mistral et Cohere. Calculez les dépenses par requête, appliquez les remises d'inférence par lots (50 % de réduction) et de mise en cache des prompts, comparez les tarifs des modèles côte à côte et projetez les dépenses quotidiennes, mensuelles ou annuelles – 100 % gratuit et entièrement dans votre navigateur.

AWS Bedrock Cost Calculator

Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.

Provider: AnthropicInput/1M: $3.000Output/1M: $15.000Cache/1M: $0.300Context: 1,000,000 tokens

Prompt Token Counts

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$900.00for 30,000 total requests

Cost per Single Call

$0.0300

Input Token Cost

$0.0150

Output Token Cost

$0.0150

Model Comparison (Monthly Forecast)

ModelCost/CallMonthly TotalFeatures
Amazon Nova MicroBest Value
Amazon · In: $0.035/M · Out: $0.140/M
$0.000315$9.45Std
Amazon Nova LiteBest Value
Amazon · In: $0.060/M · Out: $0.240/M
$0.000540$16.20Caching ✓
Mistral Small 3Best Value
Mistral AI · In: $0.100/M · Out: $0.300/M
$0.000800$24.00Std
Claude 3 HaikuBest Value
Anthropic · In: $0.250/M · Out: $1.250/M
$0.002500$75.00Caching ✓
Cohere Command RBest Value
Cohere · In: $0.500/M · Out: $1.500/M
$0.004000$120.00Std
Meta Llama 3.3 70B InstructBest Value
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Meta Llama 3.1 70B Instruct
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Amazon Nova ProCapable
Amazon · In: $0.800/M · Out: $3.200/M
$0.007200$216.00Caching ✓
Claude 3.5 HaikuBest Value
Anthropic · In: $0.800/M · Out: $4.000/M
$0.008000$240.00Caching ✓
Mistral Large 2 (2411)Capable
Mistral AI · In: $2.000/M · Out: $6.000/M
$0.0160$480.00Std
Meta Llama 3.1 405B InstructCapable
Meta · In: $2.650/M · Out: $3.500/M
$0.0168$502.50Std
Cohere Command R+
Cohere · In: $2.500/M · Out: $10.000/M
$0.0225$675.00Std
Claude Sonnet 4 (Latest)Capable Selected
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.7 SonnetCapable
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.5 Sonnet v2
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3 OpusCapable
Anthropic · In: $15.000/M · Out: $75.000/M
$0.1500$4,500.00Caching ✓
Disclaimer: Rates reflect US-East-1 (N. Virginia) on-demand pricing. Actual bills may vary by AWS region, EDP commitments, AWS Free Tier credits, or model version updates. Prompt caching discount depth varies by model (typically 75-90% off standard input rates). Always verify against the official AWS Bedrock pricing page before committing budget. All calculations run locally in your browser - no data is sent to any server.

Ce qui détermine le coût par appel sur Bedrock

Sur Bedrock, le coût ne vient pas d'un forfait mais du nombre de tokens d'entrée et de sortie par requête. Deux applications avec le même nombre d'appels peuvent avoir des factures très différentes.

Saisissez les tokens d'entrée et de sortie par requête, le volume de requêtes et le modèle choisi pour obtenir le coût réel par appel et la projection de dépenses.

  • Les tokens de sortie coûtent 3 à 10 fois plus cher que ceux d'entrée : la longueur des réponses est le levier le plus direct.
  • L'inférence par lots applique une remise fixe de 50 % quand la latence temps réel n'est pas nécessaire.
  • La mise en cache des prompts réduit de 75 à 90 % le coût du préfixe répété dans de longs contextes statiques.

Choisir le modèle et le mode de facturation

Le modèle le plus capable est rarement le plus rentable pour toutes les tâches. Classer les charges par complexité avant de choisir économise souvent plus que l'optimisation technique.

  • Nova Micro et Nova Lite couvrent bien les tâches générales texte à très faible coût.
  • Le débit provisionné est pertinent quand le trafic est élevé et régulier : jusqu'à 40-60 % moins cher.
  • Les engagements PTU portent sur 1 ou 6 mois : confirmez la stabilité de votre volume.

Utiliser la projection avec discernement

Les prévisions sont un outil de planification, pas une facture. Confrontez-les à votre facture réelle du premier mois et ajustez vos hypothèses de tokens et de volume.

  1. Mesurez les tokens d'entrée et de sortie réels d'une requête représentative.
  2. Saisissez le volume quotidien, mensuel ou annuel attendu.
  3. Sélectionnez le modèle et la région de référence pour obtenir le coût projeté.
  4. Appliquez les remises par lots ou de cache et comparez le scénario optimisé au scénario de base.

Foire aux questions

C'est un outil en ligne qui estime vos dépenses d'API Amazon Bedrock selon les tokens d'entrée et de sortie, le choix du modèle et le volume de requêtes. Il projette le coût par appel et le convertit en prévisions quotidiennes, mensuelles ou annuelles. Notre calculateur fonctionne entièrement dans votre navigateur : aucune donnée n'est envoyée ni stockée.

Le calculateur utilise les tarifs par tokens à la demande de la région us-east-1 (Virginie du Nord) issus de la page de tarification officielle AWS Bedrock. Les factures réelles peuvent différer légèrement selon les écarts de prix régionaux, les remises d'engagement EDP, les crédits promotionnels, les mises à jour de version de modèle ou les frais de transfert de données en inférence inter-régions.

La tarification à la demande facture par token consommé sans engagement préalable : idéal pour des charges variables et imprévisibles. Les unités de débit provisionné (PTU) réservent une capacité dédiée à un tarif horaire fixe, souvent 40-60 % moins cher pour un trafic élevé et régulier. Les engagements PTU exigent une durée de 1 ou 6 mois.

Elle traite les requêtes de façon asynchrone en arrière-plan et renvoie les résultats sous 24 heures. AWS applique une remise fixe de 50 % sur tous les coûts de tokens d'entrée et de sortie par rapport aux tarifs à la demande. Idéal pour le traitement de documents en masse, les évaluations nocturnes, la traduction de jeux de données et toute charge sans besoin de réponse en temps réel.

Elle stocke dans l'infrastructure AWS les contenus souvent réutilisés (longs prompts système, documents de référence pour le RAG, gros blocs d'instructions). Lors des appels suivants réutilisant le même préfixe mis en cache, cette partie est facturée 75 à 90 % moins cher que les tarifs standard d'entrée. Très efficace pour les architectures de chatbot ou d'agent à contexte système long et statique.

Les tokens de sortie sont générés séquentiellement et de façon autorégressive : chaque token nécessite une passe avant complète dans le modèle, ce qui est plus intensif en calcul que le traitement des tokens d'entrée. La plupart des modèles Bedrock facturent la sortie 3 à 10 fois le tarif d'entrée. Des réponses concises sont le moyen le plus direct de réduire le coût par appel.

Pour des charges uniquement textuelles et générales, Amazon Nova Micro et Nova Lite sont les modèles les plus économiques d'AWS Bedrock, avec Nova Micro à partir de 0,035 $ par million de tokens d'entrée. Pour des tâches plus exigeantes, Claude 3.5 Haiku ou Claude 3 Haiku offrent un excellent rapport qualité-prix. Utilisez le tableau comparatif de ce calculateur pour comparer les coûts projetés.

Oui. Le calculateur fonctionne entièrement côté client dans votre navigateur. Vos volumes de tokens, de requêtes, vos choix de modèles et toutes les projections de coûts sont calculés localement sur votre appareil et ne sont jamais transmis, stockés ou journalisés. Vos données de planification budgétaire restent totalement privées.