Calculateur de coûts AWS Bedrock
Estimez les coûts d'inférence de l'API Amazon Bedrock pour les modèles Anthropic Claude, Amazon Nova, Meta Llama, Mistral et Cohere. Calculez les dépenses par requête, appliquez les remises d'inférence par lots (50 % de réduction) et de mise en cache des prompts, comparez les tarifs des modèles côte à côte et projetez les dépenses quotidiennes, mensuelles ou annuelles – 100 % gratuit et entièrement dans votre navigateur.
Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.
Prompt Token Counts
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0300
Input Token Cost
$0.0150
Output Token Cost
$0.0150
Model Comparison (Monthly Forecast)
| Model | Cost/Call | Monthly Total | Features |
|---|---|---|---|
Amazon Nova MicroBest Value Amazon · In: $0.035/M · Out: $0.140/M | $0.000315 | $9.45 | Std |
Amazon Nova LiteBest Value Amazon · In: $0.060/M · Out: $0.240/M | $0.000540 | $16.20 | Caching ✓ |
Mistral Small 3Best Value Mistral AI · In: $0.100/M · Out: $0.300/M | $0.000800 | $24.00 | Std |
Claude 3 HaikuBest Value Anthropic · In: $0.250/M · Out: $1.250/M | $0.002500 | $75.00 | Caching ✓ |
Cohere Command RBest Value Cohere · In: $0.500/M · Out: $1.500/M | $0.004000 | $120.00 | Std |
Meta Llama 3.3 70B InstructBest Value Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Meta Llama 3.1 70B Instruct Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Amazon Nova ProCapable Amazon · In: $0.800/M · Out: $3.200/M | $0.007200 | $216.00 | Caching ✓ |
Claude 3.5 HaikuBest Value Anthropic · In: $0.800/M · Out: $4.000/M | $0.008000 | $240.00 | Caching ✓ |
Mistral Large 2 (2411)Capable Mistral AI · In: $2.000/M · Out: $6.000/M | $0.0160 | $480.00 | Std |
Meta Llama 3.1 405B InstructCapable Meta · In: $2.650/M · Out: $3.500/M | $0.0168 | $502.50 | Std |
Cohere Command R+ Cohere · In: $2.500/M · Out: $10.000/M | $0.0225 | $675.00 | Std |
Claude Sonnet 4 (Latest)Capable Selected Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.7 SonnetCapable Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.5 Sonnet v2 Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3 OpusCapable Anthropic · In: $15.000/M · Out: $75.000/M | $0.1500 | $4,500.00 | Caching ✓ |
Ce qui détermine le coût par appel sur Bedrock
Sur Bedrock, le coût ne vient pas d'un forfait mais du nombre de tokens d'entrée et de sortie par requête. Deux applications avec le même nombre d'appels peuvent avoir des factures très différentes.
Saisissez les tokens d'entrée et de sortie par requête, le volume de requêtes et le modèle choisi pour obtenir le coût réel par appel et la projection de dépenses.
- Les tokens de sortie coûtent 3 à 10 fois plus cher que ceux d'entrée : la longueur des réponses est le levier le plus direct.
- L'inférence par lots applique une remise fixe de 50 % quand la latence temps réel n'est pas nécessaire.
- La mise en cache des prompts réduit de 75 à 90 % le coût du préfixe répété dans de longs contextes statiques.
Choisir le modèle et le mode de facturation
Le modèle le plus capable est rarement le plus rentable pour toutes les tâches. Classer les charges par complexité avant de choisir économise souvent plus que l'optimisation technique.
- Nova Micro et Nova Lite couvrent bien les tâches générales texte à très faible coût.
- Le débit provisionné est pertinent quand le trafic est élevé et régulier : jusqu'à 40-60 % moins cher.
- Les engagements PTU portent sur 1 ou 6 mois : confirmez la stabilité de votre volume.
Utiliser la projection avec discernement
Les prévisions sont un outil de planification, pas une facture. Confrontez-les à votre facture réelle du premier mois et ajustez vos hypothèses de tokens et de volume.
- Mesurez les tokens d'entrée et de sortie réels d'une requête représentative.
- Saisissez le volume quotidien, mensuel ou annuel attendu.
- Sélectionnez le modèle et la région de référence pour obtenir le coût projeté.
- Appliquez les remises par lots ou de cache et comparez le scénario optimisé au scénario de base.
Foire aux questions
C'est un outil en ligne qui estime vos dépenses d'API Amazon Bedrock selon les tokens d'entrée et de sortie, le choix du modèle et le volume de requêtes. Il projette le coût par appel et le convertit en prévisions quotidiennes, mensuelles ou annuelles. Notre calculateur fonctionne entièrement dans votre navigateur : aucune donnée n'est envoyée ni stockée.
Le calculateur utilise les tarifs par tokens à la demande de la région us-east-1 (Virginie du Nord) issus de la page de tarification officielle AWS Bedrock. Les factures réelles peuvent différer légèrement selon les écarts de prix régionaux, les remises d'engagement EDP, les crédits promotionnels, les mises à jour de version de modèle ou les frais de transfert de données en inférence inter-régions.
La tarification à la demande facture par token consommé sans engagement préalable : idéal pour des charges variables et imprévisibles. Les unités de débit provisionné (PTU) réservent une capacité dédiée à un tarif horaire fixe, souvent 40-60 % moins cher pour un trafic élevé et régulier. Les engagements PTU exigent une durée de 1 ou 6 mois.
Elle traite les requêtes de façon asynchrone en arrière-plan et renvoie les résultats sous 24 heures. AWS applique une remise fixe de 50 % sur tous les coûts de tokens d'entrée et de sortie par rapport aux tarifs à la demande. Idéal pour le traitement de documents en masse, les évaluations nocturnes, la traduction de jeux de données et toute charge sans besoin de réponse en temps réel.
Elle stocke dans l'infrastructure AWS les contenus souvent réutilisés (longs prompts système, documents de référence pour le RAG, gros blocs d'instructions). Lors des appels suivants réutilisant le même préfixe mis en cache, cette partie est facturée 75 à 90 % moins cher que les tarifs standard d'entrée. Très efficace pour les architectures de chatbot ou d'agent à contexte système long et statique.
Les tokens de sortie sont générés séquentiellement et de façon autorégressive : chaque token nécessite une passe avant complète dans le modèle, ce qui est plus intensif en calcul que le traitement des tokens d'entrée. La plupart des modèles Bedrock facturent la sortie 3 à 10 fois le tarif d'entrée. Des réponses concises sont le moyen le plus direct de réduire le coût par appel.
Pour des charges uniquement textuelles et générales, Amazon Nova Micro et Nova Lite sont les modèles les plus économiques d'AWS Bedrock, avec Nova Micro à partir de 0,035 $ par million de tokens d'entrée. Pour des tâches plus exigeantes, Claude 3.5 Haiku ou Claude 3 Haiku offrent un excellent rapport qualité-prix. Utilisez le tableau comparatif de ce calculateur pour comparer les coûts projetés.
Oui. Le calculateur fonctionne entièrement côté client dans votre navigateur. Vos volumes de tokens, de requêtes, vos choix de modèles et toutes les projections de coûts sont calculés localement sur votre appareil et ne sont jamais transmis, stockés ou journalisés. Vos données de planification budgétaire restent totalement privées.