Calculadora de costes de AWS Bedrock
Estima los costes de inferencia de la API de Amazon Bedrock con los modelos Anthropic Claude, Amazon Nova, Meta Llama, Mistral y Cohere. Calcula el gasto por petición, aplica los descuentos de inferencia por lotes (50 % menos) y de caché de prompts, compara los precios de los modelos en paralelo y proyecta el gasto diario, mensual o anual — 100 % gratis y totalmente en tu navegador.
Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.
Prompt Token Counts
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0300
Input Token Cost
$0.0150
Output Token Cost
$0.0150
Model Comparison (Monthly Forecast)
| Model | Cost/Call | Monthly Total | Features |
|---|---|---|---|
Amazon Nova MicroBest Value Amazon · In: $0.035/M · Out: $0.140/M | $0.000315 | $9.45 | Std |
Amazon Nova LiteBest Value Amazon · In: $0.060/M · Out: $0.240/M | $0.000540 | $16.20 | Caching ✓ |
Mistral Small 3Best Value Mistral AI · In: $0.100/M · Out: $0.300/M | $0.000800 | $24.00 | Std |
Claude 3 HaikuBest Value Anthropic · In: $0.250/M · Out: $1.250/M | $0.002500 | $75.00 | Caching ✓ |
Cohere Command RBest Value Cohere · In: $0.500/M · Out: $1.500/M | $0.004000 | $120.00 | Std |
Meta Llama 3.3 70B InstructBest Value Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Meta Llama 3.1 70B Instruct Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Amazon Nova ProCapable Amazon · In: $0.800/M · Out: $3.200/M | $0.007200 | $216.00 | Caching ✓ |
Claude 3.5 HaikuBest Value Anthropic · In: $0.800/M · Out: $4.000/M | $0.008000 | $240.00 | Caching ✓ |
Mistral Large 2 (2411)Capable Mistral AI · In: $2.000/M · Out: $6.000/M | $0.0160 | $480.00 | Std |
Meta Llama 3.1 405B InstructCapable Meta · In: $2.650/M · Out: $3.500/M | $0.0168 | $502.50 | Std |
Cohere Command R+ Cohere · In: $2.500/M · Out: $10.000/M | $0.0225 | $675.00 | Std |
Claude Sonnet 4 (Latest)Capable Selected Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.7 SonnetCapable Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.5 Sonnet v2 Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3 OpusCapable Anthropic · In: $15.000/M · Out: $75.000/M | $0.1500 | $4,500.00 | Caching ✓ |
Qué determina el coste por llamada en Bedrock
En Bedrock el coste no depende de una tarifa plana, sino del número de tokens de entrada y salida de cada petición. Dos aplicaciones con el mismo número de llamadas pueden tener facturas muy distintas.
Introduce tokens de entrada y salida por petición, el volumen de peticiones y el modelo elegido para ver el coste real por llamada y la proyección de gasto.
- Los tokens de salida cuestan entre 3 y 10 veces más que los de entrada: la longitud de las respuestas es la palanca más directa.
- La inferencia por lotes aplica un 50 % de descuento fijo cuando la latencia en tiempo real no es necesaria.
- La caché de prompts reduce entre un 75 % y un 90 % el coste del prefijo repetido en contextos estáticos largos.
Elegir modelo y modalidad de cobro
El modelo más capaz rara vez es el más rentable para todas las tareas. Clasificar las cargas por complejidad antes de elegir suele ahorrar más que cualquier optimización técnica.
- Nova Micro y Nova Lite cubren bien tareas generales de solo texto a coste muy bajo.
- El throughput aprovisionado conviene cuando el tráfico es alto y constante: puede ser un 40-60 % más barato.
- Los compromisos de PTU exigen plazos de 1 o 6 meses, así que confirma la estabilidad del volumen.
Cómo usar la proyección con criterio
Las previsiones son una herramienta de planificación, no una factura. Contrástalas con tu factura real del primer mes y ajusta los supuestos de tokens y volumen.
- Mide los tokens de entrada y salida reales de una petición representativa.
- Introduce el volumen diario, mensual o anual que esperas procesar.
- Selecciona modelo y región de referencia para obtener el coste proyectado.
- Aplica descuentos por lotes o caché y compara el escenario optimizado con el base.
Preguntas frecuentes
Es una herramienta online que estima tus gastos de API de Amazon Bedrock a partir del número de tokens de entrada y salida, la elección de modelo y el volumen de peticiones. Proyecta el coste por llamada y lo escala a previsiones diarias, mensuales o anuales. Nuestra calculadora funciona totalmente en tu navegador: no se sube ni se almacena ningún dato.
La calculadora usa las tarifas por tokens bajo demanda de la región estándar us-east-1 (Norte de Virginia) de la página oficial de precios de AWS Bedrock. Las facturas reales pueden diferir ligeramente por variaciones de precio entre regiones, descuentos por compromiso EDP, créditos promocionales, actualizaciones de versión de modelo o gastos de transferencia de datos por inferencia entre regiones.
El precio bajo demanda cobra por token consumido sin compromiso previo: ideal para cargas variables e impredecibles. Las unidades de throughput aprovisionado (PTU) reservan capacidad dedicada del modelo con una tarifa horaria fija, normalmente un 40-60 % más baratas para tráfico alto y constante. Los compromisos de PTU exigen plazos de 1 o 6 meses.
Procesa las peticiones de forma asíncrona en segundo plano y devuelve los resultados en un plazo de 24 horas. AWS aplica un descuento fijo del 50 % sobre todos los costes de tokens de entrada y salida respecto a las tarifas bajo demanda. Es ideal para procesamiento masivo de documentos, evaluaciones nocturnas, traducción de conjuntos de datos y cualquier carga que no requiera respuestas en tiempo real.
La caché de prompts almacena contenido reutilizado con frecuencia (prompts de sistema largos, documentos de referencia para RAG o bloques grandes de instrucciones) en la infraestructura de AWS. En llamadas posteriores que reutilizan el mismo prefijo en caché, esa parte se factura entre un 75 % y un 90 % menos que las tarifas estándar de tokens de entrada. Es especialmente potente en arquitecturas de chatbot o agente con contextos de sistema grandes y estáticos.
Los tokens de salida se generan de forma secuencial y autorregresiva: cada token requiere un paso completo hacia delante por el modelo. Eso es computacionalmente más intensivo que procesar tokens de entrada. La mayoría de los modelos de Bedrock cobran los tokens de salida entre 3 y 10 veces la tarifa de entrada. Mantener respuestas concisas es la forma más directa de bajar el coste por llamada.
Para cargas solo de texto y de propósito general, Amazon Nova Micro y Amazon Nova Lite son los modelos más económicos de AWS Bedrock, con Nova Micro desde 0,035 $ por millón de tokens de entrada. Para tareas que requieren más capacidad, Claude 3.5 Haiku o Claude 3 Haiku ofrecen una excelente relación calidad-precio. Usa la tabla comparativa de esta calculadora para contrastar los costes proyectados.
Sí. La calculadora funciona íntegramente en el lado del cliente, en tu navegador. El número de tokens, los volúmenes de peticiones, la selección de modelos y todas las proyecciones de coste se calculan localmente en tu dispositivo y nunca se transmiten a ningún servidor, ni se almacenan ni se registran. Los datos de tu planificación de presupuesto permanecen totalmente privados.