Saltar al contenido
Aback Tools Logo

Calculadora de costes de AWS Bedrock

Estima los costes de inferencia de la API de Amazon Bedrock con los modelos Anthropic Claude, Amazon Nova, Meta Llama, Mistral y Cohere. Calcula el gasto por petición, aplica los descuentos de inferencia por lotes (50 % menos) y de caché de prompts, compara los precios de los modelos en paralelo y proyecta el gasto diario, mensual o anual — 100 % gratis y totalmente en tu navegador.

AWS Bedrock Cost Calculator

Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.

Provider: AnthropicInput/1M: $3.000Output/1M: $15.000Cache/1M: $0.300Context: 1,000,000 tokens

Prompt Token Counts

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$900.00for 30,000 total requests

Cost per Single Call

$0.0300

Input Token Cost

$0.0150

Output Token Cost

$0.0150

Model Comparison (Monthly Forecast)

ModelCost/CallMonthly TotalFeatures
Amazon Nova MicroBest Value
Amazon · In: $0.035/M · Out: $0.140/M
$0.000315$9.45Std
Amazon Nova LiteBest Value
Amazon · In: $0.060/M · Out: $0.240/M
$0.000540$16.20Caching ✓
Mistral Small 3Best Value
Mistral AI · In: $0.100/M · Out: $0.300/M
$0.000800$24.00Std
Claude 3 HaikuBest Value
Anthropic · In: $0.250/M · Out: $1.250/M
$0.002500$75.00Caching ✓
Cohere Command RBest Value
Cohere · In: $0.500/M · Out: $1.500/M
$0.004000$120.00Std
Meta Llama 3.3 70B InstructBest Value
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Meta Llama 3.1 70B Instruct
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Amazon Nova ProCapable
Amazon · In: $0.800/M · Out: $3.200/M
$0.007200$216.00Caching ✓
Claude 3.5 HaikuBest Value
Anthropic · In: $0.800/M · Out: $4.000/M
$0.008000$240.00Caching ✓
Mistral Large 2 (2411)Capable
Mistral AI · In: $2.000/M · Out: $6.000/M
$0.0160$480.00Std
Meta Llama 3.1 405B InstructCapable
Meta · In: $2.650/M · Out: $3.500/M
$0.0168$502.50Std
Cohere Command R+
Cohere · In: $2.500/M · Out: $10.000/M
$0.0225$675.00Std
Claude Sonnet 4 (Latest)Capable Selected
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.7 SonnetCapable
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.5 Sonnet v2
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3 OpusCapable
Anthropic · In: $15.000/M · Out: $75.000/M
$0.1500$4,500.00Caching ✓
Disclaimer: Rates reflect US-East-1 (N. Virginia) on-demand pricing. Actual bills may vary by AWS region, EDP commitments, AWS Free Tier credits, or model version updates. Prompt caching discount depth varies by model (typically 75-90% off standard input rates). Always verify against the official AWS Bedrock pricing page before committing budget. All calculations run locally in your browser - no data is sent to any server.

Qué determina el coste por llamada en Bedrock

En Bedrock el coste no depende de una tarifa plana, sino del número de tokens de entrada y salida de cada petición. Dos aplicaciones con el mismo número de llamadas pueden tener facturas muy distintas.

Introduce tokens de entrada y salida por petición, el volumen de peticiones y el modelo elegido para ver el coste real por llamada y la proyección de gasto.

  • Los tokens de salida cuestan entre 3 y 10 veces más que los de entrada: la longitud de las respuestas es la palanca más directa.
  • La inferencia por lotes aplica un 50 % de descuento fijo cuando la latencia en tiempo real no es necesaria.
  • La caché de prompts reduce entre un 75 % y un 90 % el coste del prefijo repetido en contextos estáticos largos.

Elegir modelo y modalidad de cobro

El modelo más capaz rara vez es el más rentable para todas las tareas. Clasificar las cargas por complejidad antes de elegir suele ahorrar más que cualquier optimización técnica.

  • Nova Micro y Nova Lite cubren bien tareas generales de solo texto a coste muy bajo.
  • El throughput aprovisionado conviene cuando el tráfico es alto y constante: puede ser un 40-60 % más barato.
  • Los compromisos de PTU exigen plazos de 1 o 6 meses, así que confirma la estabilidad del volumen.

Cómo usar la proyección con criterio

Las previsiones son una herramienta de planificación, no una factura. Contrástalas con tu factura real del primer mes y ajusta los supuestos de tokens y volumen.

  1. Mide los tokens de entrada y salida reales de una petición representativa.
  2. Introduce el volumen diario, mensual o anual que esperas procesar.
  3. Selecciona modelo y región de referencia para obtener el coste proyectado.
  4. Aplica descuentos por lotes o caché y compara el escenario optimizado con el base.

Preguntas frecuentes

Es una herramienta online que estima tus gastos de API de Amazon Bedrock a partir del número de tokens de entrada y salida, la elección de modelo y el volumen de peticiones. Proyecta el coste por llamada y lo escala a previsiones diarias, mensuales o anuales. Nuestra calculadora funciona totalmente en tu navegador: no se sube ni se almacena ningún dato.

La calculadora usa las tarifas por tokens bajo demanda de la región estándar us-east-1 (Norte de Virginia) de la página oficial de precios de AWS Bedrock. Las facturas reales pueden diferir ligeramente por variaciones de precio entre regiones, descuentos por compromiso EDP, créditos promocionales, actualizaciones de versión de modelo o gastos de transferencia de datos por inferencia entre regiones.

El precio bajo demanda cobra por token consumido sin compromiso previo: ideal para cargas variables e impredecibles. Las unidades de throughput aprovisionado (PTU) reservan capacidad dedicada del modelo con una tarifa horaria fija, normalmente un 40-60 % más baratas para tráfico alto y constante. Los compromisos de PTU exigen plazos de 1 o 6 meses.

Procesa las peticiones de forma asíncrona en segundo plano y devuelve los resultados en un plazo de 24 horas. AWS aplica un descuento fijo del 50 % sobre todos los costes de tokens de entrada y salida respecto a las tarifas bajo demanda. Es ideal para procesamiento masivo de documentos, evaluaciones nocturnas, traducción de conjuntos de datos y cualquier carga que no requiera respuestas en tiempo real.

La caché de prompts almacena contenido reutilizado con frecuencia (prompts de sistema largos, documentos de referencia para RAG o bloques grandes de instrucciones) en la infraestructura de AWS. En llamadas posteriores que reutilizan el mismo prefijo en caché, esa parte se factura entre un 75 % y un 90 % menos que las tarifas estándar de tokens de entrada. Es especialmente potente en arquitecturas de chatbot o agente con contextos de sistema grandes y estáticos.

Los tokens de salida se generan de forma secuencial y autorregresiva: cada token requiere un paso completo hacia delante por el modelo. Eso es computacionalmente más intensivo que procesar tokens de entrada. La mayoría de los modelos de Bedrock cobran los tokens de salida entre 3 y 10 veces la tarifa de entrada. Mantener respuestas concisas es la forma más directa de bajar el coste por llamada.

Para cargas solo de texto y de propósito general, Amazon Nova Micro y Amazon Nova Lite son los modelos más económicos de AWS Bedrock, con Nova Micro desde 0,035 $ por millón de tokens de entrada. Para tareas que requieren más capacidad, Claude 3.5 Haiku o Claude 3 Haiku ofrecen una excelente relación calidad-precio. Usa la tabla comparativa de esta calculadora para contrastar los costes proyectados.

Sí. La calculadora funciona íntegramente en el lado del cliente, en tu navegador. El número de tokens, los volúmenes de peticiones, la selección de modelos y todas las proyecciones de coste se calculan localmente en tu dispositivo y nunca se transmiten a ningún servidor, ni se almacenan ni se registran. Los datos de tu planificación de presupuesto permanecen totalmente privados.