Calculadora de custos do AWS Bedrock
Estime os custos de inferência da API Amazon Bedrock nos modelos Anthropic Claude, Amazon Nova, Meta Llama, Mistral e Cohere. Calcule o gasto por requisição, aplique descontos de inferência em lote (50 % off) e de cache de prompts, compare os preços dos modelos lado a lado e projete o gasto diário, mensal ou anual — 100 % grátis e totalmente no seu navegador.
Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.
Prompt Token Counts
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0300
Input Token Cost
$0.0150
Output Token Cost
$0.0150
Model Comparison (Monthly Forecast)
| Model | Cost/Call | Monthly Total | Features |
|---|---|---|---|
Amazon Nova MicroBest Value Amazon · In: $0.035/M · Out: $0.140/M | $0.000315 | $9.45 | Std |
Amazon Nova LiteBest Value Amazon · In: $0.060/M · Out: $0.240/M | $0.000540 | $16.20 | Caching ✓ |
Mistral Small 3Best Value Mistral AI · In: $0.100/M · Out: $0.300/M | $0.000800 | $24.00 | Std |
Claude 3 HaikuBest Value Anthropic · In: $0.250/M · Out: $1.250/M | $0.002500 | $75.00 | Caching ✓ |
Cohere Command RBest Value Cohere · In: $0.500/M · Out: $1.500/M | $0.004000 | $120.00 | Std |
Meta Llama 3.3 70B InstructBest Value Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Meta Llama 3.1 70B Instruct Meta · In: $0.720/M · Out: $0.720/M | $0.004320 | $129.60 | Std |
Amazon Nova ProCapable Amazon · In: $0.800/M · Out: $3.200/M | $0.007200 | $216.00 | Caching ✓ |
Claude 3.5 HaikuBest Value Anthropic · In: $0.800/M · Out: $4.000/M | $0.008000 | $240.00 | Caching ✓ |
Mistral Large 2 (2411)Capable Mistral AI · In: $2.000/M · Out: $6.000/M | $0.0160 | $480.00 | Std |
Meta Llama 3.1 405B InstructCapable Meta · In: $2.650/M · Out: $3.500/M | $0.0168 | $502.50 | Std |
Cohere Command R+ Cohere · In: $2.500/M · Out: $10.000/M | $0.0225 | $675.00 | Std |
Claude Sonnet 4 (Latest)Capable Selected Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.7 SonnetCapable Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3.5 Sonnet v2 Anthropic · In: $3.000/M · Out: $15.000/M | $0.0300 | $900.00 | Caching ✓ |
Claude 3 OpusCapable Anthropic · In: $15.000/M · Out: $75.000/M | $0.1500 | $4,500.00 | Caching ✓ |
O que determina o custo por chamada no Bedrock
No Bedrock o custo não vem de uma tarifa fixa, mas da contagem de tokens de entrada e saída de cada requisição. Dois aplicativos com o mesmo número de chamadas podem ter faturas bem diferentes.
Informe tokens de entrada e saída por requisição, o volume de requisições e o modelo escolhido para ver o custo real por chamada e a projeção de gastos.
- Tokens de saída custam de 3 a 10 vezes mais que os de entrada: o tamanho das respostas é a alavanca mais direta.
- A inferência em lote aplica 50 % de desconto fixo quando latência em tempo real não é necessária.
- O cache de prompts reduz de 75 % a 90 % o custo do prefixo repetido em contextos estáticos longos.
Escolher modelo e modo de cobrança
O modelo mais capaz raramente é o mais econômico para todas as tarefas. Classificar as cargas por complexidade antes de escolher costuma economizar mais que qualquer otimização técnica.
- Nova Micro e Nova Lite cobrem bem tarefas gerais de texto a custo muito baixo.
- O throughput provisionado compensa quando o tráfego é alto e constante: pode ser 40-60 % mais barato.
- Compromissos de PTU exigem 1 ou 6 meses, então confirme a estabilidade do volume.
Usar a projeção com critério
As previsões são ferramenta de planejamento, não fatura. Compare-as com a fatura real do primeiro mês e ajuste as premissas de tokens e volume.
- Meça os tokens de entrada e saída reais de uma requisição representativa.
- Informe o volume diário, mensal ou anual esperado.
- Selecione modelo e região de referência para obter o custo projetado.
- Aplique descontos de lote ou cache e compare o cenário otimizado com o base.
Perguntas frequentes
É uma ferramenta online que estima seus gastos de API do Amazon Bedrock com base na contagem de tokens de entrada e saída, escolha de modelo e volume de requisições. Ela projeta o custo por chamada e escala para previsões diárias, mensais ou anuais. Nossa calculadora roda totalmente no seu navegador: nenhum dado é enviado ou armazenado.
A calculadora usa as tarifas por token sob demanda da região us-east-1 (Norte da Virgínia) da página oficial de preços do AWS Bedrock. Faturas reais podem diferir um pouco por variações regionais de preço, descontos de compromisso EDP, créditos promocionais, atualizações de versão de modelo ou taxas de transferência de dados na inferência entre regiões.
O preço sob demanda cobra por token consumido sem compromisso prévio — ideal para cargas variáveis e imprevisíveis. As unidades de throughput provisionado (PTU) reservam capacidade dedicada a uma tarifa horária fixa, normalmente 40-60 % mais baratas para tráfego alto e constante. Compromissos de PTU exigem prazo de 1 ou 6 meses.
Ela processa as requisições de forma assíncrona em segundo plano e devolve os resultados em até 24 horas. A AWS aplica desconto fixo de 50 % em todos os custos de tokens de entrada e saída em relação ao preço sob demanda. É ideal para processamento massivo de documentos, avaliações noturnas, tradução de conjuntos de dados e qualquer carga que não exija resposta em tempo real.
O cache de prompts armazena conteúdo reutilizado com frequência (prompts de sistema longos, documentos de referência para RAG, blocos grandes de instruções) na infraestrutura da AWS. Em chamadas seguintes que reutilizam o mesmo prefixo em cache, essa parte é cobrada de 75 % a 90 % menos que as tarifas padrão de entrada. É especialmente eficaz em arquiteturas de chatbot ou agente com contexto de sistema grande e estático.
Tokens de saída são gerados de forma sequencial e autorregressiva: cada token exige um passo completo à frente no modelo, o que é computacionalmente mais intenso que processar tokens de entrada. A maioria dos modelos do Bedrock cobra saída de 3 a 10 vezes o tarifário de entrada. Manter respostas concisas é o caminho mais direto para reduzir o custo por chamada.
Para cargas apenas de texto e de propósito geral, Amazon Nova Micro e Amazon Nova Lite são os modelos mais econômicos do AWS Bedrock, com o Nova Micro a partir de US$ 0,035 por milhão de tokens de entrada. Para tarefas que exigem mais capacidade, Claude 3.5 Haiku ou Claude 3 Haiku oferecem ótima relação qualidade-custo. Use a tabela comparativa desta calculadora para comparar custos projetados.
Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador. Contagem de tokens, volumes de requisições, seleção de modelos e todas as projeções de custo são calculados localmente no seu dispositivo e nunca transmitidos a servidor algum, nem armazenados ou registrados. Os dados do seu planejamento de orçamento permanecem totalmente privados.