Pular para o conteúdo
Aback Tools Logo

Calculadora de custos do AWS Bedrock

Estime os custos de inferência da API Amazon Bedrock nos modelos Anthropic Claude, Amazon Nova, Meta Llama, Mistral e Cohere. Calcule o gasto por requisição, aplique descontos de inferência em lote (50 % off) e de cache de prompts, compare os preços dos modelos lado a lado e projete o gasto diário, mensal ou anual — 100 % grátis e totalmente no seu navegador.

AWS Bedrock Cost Calculator

Estimate on-demand inference costs across Anthropic Claude, Amazon Nova, Meta Llama, Mistral, and Cohere models. Configure prompt caching, Batch API discounts, and forecast daily, monthly, or yearly API spend - entirely in your browser.

Provider: AnthropicInput/1M: $3.000Output/1M: $15.000Cache/1M: $0.300Context: 1,000,000 tokens

Prompt Token Counts

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$900.00for 30,000 total requests

Cost per Single Call

$0.0300

Input Token Cost

$0.0150

Output Token Cost

$0.0150

Model Comparison (Monthly Forecast)

ModelCost/CallMonthly TotalFeatures
Amazon Nova MicroBest Value
Amazon · In: $0.035/M · Out: $0.140/M
$0.000315$9.45Std
Amazon Nova LiteBest Value
Amazon · In: $0.060/M · Out: $0.240/M
$0.000540$16.20Caching ✓
Mistral Small 3Best Value
Mistral AI · In: $0.100/M · Out: $0.300/M
$0.000800$24.00Std
Claude 3 HaikuBest Value
Anthropic · In: $0.250/M · Out: $1.250/M
$0.002500$75.00Caching ✓
Cohere Command RBest Value
Cohere · In: $0.500/M · Out: $1.500/M
$0.004000$120.00Std
Meta Llama 3.3 70B InstructBest Value
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Meta Llama 3.1 70B Instruct
Meta · In: $0.720/M · Out: $0.720/M
$0.004320$129.60Std
Amazon Nova ProCapable
Amazon · In: $0.800/M · Out: $3.200/M
$0.007200$216.00Caching ✓
Claude 3.5 HaikuBest Value
Anthropic · In: $0.800/M · Out: $4.000/M
$0.008000$240.00Caching ✓
Mistral Large 2 (2411)Capable
Mistral AI · In: $2.000/M · Out: $6.000/M
$0.0160$480.00Std
Meta Llama 3.1 405B InstructCapable
Meta · In: $2.650/M · Out: $3.500/M
$0.0168$502.50Std
Cohere Command R+
Cohere · In: $2.500/M · Out: $10.000/M
$0.0225$675.00Std
Claude Sonnet 4 (Latest)Capable Selected
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.7 SonnetCapable
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3.5 Sonnet v2
Anthropic · In: $3.000/M · Out: $15.000/M
$0.0300$900.00Caching ✓
Claude 3 OpusCapable
Anthropic · In: $15.000/M · Out: $75.000/M
$0.1500$4,500.00Caching ✓
Disclaimer: Rates reflect US-East-1 (N. Virginia) on-demand pricing. Actual bills may vary by AWS region, EDP commitments, AWS Free Tier credits, or model version updates. Prompt caching discount depth varies by model (typically 75-90% off standard input rates). Always verify against the official AWS Bedrock pricing page before committing budget. All calculations run locally in your browser - no data is sent to any server.

O que determina o custo por chamada no Bedrock

No Bedrock o custo não vem de uma tarifa fixa, mas da contagem de tokens de entrada e saída de cada requisição. Dois aplicativos com o mesmo número de chamadas podem ter faturas bem diferentes.

Informe tokens de entrada e saída por requisição, o volume de requisições e o modelo escolhido para ver o custo real por chamada e a projeção de gastos.

  • Tokens de saída custam de 3 a 10 vezes mais que os de entrada: o tamanho das respostas é a alavanca mais direta.
  • A inferência em lote aplica 50 % de desconto fixo quando latência em tempo real não é necessária.
  • O cache de prompts reduz de 75 % a 90 % o custo do prefixo repetido em contextos estáticos longos.

Escolher modelo e modo de cobrança

O modelo mais capaz raramente é o mais econômico para todas as tarefas. Classificar as cargas por complexidade antes de escolher costuma economizar mais que qualquer otimização técnica.

  • Nova Micro e Nova Lite cobrem bem tarefas gerais de texto a custo muito baixo.
  • O throughput provisionado compensa quando o tráfego é alto e constante: pode ser 40-60 % mais barato.
  • Compromissos de PTU exigem 1 ou 6 meses, então confirme a estabilidade do volume.

Usar a projeção com critério

As previsões são ferramenta de planejamento, não fatura. Compare-as com a fatura real do primeiro mês e ajuste as premissas de tokens e volume.

  1. Meça os tokens de entrada e saída reais de uma requisição representativa.
  2. Informe o volume diário, mensal ou anual esperado.
  3. Selecione modelo e região de referência para obter o custo projetado.
  4. Aplique descontos de lote ou cache e compare o cenário otimizado com o base.

Perguntas frequentes

É uma ferramenta online que estima seus gastos de API do Amazon Bedrock com base na contagem de tokens de entrada e saída, escolha de modelo e volume de requisições. Ela projeta o custo por chamada e escala para previsões diárias, mensais ou anuais. Nossa calculadora roda totalmente no seu navegador: nenhum dado é enviado ou armazenado.

A calculadora usa as tarifas por token sob demanda da região us-east-1 (Norte da Virgínia) da página oficial de preços do AWS Bedrock. Faturas reais podem diferir um pouco por variações regionais de preço, descontos de compromisso EDP, créditos promocionais, atualizações de versão de modelo ou taxas de transferência de dados na inferência entre regiões.

O preço sob demanda cobra por token consumido sem compromisso prévio — ideal para cargas variáveis e imprevisíveis. As unidades de throughput provisionado (PTU) reservam capacidade dedicada a uma tarifa horária fixa, normalmente 40-60 % mais baratas para tráfego alto e constante. Compromissos de PTU exigem prazo de 1 ou 6 meses.

Ela processa as requisições de forma assíncrona em segundo plano e devolve os resultados em até 24 horas. A AWS aplica desconto fixo de 50 % em todos os custos de tokens de entrada e saída em relação ao preço sob demanda. É ideal para processamento massivo de documentos, avaliações noturnas, tradução de conjuntos de dados e qualquer carga que não exija resposta em tempo real.

O cache de prompts armazena conteúdo reutilizado com frequência (prompts de sistema longos, documentos de referência para RAG, blocos grandes de instruções) na infraestrutura da AWS. Em chamadas seguintes que reutilizam o mesmo prefixo em cache, essa parte é cobrada de 75 % a 90 % menos que as tarifas padrão de entrada. É especialmente eficaz em arquiteturas de chatbot ou agente com contexto de sistema grande e estático.

Tokens de saída são gerados de forma sequencial e autorregressiva: cada token exige um passo completo à frente no modelo, o que é computacionalmente mais intenso que processar tokens de entrada. A maioria dos modelos do Bedrock cobra saída de 3 a 10 vezes o tarifário de entrada. Manter respostas concisas é o caminho mais direto para reduzir o custo por chamada.

Para cargas apenas de texto e de propósito geral, Amazon Nova Micro e Amazon Nova Lite são os modelos mais econômicos do AWS Bedrock, com o Nova Micro a partir de US$ 0,035 por milhão de tokens de entrada. Para tarefas que exigem mais capacidade, Claude 3.5 Haiku ou Claude 3 Haiku oferecem ótima relação qualidade-custo. Use a tabela comparativa desta calculadora para comparar custos projetados.

Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador. Contagem de tokens, volumes de requisições, seleção de modelos e todas as projeções de custo são calculados localmente no seu dispositivo e nunca transmitidos a servidor algum, nem armazenados ou registrados. Os dados do seu planejamento de orçamento permanecem totalmente privados.