Pular para o conteúdo
Aback Tools Logo

Calculadora de custos de inferência

Estime grátis e online os gastos de inferência de LLM a partir de requisições, latência e volumes de tokens. Modele descontos de cache de prompts, economia da Batch API, sobrecarga de tentativas e capacidade de throughput concorrente; depois compare custos e latência entre 14 modelos. Roda 100 % no seu navegador.

Inference Cost Calculator

Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.

Real-time user-facing chat with sub-2s latency SLA

In/1M: $0.15Out/1M: $0.60TTFT: 250msSpeed: 100 tok/s

Token Sizes per Request

tokens
tokens
Total/req: 1,150 tokensIn cost: $0.000120Out cost: $0.000210

Request Volume & Latency

req/day
concurrent
ms

Cost Optimizations

%
%
%
⚠️ SLA Risk: Estimated P95 latency for GPT-4o mini is 3.8s - exceeds your 1.5s target. Consider a faster model or reduce output tokens.

Projected Monthly Inference Cost

$201.96for 612,000 requests

Cost / Request

$0.000330

Cost / 1K Req

$0.3300

Est. Latency

3.8s

Max RPS

13.3

Per-Request Cost Breakdown

Input (standard): $0.000120Input (cached): $0.00Output: $0.000210Retry overhead: $0.00000660

Model Cost & Latency Comparison

Sorted by lowest monthly cost
Model$/reqMonthly CostLatencySLA
Llama 3.1 8BBudget
Groq/Together · 600 tok/s · TTFT 80ms
$0.00006800$41.62663ms✓ Met
Mistral Small 3.2Budget
Mistral · 160 tok/s · TTFT 160ms
$0.000185$113.222.3s✗ Breach
GPT-4o miniBudget Selected
OpenAI · 100 tok/s · TTFT 250ms
$0.000330$201.963.8s✗ Breach
DeepSeek-V3Budget
DeepSeek · 90 tok/s · TTFT 300ms
$0.000601$367.814.2s✗ Breach
Llama 3.3 70BBudget
Groq/Togther · 250 tok/s · TTFT 120ms
$0.000749$458.081.5s✗ Breach
Gemini 2.5 FlashBudget
Google · 150 tok/s · TTFT 180ms
$0.001115$682.382.5s✗ Breach
Grok 4.3
xAI · 80 tok/s · TTFT 350ms
$0.001875$1,147.504.7s✗ Breach
Claude 3.5 HaikuBudget
Anthropic · 130 tok/s · TTFT 200ms
$0.002040$1,248.482.9s✗ Breach
o4-mini
OpenAI · 50 tok/s · TTFT 600ms
$0.002420$1,481.047.6s✗ Breach
Mistral Large 3
Mistral · 70 tok/s · TTFT 380ms
$0.003700$2,264.405.4s✗ Breach
o3Capable
OpenAI · 45 tok/s · TTFT 700ms
$0.004400$2,692.808.5s✗ Breach
Gemini 2.5 Pro
Google · 65 tok/s · TTFT 450ms
$0.004500$2,754.005.8s✗ Breach
GPT-4oCapable
OpenAI · 60 tok/s · TTFT 400ms
$0.005500$3,366.006.2s✗ Breach
Claude Sonnet 4.6Capable
Anthropic · 55 tok/s · TTFT 500ms
$0.007650$4,681.806.9s✗ Breach
Disclaimer:Pricing uses standard Pay-As-You-Go rates. Latency estimates are indicative medians - actual TTFT and throughput vary by region, load, and request size. Batch API discounts are typically ~50% but differ by provider. Always verify rates on each provider's official pricing page. All calculations run locally in your browser; no data is sent to any server.

O que compõe o custo de inferência

O custo de inferência depende do número de requisições, do tamanho de entrada e saída de cada uma e do modelo escolhido. A combinação desses três fatores muda totalmente o resultado.

Como tokens de saída custam mais que os de entrada, uma resposta longa com prompt curto pode custar mais do que o contrário.

  • Requisições diárias × custo por requisição = gasto base diário.
  • Tokens de saída mais caros: monitore o tamanho das respostas.
  • A latência-alvo influencia o modelo que você pode pagar.

Descontos de cache e de lote

O cache de prompts e a Batch API são as duas principais alavancas para reduzir a fatura sem perder qualidade. Cada uma se encaixa em padrões de tráfego diferentes.

  • Cache de prompts: útil com system prompt ou contexto grande e repetido.
  • Batch API: cerca de 50 % de desconto para trabalhos assíncronos.
  • Tentativas: somam proporcionalmente ao volume e ao custo total.

Verificar o SLA de latência

Custo baixo não adianta se a experiência piora. A latência estimada vem do TTFT mais o tempo de geração dos tokens de saída.

  1. Defina o TTFT e a velocidade de geração do modelo avaliado.
  2. Calcule a latência ponta a ponta com o tamanho típico de saída.
  3. Compare o resultado com sua meta de SLA.
  4. Se falhar, mude para um modelo mais rápido ou reduza o tamanho da saída.

Perguntas frequentes

Ela estima quanto você paga para executar requisições de LLM ao vivo em uma determinada escala. Usa sua contagem de tokens de entrada e saída, o volume diário de requisições e o modelo escolhido para projetar o custo por requisição e o total diário, mensal ou anual. Nossa ferramenta também modela conformidade com o SLA de latência, capacidade de throughput, cache de prompts, descontos da Batch API e sobrecarga de tentativas — tudo localmente no navegador e sem cadastro.

O custo de treinamento é uma despesa única para construir ou ajustar um modelo usando computação de GPU. O custo de inferência é a despesa recorrente por requisição que você paga cada vez que um usuário ou pipeline envia um prompt e recebe uma resposta. Na maioria das aplicações em produção, a inferência domina o gasto contínuo de IA — ela escala diretamente com sua base de usuários e o volume de requisições.

Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador, em JavaScript. Tamanhos de tokens, volumes de requisições, metas de latência e projeções de custo são processados localmente no seu dispositivo e nunca transmitidos a servidor algum nem armazenados. Seus dados permanecem 100 % privados durante toda a sessão.

A latência ponta a ponta é estimada como: tempo até o primeiro token (TTFT) + (tokens de saída ÷ velocidade de geração em tokens/s). Por exemplo, um modelo com 300 ms de TTFT gerando 500 tokens a 100 tokens/s tem latência estimada de 300 ms + 5.000 ms = 5,3 segundos. Os valores de TTFT e velocidade são medianas representativas; os reais variam por região do provedor, carga do servidor e tamanho da requisição.

O TTFT é o tempo entre enviar uma requisição e receber o primeiro token da resposta. Ele determina a rapidez com que sua aplicação pode começar a exibir a saída ao usuário. TTFT baixo (abaixo de 200 ms) é crítico para aplicações de chat interativas. Modelos menores e mais quantizados costumam ter TTFT menor que grandes modelos de fronteira.

O cache de prompts armazena o estado de atenção KV de um prefixo de prompt repetido, de modo que requisições seguintes com o mesmo prefixo são cobradas a cerca de 25 % da tarifa de entrada padrão. Isso é muito eficaz quando seu prompt de sistema ou contexto de documento é grande e compartilhado entre muitas requisições.

Use a Batch API para cargas insensíveis à latência: sumarização massiva de documentos, enriquecimento de dados offline, classificação em larga escala, geração noturna de relatórios. A Batch API cobra cerca de 50 % da tarifa padrão em tempo real. A inferência em tempo real é necessária para qualquer recurso interativo voltado ao usuário.

Uma taxa de 2-5 % é típica em cargas de API de LLM em produção, considerando erros de limite de taxa, timeouts transitórios e erros 5xx do provedor. Aplicações de alto throughput que chamam com frequência perto dos limites podem ver taxas de 5-15 %. A taxa de tentativas soma-se proporcionalmente ao total de requisições e ao custo.