Calculadora de custos de inferência
Estime grátis e online os gastos de inferência de LLM a partir de requisições, latência e volumes de tokens. Modele descontos de cache de prompts, economia da Batch API, sobrecarga de tentativas e capacidade de throughput concorrente; depois compare custos e latência entre 14 modelos. Roda 100 % no seu navegador.
Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.
Real-time user-facing chat with sub-2s latency SLA
Token Sizes per Request
Request Volume & Latency
Cost Optimizations
Projected Monthly Inference Cost
Cost / Request
$0.000330
Cost / 1K Req
$0.3300
Est. Latency
3.8s
Max RPS
13.3
Per-Request Cost Breakdown
Model Cost & Latency Comparison
Sorted by lowest monthly cost| Model | $/req | Monthly Cost | Latency | SLA |
|---|---|---|---|---|
Llama 3.1 8BBudget Groq/Together · 600 tok/s · TTFT 80ms | $0.00006800 | $41.62 | 663ms | ✓ Met |
Mistral Small 3.2Budget Mistral · 160 tok/s · TTFT 160ms | $0.000185 | $113.22 | 2.3s | ✗ Breach |
GPT-4o miniBudget Selected OpenAI · 100 tok/s · TTFT 250ms | $0.000330 | $201.96 | 3.8s | ✗ Breach |
DeepSeek-V3Budget DeepSeek · 90 tok/s · TTFT 300ms | $0.000601 | $367.81 | 4.2s | ✗ Breach |
Llama 3.3 70BBudget Groq/Togther · 250 tok/s · TTFT 120ms | $0.000749 | $458.08 | 1.5s | ✗ Breach |
Gemini 2.5 FlashBudget Google · 150 tok/s · TTFT 180ms | $0.001115 | $682.38 | 2.5s | ✗ Breach |
Grok 4.3 xAI · 80 tok/s · TTFT 350ms | $0.001875 | $1,147.50 | 4.7s | ✗ Breach |
Claude 3.5 HaikuBudget Anthropic · 130 tok/s · TTFT 200ms | $0.002040 | $1,248.48 | 2.9s | ✗ Breach |
o4-mini OpenAI · 50 tok/s · TTFT 600ms | $0.002420 | $1,481.04 | 7.6s | ✗ Breach |
Mistral Large 3 Mistral · 70 tok/s · TTFT 380ms | $0.003700 | $2,264.40 | 5.4s | ✗ Breach |
o3Capable OpenAI · 45 tok/s · TTFT 700ms | $0.004400 | $2,692.80 | 8.5s | ✗ Breach |
Gemini 2.5 Pro Google · 65 tok/s · TTFT 450ms | $0.004500 | $2,754.00 | 5.8s | ✗ Breach |
GPT-4oCapable OpenAI · 60 tok/s · TTFT 400ms | $0.005500 | $3,366.00 | 6.2s | ✗ Breach |
Claude Sonnet 4.6Capable Anthropic · 55 tok/s · TTFT 500ms | $0.007650 | $4,681.80 | 6.9s | ✗ Breach |
O que compõe o custo de inferência
O custo de inferência depende do número de requisições, do tamanho de entrada e saída de cada uma e do modelo escolhido. A combinação desses três fatores muda totalmente o resultado.
Como tokens de saída custam mais que os de entrada, uma resposta longa com prompt curto pode custar mais do que o contrário.
- Requisições diárias × custo por requisição = gasto base diário.
- Tokens de saída mais caros: monitore o tamanho das respostas.
- A latência-alvo influencia o modelo que você pode pagar.
Descontos de cache e de lote
O cache de prompts e a Batch API são as duas principais alavancas para reduzir a fatura sem perder qualidade. Cada uma se encaixa em padrões de tráfego diferentes.
- Cache de prompts: útil com system prompt ou contexto grande e repetido.
- Batch API: cerca de 50 % de desconto para trabalhos assíncronos.
- Tentativas: somam proporcionalmente ao volume e ao custo total.
Verificar o SLA de latência
Custo baixo não adianta se a experiência piora. A latência estimada vem do TTFT mais o tempo de geração dos tokens de saída.
- Defina o TTFT e a velocidade de geração do modelo avaliado.
- Calcule a latência ponta a ponta com o tamanho típico de saída.
- Compare o resultado com sua meta de SLA.
- Se falhar, mude para um modelo mais rápido ou reduza o tamanho da saída.
Perguntas frequentes
Ela estima quanto você paga para executar requisições de LLM ao vivo em uma determinada escala. Usa sua contagem de tokens de entrada e saída, o volume diário de requisições e o modelo escolhido para projetar o custo por requisição e o total diário, mensal ou anual. Nossa ferramenta também modela conformidade com o SLA de latência, capacidade de throughput, cache de prompts, descontos da Batch API e sobrecarga de tentativas — tudo localmente no navegador e sem cadastro.
O custo de treinamento é uma despesa única para construir ou ajustar um modelo usando computação de GPU. O custo de inferência é a despesa recorrente por requisição que você paga cada vez que um usuário ou pipeline envia um prompt e recebe uma resposta. Na maioria das aplicações em produção, a inferência domina o gasto contínuo de IA — ela escala diretamente com sua base de usuários e o volume de requisições.
Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador, em JavaScript. Tamanhos de tokens, volumes de requisições, metas de latência e projeções de custo são processados localmente no seu dispositivo e nunca transmitidos a servidor algum nem armazenados. Seus dados permanecem 100 % privados durante toda a sessão.
A latência ponta a ponta é estimada como: tempo até o primeiro token (TTFT) + (tokens de saída ÷ velocidade de geração em tokens/s). Por exemplo, um modelo com 300 ms de TTFT gerando 500 tokens a 100 tokens/s tem latência estimada de 300 ms + 5.000 ms = 5,3 segundos. Os valores de TTFT e velocidade são medianas representativas; os reais variam por região do provedor, carga do servidor e tamanho da requisição.
O TTFT é o tempo entre enviar uma requisição e receber o primeiro token da resposta. Ele determina a rapidez com que sua aplicação pode começar a exibir a saída ao usuário. TTFT baixo (abaixo de 200 ms) é crítico para aplicações de chat interativas. Modelos menores e mais quantizados costumam ter TTFT menor que grandes modelos de fronteira.
O cache de prompts armazena o estado de atenção KV de um prefixo de prompt repetido, de modo que requisições seguintes com o mesmo prefixo são cobradas a cerca de 25 % da tarifa de entrada padrão. Isso é muito eficaz quando seu prompt de sistema ou contexto de documento é grande e compartilhado entre muitas requisições.
Use a Batch API para cargas insensíveis à latência: sumarização massiva de documentos, enriquecimento de dados offline, classificação em larga escala, geração noturna de relatórios. A Batch API cobra cerca de 50 % da tarifa padrão em tempo real. A inferência em tempo real é necessária para qualquer recurso interativo voltado ao usuário.
Uma taxa de 2-5 % é típica em cargas de API de LLM em produção, considerando erros de limite de taxa, timeouts transitórios e erros 5xx do provedor. Aplicações de alto throughput que chamam com frequência perto dos limites podem ver taxas de 5-15 %. A taxa de tentativas soma-se proporcionalmente ao total de requisições e ao custo.