Pular para o conteúdo
Aback Tools Logo

Calculadora de custo de prompt

Estime grátis e online o custo de rodar prompts em escala. Defina seu prompt de sistema, mensagem do usuário e tamanhos de tokens de saída, e ajuste seu volume diário de requisições para ver os custos de API projetados em períodos diários, mensais e anuais. Compare custos entre 13 grandes provedores de LLM na hora. Rápido, privado e 100 % no navegador.

Prompt Cost Calculator

Estimate the cost of running prompts at scale. Define your system prompt, user message, and output size - then set your request volume to see daily, monthly, and yearly API cost projections across all major models.

Support chatbot with system prompt + short user messages

Prompt Composition (per request)

tokens
tokens
tokens

Token Breakdown per Request

System: 800User: 150Output: 300Total: 1,250

Scale & Model

Input/1M: $0.15Output/1M: $0.60
req/day
% / mo

Projected Monthly Cost - GPT-4o mini

$48.38for 150,000 requests

Cost / Request

$0.000322

Cost / Day

$1.61

Input Token Cost

$21.38

Output Token Cost

$27.00

Cheapest option: Mistral Small (Mistral) would cost $27.75 monthly - saving $20.63 vs your selection.

Cost at Scale - All Periods

PeriodTotal RequestsInput CostOutput CostTotal Cost
Daily5,000$0.7125$0.9000$1.61
MonthlySelected150,000$21.38$27.00$48.38
Yearly1,825,000$260.06$328.50$588.56

Cross-Model Price Comparison

Sorted by lowest monthly cost
ModelIn/1MOut/1MCost/ReqMonthly Total
Mistral Small(Mistral)Budget
$0.10$0.30$0.000185$27.75
GPT-4o mini(OpenAI)Budget Active
$0.15$0.60$0.000322$48.37
DeepSeek-V3(DeepSeek)Budget
$0.27$1.10$0.000586$87.98
Gemini 2.5 Flash(Google)Budget
$0.30$2.50$0.001035$155.25
Grok 4.3(xAI)
$1.25$2.50$0.001937$290.63
Claude 3.5 Haiku(Anthropic)Budget
$0.80$4.00$0.001960$294.00
o4-mini(OpenAI)Budget
$1.10$4.40$0.002365$354.75
Mistral Large(Mistral)
$2.00$6.00$0.003700$555.00
Gemini 2.5 Pro(Google)
$1.25$10.00$0.004187$628.12
o3(OpenAI)
$2.00$8.00$0.004300$645.00
GPT-4o(OpenAI)
$2.50$10.00$0.005375$806.25
Claude Sonnet 4.6(Anthropic)Powerful
$3.00$15.00$0.007350$1,102.50
Claude 3 Opus(Anthropic)Powerful
$15.00$75.00$0.0367$5,512.50

Click any row to select that model.

Disclaimer: Estimates use standard Pay-As-You-Go rates. Token counts are approximations - actual tokenization varies by model and content. Prompt caching, batch discounts, and volume pricing are not included unless your provider plan applies them automatically. Always verify current rates with each provider before budgeting.

Por que o prompt de sistema domina a fatura

O prompt de sistema é enviado completo em cada requisição. Seu custo não depende de quão útil ele é, mas do número de requisições que você faz.

Em volumes altos, cortar algumas centenas de tokens do prompt de sistema gera economia mensal significativa.

  • Custo do prompt de sistema = tokens × requisições por dia × dias.
  • Tokens de saída custam 3-6× mais que os de entrada.
  • O cache de prompts reduz esse custo 75-90 % quando se aplica.

Separar mensagem do usuário e contexto

Separe o que é contexto fixo do que muda a cada requisição. Apenas a parte fixa é candidata ao cache.

  1. Meça separadamente os tokens do prompt de sistema e da mensagem do usuário.
  2. Some os tokens de entrada previstos por requisição.
  3. Adicione os tokens de saída esperados por resposta.
  4. Multiplique pelo volume de requisições para ver o total do período.

Escolher modelo e projetar crescimento

Compare o custo total da sua configuração exata entre modelos antes de se comprometer. O modelo mais barato que atende seus requisitos de qualidade quase sempre é a melhor escolha.

  • Comece pelo modelo mais econômico e suba só se a qualidade não bastar.
  • Modele o crescimento mensal para não subestimar o orçamento.
  • Reserve modelos de fronteira para raciocínio complexo.

Perguntas frequentes

Ela estima a despesa de API de rodar uma configuração de prompt específica - incluindo prompt de sistema, mensagem do usuário e saída esperada - para um volume de requisições e período determinados. Ajuda desenvolvedores e equipes de produto a conhecer seus custos de API de LLM antes de lançar, planejar níveis de preço de SaaS de IA e comparar qual modelo entrega a melhor relação custo-qualidade.

Regra aproximada: 1 token ≈ 4 caracteres, ou cerca de 0,75 palavra em inglês. Um prompt de sistema de 500 palavras tem cerca de 650-700 tokens. Uma mensagem curta de 50 palavras fica em torno de 65-70 tokens. Para contagens precisas, use um tokenizador: o Tiktoken da OpenAI e o tokenizador Claude da Anthropic estão disponíveis como open source. Nossa ferramenta Token Counter também estima tokens a partir de texto colado.

O prompt de sistema é cobrado integralmente em cada requisição à API. Se ele tem 1.000 tokens e você faz 10.000 requisições por dia, isso são 10 milhões de tokens de entrada só do prompt de sistema, todo dia. Por isso prompts de sistema longos e verbosos inflam muito o custo. Enxugar o prompt de sistema e ativar o cache de prompts são as duas otimizações com melhor retorno na maioria das aplicações LLM em produção.

Não - a calculadora usa tarifas padrão de pague pelo uso, sem cache. Isso dá intencionalmente o custo base do pior caso. Na prática, provedores como OpenAI, Anthropic, Google e xAI oferecem cache de prompts que reduz o custo dos tokens de entrada em 75-90 % para conteúdo estático repetido como prompts de sistema. Use esta ferramenta para definir sua base e depois modele a economia do cache separadamente.

Use a tabela de comparação entre modelos: ela mostra o custo total para sua configuração exata em todos os modelos compatíveis. Comece pelo modelo mais barato que atenda seu padrão de qualidade. Tarefas como classificação, extração e saída estruturada costumam funcionar muito bem em modelos menores (GPT-4o mini, Claude 3.5 Haiku, Gemini Flash, Mistral Small). Reserve modelos de fronteira caros para tarefas que realmente exigem raciocínio profundo.

O campo de crescimento mensal modela o aumento do volume de requisições ao longo do período de previsão. Se você informar 20 %, a calculadora assume que seu número de requisições diárias cresce 20 % por mês. Para uma previsão anual, ela usa interpolação linear entre o volume inicial e o volume final projetado. Coloque 0 para projeções constantes.

Gerar tokens exige que o modelo faça uma passagem forward autorregressiva completa por token - muito mais computação do que ler tokens de entrada. A geração de saída é computacionalmente mais cara e é cobrada com um prêmio de 3-6× sobre os tokens de entrada na maioria dos provedores. Por isso aplicações com respostas longas têm perfil de custo diferente de classificadores de saída curta.

Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador. Nenhuma contagem de tokens, configuração de prompt, estimativa de custo ou seleção de modelo é enviada a servidor algum. Tudo é calculado localmente no seu dispositivo e nunca armazenado. Seus dados de planejamento são 100 % privados e seguros.