Calculadora de custo de prompt
Estime grátis e online o custo de rodar prompts em escala. Defina seu prompt de sistema, mensagem do usuário e tamanhos de tokens de saída, e ajuste seu volume diário de requisições para ver os custos de API projetados em períodos diários, mensais e anuais. Compare custos entre 13 grandes provedores de LLM na hora. Rápido, privado e 100 % no navegador.
Estimate the cost of running prompts at scale. Define your system prompt, user message, and output size - then set your request volume to see daily, monthly, and yearly API cost projections across all major models.
Support chatbot with system prompt + short user messages
Prompt Composition (per request)
Token Breakdown per Request
Scale & Model
Projected Monthly Cost - GPT-4o mini
Cost / Request
$0.000322
Cost / Day
$1.61
Input Token Cost
$21.38
Output Token Cost
$27.00
Cost at Scale - All Periods
| Period | Total Requests | Input Cost | Output Cost | Total Cost |
|---|---|---|---|---|
| Daily | 5,000 | $0.7125 | $0.9000 | $1.61 |
| MonthlySelected | 150,000 | $21.38 | $27.00 | $48.38 |
| Yearly | 1,825,000 | $260.06 | $328.50 | $588.56 |
Cross-Model Price Comparison
Sorted by lowest monthly cost| Model | In/1M | Out/1M | Cost/Req | Monthly Total |
|---|---|---|---|---|
Mistral Small(Mistral)Budget | $0.10 | $0.30 | $0.000185 | $27.75 |
GPT-4o mini(OpenAI)Budget Active | $0.15 | $0.60 | $0.000322 | $48.37 |
DeepSeek-V3(DeepSeek)Budget | $0.27 | $1.10 | $0.000586 | $87.98 |
Gemini 2.5 Flash(Google)Budget | $0.30 | $2.50 | $0.001035 | $155.25 |
Grok 4.3(xAI) | $1.25 | $2.50 | $0.001937 | $290.63 |
Claude 3.5 Haiku(Anthropic)Budget | $0.80 | $4.00 | $0.001960 | $294.00 |
o4-mini(OpenAI)Budget | $1.10 | $4.40 | $0.002365 | $354.75 |
Mistral Large(Mistral) | $2.00 | $6.00 | $0.003700 | $555.00 |
Gemini 2.5 Pro(Google) | $1.25 | $10.00 | $0.004187 | $628.12 |
o3(OpenAI) | $2.00 | $8.00 | $0.004300 | $645.00 |
GPT-4o(OpenAI) | $2.50 | $10.00 | $0.005375 | $806.25 |
Claude Sonnet 4.6(Anthropic)Powerful | $3.00 | $15.00 | $0.007350 | $1,102.50 |
Claude 3 Opus(Anthropic)Powerful | $15.00 | $75.00 | $0.0367 | $5,512.50 |
Click any row to select that model.
Por que o prompt de sistema domina a fatura
O prompt de sistema é enviado completo em cada requisição. Seu custo não depende de quão útil ele é, mas do número de requisições que você faz.
Em volumes altos, cortar algumas centenas de tokens do prompt de sistema gera economia mensal significativa.
- Custo do prompt de sistema = tokens × requisições por dia × dias.
- Tokens de saída custam 3-6× mais que os de entrada.
- O cache de prompts reduz esse custo 75-90 % quando se aplica.
Separar mensagem do usuário e contexto
Separe o que é contexto fixo do que muda a cada requisição. Apenas a parte fixa é candidata ao cache.
- Meça separadamente os tokens do prompt de sistema e da mensagem do usuário.
- Some os tokens de entrada previstos por requisição.
- Adicione os tokens de saída esperados por resposta.
- Multiplique pelo volume de requisições para ver o total do período.
Escolher modelo e projetar crescimento
Compare o custo total da sua configuração exata entre modelos antes de se comprometer. O modelo mais barato que atende seus requisitos de qualidade quase sempre é a melhor escolha.
- Comece pelo modelo mais econômico e suba só se a qualidade não bastar.
- Modele o crescimento mensal para não subestimar o orçamento.
- Reserve modelos de fronteira para raciocínio complexo.
Perguntas frequentes
Ela estima a despesa de API de rodar uma configuração de prompt específica - incluindo prompt de sistema, mensagem do usuário e saída esperada - para um volume de requisições e período determinados. Ajuda desenvolvedores e equipes de produto a conhecer seus custos de API de LLM antes de lançar, planejar níveis de preço de SaaS de IA e comparar qual modelo entrega a melhor relação custo-qualidade.
Regra aproximada: 1 token ≈ 4 caracteres, ou cerca de 0,75 palavra em inglês. Um prompt de sistema de 500 palavras tem cerca de 650-700 tokens. Uma mensagem curta de 50 palavras fica em torno de 65-70 tokens. Para contagens precisas, use um tokenizador: o Tiktoken da OpenAI e o tokenizador Claude da Anthropic estão disponíveis como open source. Nossa ferramenta Token Counter também estima tokens a partir de texto colado.
O prompt de sistema é cobrado integralmente em cada requisição à API. Se ele tem 1.000 tokens e você faz 10.000 requisições por dia, isso são 10 milhões de tokens de entrada só do prompt de sistema, todo dia. Por isso prompts de sistema longos e verbosos inflam muito o custo. Enxugar o prompt de sistema e ativar o cache de prompts são as duas otimizações com melhor retorno na maioria das aplicações LLM em produção.
Não - a calculadora usa tarifas padrão de pague pelo uso, sem cache. Isso dá intencionalmente o custo base do pior caso. Na prática, provedores como OpenAI, Anthropic, Google e xAI oferecem cache de prompts que reduz o custo dos tokens de entrada em 75-90 % para conteúdo estático repetido como prompts de sistema. Use esta ferramenta para definir sua base e depois modele a economia do cache separadamente.
Use a tabela de comparação entre modelos: ela mostra o custo total para sua configuração exata em todos os modelos compatíveis. Comece pelo modelo mais barato que atenda seu padrão de qualidade. Tarefas como classificação, extração e saída estruturada costumam funcionar muito bem em modelos menores (GPT-4o mini, Claude 3.5 Haiku, Gemini Flash, Mistral Small). Reserve modelos de fronteira caros para tarefas que realmente exigem raciocínio profundo.
O campo de crescimento mensal modela o aumento do volume de requisições ao longo do período de previsão. Se você informar 20 %, a calculadora assume que seu número de requisições diárias cresce 20 % por mês. Para uma previsão anual, ela usa interpolação linear entre o volume inicial e o volume final projetado. Coloque 0 para projeções constantes.
Gerar tokens exige que o modelo faça uma passagem forward autorregressiva completa por token - muito mais computação do que ler tokens de entrada. A geração de saída é computacionalmente mais cara e é cobrada com um prêmio de 3-6× sobre os tokens de entrada na maioria dos provedores. Por isso aplicações com respostas longas têm perfil de custo diferente de classificadores de saída curta.
Sim. A calculadora roda inteiramente no lado do cliente, no seu navegador. Nenhuma contagem de tokens, configuração de prompt, estimativa de custo ou seleção de modelo é enviada a servidor algum. Tudo é calculado localmente no seu dispositivo e nunca armazenado. Seus dados de planejamento são 100 % privados e seguros.