Pular para o conteúdo
Aback Tools Logo

O que é uma calculadora de preço por consulta? Guia de custos de API LLM

Entenda como uma calculadora de preço por consulta estima os custos de API de um LLM: tokens, preços de entrada e saída, comparações de modelos e estratégias para reduzir sua conta de IA em 30-80 %.

DH
Tips & Best Practices11 min de leitura2,550 palavras

Cada chamada de API ao GPT, Claude, Gemini ou qualquer outro modelo de linguagem tem um custo medido em tokens - e esse custo se multiplica rápido quando você escala. Uma calculadora de preço por consulta traduz tokens em dinheiro para que você possa orçar com precisão, escolher o nível de modelo certo e identificar onde otimizar antes que a conta mensal da API vire surpresa.

US$ 0,01-0,15Custo típico por consultaVaria por modelo e tamanho
30-60 %Economia de tokens possívelCom compressão da entrada
~0,75Palavras por tokenMédia em texto em inglês

O que é uma calculadora de preço por consulta?

Uma calculadora de preço por consulta é uma ferramenta que estima o custo de API de uma única chamada a um modelo de linguagem de grande porte (LLM). Você informa o número de tokens de entrada (seu prompt, o contexto e os documentos recuperados), o número esperado de tokens de saída (a resposta do modelo) e o modelo desejado. A calculadora multiplica cada um pela tarifa por token publicada pelo provedor e retorna o custo por consulta, além de um total mensal projetado conforme o volume de chamadas esperado.

O objetivo central é tornar os custos de IA previsíveis. Sem uma calculadora, é fácil subestimar a velocidade com que os tokens se acumulam em escala. Uma consulta de US$ 0,012 parece insignificante, mas com 10.000 chamadas por dia isso dá US$ 120 por dia, ou US$ 3.600 por mês, saindo de um único endpoint. As calculadoras de preço por consulta revelam isso antes do deploy, não depois.

O que uma calculadora de preço por consulta mostra

  • Custo por consulta - o valor exato de uma chamada de API com seus números de tokens e seu modelo.
  • Projeções diárias e mensais - aplica o custo por consulta ao volume de chamadas esperado.
  • Detalhamento de entrada e saída - mostra quanto do custo vem do prompt e quanto vem da resposta, já que tokens de saída são mais caros.
  • Comparação de modelos - algumas calculadoras permitem comparar ao mesmo tempo o custo da mesma consulta em vários modelos.

Note

As calculadoras usam os preços de tabela dos provedores, que podem diferir da cobrança real se você tiver descontos por volume negociados, tarifas de API em lote ou tokens de prompt em cache. Sempre confira no painel de faturamento do provedor depois que estiver em produção.

Como funciona o preço por token dos LLMs

Os provedores de LLM cobram por token: uma unidade de texto equivalente a cerca de 0,75 palavra em inglês (ou aproximadamente 4 caracteres). Os preços são por milhão de tokens ($/M), separadamente para entrada e saída. Os tokens de entrada incluem tudo o que você envia: o prompt de sistema, o histórico de conversa, a mensagem do usuário, os trechos de documentos recuperados por pipelines RAG e os esquemas de funções ou ferramentas. Os tokens de saída são a resposta gerada pelo modelo.

Tokens de entrada e de saída são cobrados separadamente. Os de saída custam de 3 a 5 vezes mais que os de entrada porque gerar texto é computacionalmente mais caro que processar contexto.

- Convenção padrão de cobrança de API de LLM, 2024-2026

Por que tokens de saída custam mais

Durante a inferência, processar os tokens de entrada exige uma única passagem direta pelo modelo. Gerar tokens de saída exige um loop autorregressivo: o modelo produz um token por vez, e cada passo depende do anterior. Esse processo sequencial é muito mais intensivo em GPU por token, e é por isso que os provedores cobram um prêmio significativo na saída. Nos preços do GPT-4o, a entrada custa US$ 2,50/M e a saída US$ 10,00/M - um múltiplo de 4. Isso tem uma implicação prática direta: respostas longas e prolixas custam desproporcionalmente mais que as concisas.

Como os tokens se traduzem em tamanhos reais de prompt

  • Prompt curto + resposta curta (ex.: "Classifique este texto"): ~50-200 tokens no total.
  • Mensagem de sistema + consulta com contexto: ~500-2.000 tokens de entrada, 100-500 de saída.
  • Consulta RAG com trechos de documentos: ~2.000-8.000 tokens de entrada, 300-1.000 de saída.
  • Fluxo agêntico com resultados de ferramentas e histórico: ~8.000-32.000 tokens de entrada por chamada.
  • Geração longa (artigo, código): ~1.000-4.000 tokens de entrada, 1.000-4.000 de saída.

Tip

A regra de 1 token ≈ 0,75 palavra vale para texto em inglês. Código e JSON são bem menos eficientes em tokens, porque caracteres especiais, espaços e tokens repetidos são tokenizados com menor densidade. Um ensaio de 1.000 palavras em inglês usa cerca de 1.300 tokens; 1.000 caracteres de JSON costumam usar 300-500 tokens, e não os ~250 que as proporções do inglês sugeririam.

Como estimar seus custos por consulta

Estimar custos por consulta com precisão exige conhecer três números: o número médio de tokens de entrada por chamada, o número médio de tokens de saída por chamada e seu volume diário de chamadas. Os dois primeiros são melhores medidos empiricamente com o contador de tokens do provedor ou com o campo `usage` nas respostas da API, e não estimados a partir de contagem de palavras.

Passo 1 - Meça o uso real de tokens em desenvolvimento

Toda resposta de API de LLM inclui um objeto `usage` com `prompt_tokens`, `completion_tokens` e `total_tokens`. Registre esses dados durante o desenvolvimento em uma amostra representativa de 50-100 consultas reais. Calcule a média e o percentil 95 tanto da entrada quanto da saída. Para planejar custos, use o percentil 95 da entrada e a média da saída: isso considera contextos grandes atípicos sem superestimar a chamada típica.

Passo 2 - Estime o volume mensal

Para aplicações em produção, estime usuários ativos diários × consultas médias por sessão × chamadas de API por consulta. Um chatbot com 1.000 usuários diários, 5 mensagens por sessão e 1 chamada de API por mensagem gera 5.000 chamadas por dia. Multiplique o custo por chamada pelo volume diário e depois por 30 para a projeção mensal. Inclua uma margem de 30-50 % para picos de tráfego e iterações de engenharia de prompt.

Passo 3 - Compare entre níveis de modelo

Rode os mesmos números de tokens em vários níveis de modelo para identificar onde os requisitos de qualidade permitem um modelo mais barato. Muitas tarefas - classificação, extração de entidades, resumo simples, respostas de FAQ - alcançam qualidade aceitável com um modelo menor e mais barato. Reservar modelos de fronteira (classe GPT-4, classe Claude 3.5 Sonnet) para o subconjunto de tarefas que realmente os exige e encaminhar tarefas simples para modelos mais baratos costuma ser a redução de custo mais rentável.

Conversor JSON para TOON

Converta JSON para o formato compacto TOON e reduza o uso de tokens do LLM em 30-60 % - cortando diretamente o custo de tokens de entrada de cada consulta que inclua dados JSON estruturados.

Open tool

Comparação de custos entre os principais LLMs

Os preços dos modelos mudam com frequência: os provedores os reduziram bastante conforme a concorrência aumentou. A tabela abaixo mostra faixas de preço representativas de meados de 2026 para ilustrar a estrutura de custos. Sempre confirme os preços atuais na página oficial de cada provedor antes de montar projeções de custo para produção.

Nível de modeloEntrada ($/M tokens)Saída ($/M tokens)Melhor uso
Classe GPT-4o MiniUS$ 0,15-0,50US$ 0,60-2,00Classificação, extração
Classe Gemini FlashUS$ 0,10-0,35US$ 0,40-1,50Resumo em alto volume
Classe Claude HaikuUS$ 0,25-0,80US$ 1,25-4,00Saída estruturada rápida
Classe GPT-4oUS$ 2,50-5,00US$ 10-20Raciocínio complexo, código
Classe Claude SonnetUS$ 3,00-15,00US$ 15-75Análise, contexto longo
Classe o1 / raciocínioUS$ 15-60US$ 60-240Lógica multi-etapas, matemática

A diferença de custo entre o nível mais barato e o mais caro abrange duas ordens de magnitude. Uma aplicação com 10.000 consultas por dia usando um modelo classe o1 custa cerca de US$ 60-240 por dia; a mesma aplicação com GPT-4o Mini custa US$ 1,50-20 por dia. Decisões de roteamento baseadas na complexidade da tarefa - usar um classificador de consultas para direcionar cada chamada ao nível de modelo adequado - podem reduzir o gasto total de API em 60-80 % em pipelines com complexidade mista.


Janela de contexto versus custo

Janelas de contexto maiores permitem incluir mais informação por consulta, mas mais tokens no prompt significa custo de entrada maior. Uma janela de 100 mil tokens só vale a pena se o contexto adicional realmente melhorar a qualidade da resposta para aquela tarefa. Na maioria das aplicações de geração aumentada por recuperação (RAG), 2.000-4.000 tokens de contexto recuperado produzem resultados quase tão bons quanto 20.000 tokens, com custo de entrada de 5 a 10 vezes menor. Sempre compare qualidade e tamanho de contexto antes de fixar prompts grandes em produção.

Note

Os provedores costumam oferecer preço com desconto para **tokens de prompt em cache** - a parte do prompt que permanece idêntica entre chamadas (prompts de sistema, exemplos few-shot, instruções estáticas). O cache de prompt da OpenAI reduz o custo desses tokens de entrada em 50 %; o da Anthropic reduz em 90 %. Em aplicações com um prompt de sistema grande e fixo, ativar o cache pode reduzir bastante os custos de entrada.

Estratégias para reduzir os custos por consulta

A otimização de custo por consulta tem duas alavancas: reduzir os tokens por consulta e reduzir o preço por token. As estratégias a seguir atacam as duas e estão ordenadas, de forma aproximada, do menor para o maior esforço de implementação.

  • Comprima os dados de entrada antes de injetá-los - converta payloads JSON, CSV ou YAML para o formato TOON antes de incluí-los nos prompts. O Conversor JSON para TOON reduz a contagem de tokens em 30-60 % sem perda de informação.
  • Use o modelo mais barato que atenda aos requisitos - teste cada tipo de tarefa em níveis de modelo menores antes de presumir que precisa de um modelo de fronteira. Muitas tarefas de extração, classificação e resumo funcionam bem com GPT-4o Mini ou Gemini Flash.
  • Encurte e enxugue os prompts de sistema - audite seu prompt de sistema em busca de instruções redundantes, exemplos de formatação longos e ressalvas repetidas. Cada token removido economiza dinheiro em todas as chamadas de API.
  • Limite o tamanho da saída com max_tokens - peça respostas concisas e defina um teto rígido de max_tokens. Tokens de saída custam de 3 a 5 vezes os de entrada, então reduzir respostas prolixas corta direto a parte mais cara da conta.
  • Ative o cache de prompt - use o cache nativo do provedor para prompts de sistema estáticos e exemplos few-shot. Tokens em cache custam de 50 a 90 % menos que tokens sem cache na OpenAI e na Anthropic.
  • Cacheie respostas de consultas frequentes - para consultas determinísticas ou quase determinísticas, guarde a resposta do LLM em cache e sirva-a para entradas idênticas repetidas sem fazer chamada de API.

Compressão de tokens: o caminho mais rápido para economizar

Em aplicações que enviam dados estruturados a LLMs - catálogos de produtos, cadastros de usuários, exportações analíticas, respostas de API -, a compressão de tokens de entrada oferece a redução de custo mais rápida e consistente. Converter um payload JSON de 2.000 tokens para o formato TOON o reduz a cerca de 800-1.400 tokens. A US$ 3,00/M de tokens de entrada e 50.000 consultas diárias, essa única mudança economiza US$ 0,09-0,18 por dia: cerca de US$ 33-66 por mês sem impacto na qualidade. Para dados CSV, o Conversor CSV para TOON alcança 40-60 % de economia de tokens em conjuntos tabulares, e o Conversor YAML para TOON cuida de configurações e dados estruturados em YAML.

Tip

Valide as saídas do LLM com o [Validador de guarda-corpos JSON para saída de LLM](/tools/data/converters/llm-output-json-guardrail-validator) antes de disparar loops de nova tentativa caros. Uma saída estruturada que falha e exige nova pergunta dobra o custo de tokens daquela consulta. Detectar erros de parsing e violações de tipo antes que cheguem à sua camada de validação elimina tokens de nova tentativa desperdiçados.

Quando o custo por consulta vira problema

Para desenvolvedores solo e projetos pequenos, os custos de tokens raramente são relevantes: US$ 5-20 por mês para experimentação e desenvolvimento. O problema aparece quando um recurso escala para volume de produção, quando os prompts incluem payloads de contexto grandes ou quando um pipeline encadeia várias chamadas de API por interação do usuário. Esses são os cenários em que os cálculos de preço por consulta se tornam críticos.

Pipelines agênticos e de várias etapas

Fluxos agênticos que encadeiam várias chamadas ao LLM - planejamento, uso de ferramentas, reflexão, resumo - podem acumular 10.000-100.000 tokens em uma única requisição do usuário que parece uma só interação. Cada resultado de ferramenta e cada turno de conversa é reinjetado como contexto para a chamada seguinte, fazendo a contagem de tokens crescer de forma quadrática com o número de etapas. Nesses pipelines, estimar o custo por requisição exige multiplicar o custo por consulta pelo número médio de chamadas ao LLM por execução.

Aplicações RAG com trechos de documento grandes

Pipelines de geração aumentada por recuperação injetam os trechos recuperados em cada prompt. Se a estratégia de divisão produz trechos grandes (1.000-4.000 tokens cada) e recupera de três a cinco trechos por consulta, a contagem de tokens de entrada pode chegar a 5.000-20.000 por chamada antes mesmo de incluir a pergunta do usuário. Comprimir os trechos recuperados em um formato como TOON - ou reduzir o tamanho dos trechos no pipeline de embeddings - baixa diretamente o custo por consulta sem mudar a qualidade da recuperação. Para entender onde a validação de saída estruturada se encaixa nesse tipo de pipeline, o guia do Guardrails AI cobre a camada de validação que vem depois da recuperação.

Warning

Cuidado com estimativas de tokens vindas de contadores de palavras. As proporções de palavra para token do inglês não valem para código, JSON, SQL ou XML: esses formatos são tokenizados a 1-2 tokens por palavra, e não aos 1,3 típicos. Use a biblioteca `tiktoken` (para modelos OpenAI) ou a API de contagem de tokens do seu provedor para medir contagens reais em amostras reais de prompt, em vez de estimar por número de caracteres.

Conversor CSV para TOON

Converta conjuntos de dados CSV para o formato compacto TOON com 40-60 % de economia de tokens - o caminho mais rápido para reduzir o custo de tokens de entrada de consultas que enviam dados tabulares às APIs de LLM.

Open tool

Key takeaways

  • Uma calculadora de preço por consulta estima o custo de uma chamada de API de LLM a partir de tokens de entrada, tokens de saída e modelo - essencial para orçar antes de escalar um recurso de IA para produção.
  • O preço dos LLMs se divide entre tokens de entrada (seu prompt e contexto) e de saída (a resposta), com os de saída custando 3-5 vezes mais porque gerar é computacionalmente mais pesado.
  • Uma consulta de US$ 0,012 vira US$ 3.600 por mês com 10.000 chamadas diárias - sempre modele seus custos no volume de produção, não por consulta.
  • Escolher o nível de modelo mais barato que atenda aos requisitos de qualidade é a maior alavanca de custo: modelos de fronteira custam de 10 a 100 vezes mais que modelos pequenos em tarefas que ambos resolvem.
  • A compressão de tokens - converter payloads JSON, CSV ou YAML para o formato TOON - reduz os tokens de entrada em 30-60 % sem impacto na qualidade, com o Conversor JSON para TOON ou o Conversor CSV para TOON.
  • O cache de prompt (disponível na OpenAI e na Anthropic) corta o custo dos tokens de entrada em cache em 50-90 % para prompts de sistema estáticos - ative-o em qualquer aplicação em produção com um prompt de sistema grande e fixo.
  • Meça sempre o uso real de tokens pelo campo `usage` das respostas da API, em vez de estimar por contagem de palavras: código e JSON são tokenizados bem menos eficientemente que texto em inglês.

Perguntas frequentes

Uma calculadora de preço por consulta é uma ferramenta que estima o custo de uma chamada de API a um LLM com base no número de tokens de entrada e de saída da requisição. Você informa o tamanho do prompt (tokens de entrada), o tamanho esperado da resposta (tokens de saída) e seleciona o modelo; a calculadora multiplica cada valor pela tarifa publicada por token e retorna o custo por consulta. A maioria também mostra projeções de custo mensal conforme o volume esperado, o que é útil para orçar antes de escalar um recurso de IA.

O preço de uma API de LLM é baseado em tokens: trechos de texto que equivalem a cerca de 0,75 palavra em inglês. Os provedores cobram separadamente os tokens de entrada (seu prompt e o contexto) e os de saída (a resposta do modelo). Os preços são por milhão de tokens ($/M). Uma consulta com prompt de 1.000 tokens e resposta de 500 tokens, a US$ 3,00/M de entrada e US$ 15,00/M de saída, custa aproximadamente US$ 0,003 + US$ 0,0075 = US$ 0,0105 por chamada. Com 10.000 consultas diárias, isso dá US$ 105 por dia.

Um prompt simples de uma linha com resposta curta usa cerca de 50-200 tokens no total. Um prompt com mensagem de sistema e um trecho de documento para RAG costuma usar 1.000-4.000 tokens. Um fluxo agêntico complexo com resultados de chamadas de ferramenta, histórico de conversa e instruções de saída estruturada pode usar 8.000-32.000 tokens por consulta. Os tokens de saída geralmente representam 10-30 % do total na maioria das tarefas de conclusão, mas podem dominar em tarefas de resumo, geração de código ou escrita longa.

Em 2026, as opções mais baratas para a maioria das tarefas são os modelos Google Gemini Flash e OpenAI GPT-4o Mini, ambos abaixo de US$ 0,50/M de tokens de entrada, adequados para classificação, extração e conclusão simples. Para tarefas com muito raciocínio que exigem qualidade de nível GPT-4, os custos sobem para US$ 2-15/M de tokens de entrada. Escolher o nível de modelo certo para a tarefa é a maior alavanca de redução de custos: usar um modelo de fronteira onde um modelo menor dá conta desperdiça de 5 a 10 vezes o orçamento.

As estratégias mais eficazes são: escolher o modelo mais barato que atenda aos requisitos de qualidade; comprimir os dados de entrada para reduzir tokens (converter JSON ou CSV para o formato TOON economiza 30-60 % de tokens); armazenar em cache respostas de consultas repetidas ou quase idênticas; encurtar os prompts de sistema removendo instruções redundantes; limitar o tamanho da saída com `max_tokens`; e agrupar consultas menos urgentes em janelas de menor movimento, onde alguns provedores oferecem tarifas com desconto.

Reduzir tokens de entrada por meio de compressão de formato de dados - por exemplo, converter grandes payloads JSON para TOON antes da injeção - baixa diretamente o custo por consulta sem prejuízo de qualidade.

Tokens de entrada são os de tudo o que você envia ao modelo: o prompt de sistema, o histórico da conversa, a mensagem do usuário, os trechos de documentos recuperados, os esquemas de funções e qualquer outro contexto. Tokens de saída são os que o modelo gera na resposta. Eles costumam custar de 3 a 5 vezes mais que os de entrada, porque gerar texto é computacionalmente mais caro que processar entrada. Isso significa que respostas longas e prolixas custam proporcionalmente mais que prompts longos - motivo para usar limites de `max_tokens` e pedir respostas concisas.

Os planos gratuitos da OpenAI, Anthropic, Google e outros provedores normalmente cobrem um número limitado de tokens ou chamadas por mês sem custo, depois do que se aplica o pagamento conforme o uso. O plano gratuito serve para desenvolvimento e testes, mas costuma ser insuficiente para cargas de produção com milhares de consultas diárias. Alguns provedores mantêm planos gratuitos com limite de taxa indefinidamente; outros expiram o crédito gratuito após 90 dias, independentemente do uso. Verifique os termos atuais de cada provedor, porque mudam com frequência.

Sim - e a economia escala diretamente com o uso. Converter um payload JSON de 2.000 tokens para o formato TOON o reduz a cerca de 800-1.400 tokens, dependendo da estrutura dos dados. A US$ 3,00/M de tokens de entrada e 50.000 consultas diárias, essa única otimização economiza entre US$ 0,09 e US$ 0,18 por dia: cerca de US$ 33-66 por mês com uma só mudança. Em pipelines que enviam grandes payloads de dados estruturados a LLMs, a compressão de tokens costuma ser o caminho mais rápido para uma redução de custo significativa sem trocar de modelo ou provedor.

ShareXLinkedIn