Calculadora de custos da OpenAI
Estime e projete com precisão seus custos da API OpenAI. Selecione os modelos mais recentes como GPT-5.5, o3 e GPT-4o, use o estimador de tokens integrado para colar texto de prompt, aplique descontos de cache de prompts e compare diferentes estruturas de preços de modelos lado a lado. 100 % privado e roda inteiramente no seu navegador.
Estimate standard and cached input/output token pricing, configure Batch discounts, and analyze overall API workloads and model comparisons locally.
Prompt Tokens
Cost Optimizations
Workload Call Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0550
Input Token Cost
$0.0250
Output Token Cost
$0.0300
Model Pricing Comparisons
Sorted by lowest cost| Model Name | Cost/Call | Monthly Forecast | Optimization Match |
|---|---|---|---|
GPT-4o MiniCost-Effective In: $0.15/M • Out: $0.60/M • Cache: $0.07/M | $0.001350 | $40.50 | Caching Supported |
GPT-5.4 NanoCost-Effective In: $0.20/M • Out: $1.25/M • Cache: $0.02/M | $0.002250 | $67.50 | Caching Supported |
GPT-3.5 Turbo In: $0.50/M • Out: $1.50/M • Cache: $0.50/M | $0.004000 | $120.00 | Caching Supported |
GPT-5.4 MiniCost-Effective In: $0.75/M • Out: $4.50/M • Cache: $0.07/M | $0.008250 | $247.50 | Caching Supported |
o4-miniCost-Effective In: $1.10/M • Out: $4.40/M • Cache: $0.55/M | $0.009900 | $297.00 | Caching Supported |
o3 (Reasoning)Capable In: $2.00/M • Out: $8.00/M • Cache: $1.00/M | $0.0180 | $540.00 | Caching Supported |
GPT-4oCapable In: $2.50/M • Out: $10.00/M • Cache: $1.25/M | $0.0225 | $675.00 | Caching Supported |
GPT-5.4Capable In: $2.50/M • Out: $15.00/M • Cache: $0.25/M | $0.0275 | $825.00 | Caching Supported |
GPT-5.5 (New Flagship)Capable Selected In: $5.00/M • Out: $30.00/M • Cache: $0.50/M | $0.0550 | $1,650.00 | Caching Supported |
GPT-4 Turbo In: $10.00/M • Out: $30.00/M • Cache: $5.00/M | $0.0800 | $2,400.00 | Caching Supported |
GPT-4 (Legacy) In: $30.00/M • Out: $60.00/M • Cache: $30.00/M | $0.2100 | $6,300.00 | Caching Supported |
GPT-5.5 ProCapable In: $30.00/M • Out: $180.00/M • Cache: $15.00/M | $0.3300 | $9,900.00 | Caching Supported |
O que determina o custo na API OpenAI
O custo depende do número de consultas, do tamanho de entrada e saída de cada uma e do modelo escolhido. Tokens de saída são mais caros que os de entrada.
Modelos de raciocínio adicionam tokens internos que você não vê na resposta, mas que são cobrados.
- Tokens de entrada, de entrada em cache e de saída são cobrados separadamente.
- O desconto da Batch API aplica 50 % a todos esses tipos.
- Tokens de raciocínio contam como tokens de saída.
Aproveitar o cache de prompts
Se seu prompt tem um prefixo estável com mais de 1.024 tokens (instruções de sistema, exemplos fixos, contexto de documento), o cache reduz muito o preço.
- Identifique a parte fixa e repetida do seu prompt.
- Meça quantos tokens de entrada correspondem a esse prefixo estável.
- Informe-os no campo de tokens em cache para ver a economia.
- Se o trabalho não exigir latência, ative também a Batch API.
Comparar modelos e planejar o orçamento
O modelo mais caro nem sempre é o mais econômico: muitas vezes resolve a tarefa com menos tokens. Compare o custo por tarefa resolvida, não só o preço por milhão.
- Use a comparação lado a lado para ver a diferença mensal exata.
- Reserve modelos de raciocínio para tarefas realmente complexas.
- Classificadores e extratores costumam bastar com modelos menores.
Perguntas frequentes
É uma ferramenta online que estima os custos de API de usar modelos OpenAI como GPT-5.5, o3 e GPT-4o. Ao inserir tokens de entrada, em cache e de saída, ela calcula o custo por consulta e projeta despesas diárias, mensais e anuais.
A OpenAI cacheia automaticamente prefixos de prompt com 1.024 tokens ou mais. Requisições seguintes que reutilizam exatamente esse prefixo (como instruções de sistema ou exemplos few-shot) recebem desconto de 50 a 90 % nos tokens de entrada. A calculadora permite informar os tokens em cache separadamente para estimar com precisão essa economia.
Modelos de raciocínio (como o3 e o4-mini) geram tokens de pensamento internos durante o processamento. Embora não apareçam na saída da API, eles são cobrados ao mesmo preço dos tokens de saída padrão. Vale incluir os tokens de pensamento estimados no campo de tokens de saída desta calculadora para orçar com precisão.
Sim! A Batch API é um endpoint da OpenAI para cargas que não dependem de tempo (processamento em 24 horas). Requisições enviadas pela Batch API recebem 50 % de desconto fixo em tokens padrão, de entrada em cache e de saída. Você pode ativar o interruptor da Batch API no estimador para aplicar o desconto automaticamente.
Ele oferece uma aproximação próxima com base em proporções padrão de token por palavra e caractere por token (~1,3× em inglês simples, ~1,8× para código ou JSON). Para precisão de 100 %, recomendamos a biblioteca oficial tiktoken da OpenAI no seu código, mas nosso estimador no navegador é ideal para previsões rápidas.
Não. Nossas ferramentas rodam 100 % localmente no seu navegador. Qualquer texto de prompt colado no estimador de tokens e qualquer número inserido na calculadora são processados localmente no seu dispositivo e nunca enviados a servidor algum nem registrados.
Marque a caixa «Comparar com outro modelo» no painel da calculadora. Uma seção de comparação aparecerá, onde você pode escolher um modelo secundário (por exemplo, comparar GPT-5.5 com GPT-5.4) e ver diferenças exatas de custo mensal e a economia percentual.