Calculadora de custos do DeepSeek
Estime gratuitamente os gastos da API DeepSeek com base no seu uso de tokens. Suporta comparação de modelos (DeepSeek-V4-Flash, DeepSeek-V4-Pro, V3, R1), descontos por taxa de acerto de cache de prompts, modelagem de tokens de raciocínio e previsões mensais. Rápido, seguro e totalmente privado.
Estimate input/output token pricing, compare legacy and active model tiers, configure context caching hit rates, and analyze overall API forecasts locally.
Prompt & Response Tokens
Cost Optimizations
Workload Call Volume
Projected Monthly Workload Cost
Cost/Call
$0.001120
Input Cost
$0.000700
Output Cost
$0.000280
Reasoning Cost
$0.000140
Model Pricing Comparisons
Sorted by lowest cost| Model Name | Cost/Call | Monthly Forecast | Caching / Reasoning |
|---|---|---|---|
| DeepSeek-V3 (Legacy) | $0.000980 | $29.40 | Cache Supported |
| DeepSeek-V4-FlashCost-Effective Selected | $0.001120 | $33.60 | Cache Supported Reasoning |
| DeepSeek-V4-ProCapable | $0.003480 | $104.40 | Cache Supported Reasoning |
| DeepSeek-R1 (Legacy) | $0.006035 | $181.05 | Cache Supported Reasoning |
Os quatro itens de uma fatura do DeepSeek
Na DeepSeek o custo não se resume a entrada e saída. O cache pode baratear drasticamente tokens repetidos, e os tokens de raciocínio somam custo sem aparecer na resposta.
Informe tokens de entrada, em cache, de saída e de raciocínio com o volume de consultas para ver o custo real por consulta e a previsão mensal.
- Tokens de saída custam de 2 a 4 vezes mais que os de entrada.
- Tokens em cache podem ser até 98 % mais baratos que os tokens de entrada padrão.
- Tokens de raciocínio são cobrados como saída mesmo sem aparecer na resposta.
Quando usar cache e quando usar lotes
Cache e Batch API não competem: resolvem problemas diferentes e podem ser combinados.
- Cache: útil quando o mesmo prefixo longo se repete em muitas consultas.
- Batch: útil quando você tolera 24 horas de espera e não precisa de resposta imediata.
- Nenhum dos dois ajuda se cada consulta usa um prompt curto e diferente.
Escolher o modelo com critério
A família DeepSeek cobre desde alto volume e baixo custo até raciocínio complexo. Escolher a variante errada multiplica a fatura sem melhorar o resultado.
- Meça os tokens reais de uma consulta representativa, incluindo os de raciocínio.
- Calcule o custo por consulta com seu modelo atual e o volume mensal.
- Compare com outras variantes DeepSeek usando a mesma carga de trabalho.
- Ative cache ou Batch se seu padrão de uso permitir e revise a economia obtida.
Perguntas frequentes
É uma ferramenta que estima o preço da API DeepSeek com base nos seus tokens de entrada, em cache e de saída, volumes de consultas e configurações de modelo. Ajuda desenvolvedores a planejar orçamentos e escolher o modelo DeepSeek mais econômico para sua carga de trabalho. Roda totalmente no seu navegador, sem cadastro.
Ela usa as tarifas padrão de Pay-As-You-Go da documentação oficial da API DeepSeek. Ainda assim, os custos reais podem variar conforme planos de preço personalizados, provedores de hospedagem terceiros (como OpenRouter, Together AI ou Novita) ou atualizações de preço da DeepSeek. Consulte sempre a página oficial de preços para tarifas definitivas.
Tokens de entrada representam o texto ou mídia que você envia no prompt ao modelo. Tokens de saída representam o texto da resposta gerada pelo modelo. Gerá-los custa mais computacionalmente, então são cobrados bem mais caro (normalmente de 2 a 4 vezes) que os tokens de entrada em todos os modelos DeepSeek.
O cache de contexto permite armazenar grandes blocos repetitivos de conteúdo (como um código-fonte extenso, um livro ou instruções de sistema longas) em cache. Ao consultar o modelo, ele lê do cache em vez de reprocessar todo o prompt. Tokens de entrada em cache recebem desconto enorme (em geral até 98 % mais baratos que os tokens de entrada padrão).
Modelos de raciocínio geram tokens internos de cadeia de pensamento durante o processamento. Embora não sejam devolvidos na saída da API, são cobrados ao mesmo preço dos tokens de saída padrão. Inclua os tokens de pensamento estimados no campo de tokens de raciocínio desta calculadora para orçar com precisão.
Sim. A Batch API é feita para cargas que não são sensíveis a latência (como processamento offline de dados). Requisições em lote recebem automaticamente 50 % de desconto nas tarifas de entrada e de saída.
Não. A calculadora roda inteiramente no lado do cliente, no seu navegador. Suas entradas, tamanhos de tokens, custos estimados e resultados de comparação são processados localmente no seu dispositivo e nunca enviados a servidor algum. Seus dados permanecem 100 % privados e seguros.