Calculadora de custos de infraestrutura de IA
Estime grátis e online o gasto total de infraestrutura das suas aplicações de IA. Modele o custo de tokens de API de LLM, computação com GPU, bancos de dados vetoriais, armazenamento, egress de rede, servidores de aplicação, observabilidade e mais, com visões mensal e anual, detalhamento de custos ordenado e margem de contingência personalizável.
Estimate total monthly and annual infrastructure expenses for your AI application - covering LLM APIs, GPU compute, storage, networking, orchestration, and observability.
LLM API Usage
Embedding API
GPU / Self-Hosted Compute
Total AI Infrastructure Cost (Monthly)
Compute
$412.16
42.1%
Storage
$18.80
1.9%
Networking
$9.10
0.9%
Ops + Overhead
$539.01
55.1%
All Cost Components - Ranked by Spend
Compute (LLM + GPU)
$412.16/mo
Storage
$18.80/mo
Networking
$9.10/mo
Ops + Overhead
$539.01/mo
Overhead & Contingency
Added to subtotal to cover unexpected usage spikes, support escalations, and untracked minor services.
As camadas de custo de uma aplicação de IA
O custo de um app de IA não se resume aos tokens do LLM. Bancos vetoriais, computação, armazenamento, egress de rede e observabilidade somam rápido, e costumam ser esquecidos nas primeiras estimativas.
Percorra cada aba e informe seus volumes reais de tokens, instâncias, gigabytes e requisições para ter uma visão completa do gasto mensal e anual.
- APIs de LLM: tokens de entrada e saída conforme o modelo e o volume de requisições.
- Computação com GPU: horas de instância e utilização para inferência própria ou treino.
- Bancos vetoriais e armazenamento: vetores, índices, metadados e payloads.
- Rede: egress de dados, CDN e transferência entre zonas.
- Servidores de aplicação, orquestração e observabilidade: o restante do stack operacional.
Como usar o detalhamento de custos
A ferramenta ordena as categorias da maior para a menor despesa, então comece pelas primeiras para encontrar a maior margem de otimização.
- Informe o volume de tokens e o modelo para calcular o gasto com API de LLM.
- Adicione computação, bancos vetoriais, armazenamento, rede e servidores de aplicação.
- Inclua a observabilidade e uma margem de contingência de 10-15 %.
- Revise o detalhamento ordenado e as visões mensal e anual para definir o orçamento.
Escolher entre API gerenciada e hospedagem própria
Hospedar os modelos pode reduzir muito o custo por token quando a utilização é alta e constante, mas sai caro se a GPU ficar ociosa com frequência. Compare os dois cenários com seus próprios volumes antes de decidir.
- Com utilização de GPU abaixo de 60 %, as APIs gerenciadas costumam sair mais baratas.
- Com vazão alta e estável, uma GPU dedicada pode reduzir muito o custo por token.
- Inclua o custo de engenharia e manutenção da hospedagem própria, não só a instância.
- Reserve uma margem de contingência para picos de tráfego ou bots.
Perguntas frequentes
Uma calculadora de custos de infraestrutura de IA estima o gasto recorrente total de rodar uma aplicação de IA em todas as camadas: APIs de LLM, APIs de embeddings, computação com GPU, bancos de dados vetoriais, armazenamento de objetos, bancos relacionais, CDN, egress de rede, servidores de aplicação, orquestração e observabilidade. Ela ajuda desenvolvedores e times de produto a projetar orçamentos realistas antes de ir para produção. Roda inteiramente no navegador, sem cadastro.
O percentual de sobrecarga adiciona uma margem de contingência sobre os custos modelados para cobrir serviços menores não contabilizados, picos de uso inesperados (um momento viral ou tráfego de bots), ajustes de preço dos fornecedores, escalonamentos de suporte e cobranças diversas difíceis de prever. Uma margem de 10-15 % é uma boa prática comum de engenharia na estimativa de custos de nuvem.
Não. A calculadora funciona 100 % no lado do cliente, no seu navegador. Volumes de tokens, número de instâncias, tamanhos de armazenamento e todas as entradas de custo são processados localmente no seu dispositivo e nunca enviados a servidor algum. Os dados da sua infraestrutura são completamente privados e seguros.
A inferência própria costuma ficar competitiva com APIs gerenciadas quando a utilização da GPU passa de forma consistente de 60-70 %. Com uso baixo, você paga horas de GPU ociosas que o preço por API gerenciada evita. Em escala, com vazão constante, uma única A100 a US$ 3/hora pode processar volumes equivalentes de tokens muito mais barato que o preço gerenciado por token. Use a aba de computação da calculadora para comparar os dois cenários com seus volumes.
Em um sistema RAG, os custos de embeddings vêm de duas fontes: a ingestão inicial do corpus (vetorizar todos os seus documentos) e a vetorização contínua das consultas em tempo de execução. Para os custos recorrentes, multiplique o volume diário de consultas pelo tamanho médio da consulta em tokens e aplique a tarifa por milhão de tokens do fornecedor. O text-embedding-3-small da OpenAI custa US$ 0,02/M tokens, muito barato frente aos custos de geração do LLM.
Os custos de egress variam bastante por provedor. A AWS cobra ~US$ 0,09/GB de saída para a internet, a GCP ~US$ 0,08/GB e a Azure ~US$ 0,087/GB. Cloudflare Workers e R2 não cobram egress, o que os torna atraentes como camada de cache. Aplicações de IA que transmitem respostas longas ou devolvem áudio e imagens sintetizadas podem gerar 50-500 GB/mês de egress em escala, o que pesa rápido em provedores tradicionais.
Uma estimativa aproximada: para 1 milhão de documentos de 512 tokens com embeddings float32 de 1536 dimensões, os vetores brutos ocupam cerca de 6 GB antes da sobrecarga do índice HNSW (que adiciona 10-30 %). Com metadados e payloads, considere ~10 GB por milhão de documentos. A quantização int8 (suportada pelo Qdrant) reduz 4× e a binária 32×, com pequenas perdas de recall.
Na maioria das aplicações de IA, os custos de CDN são mínimos comparados às APIs de LLM e à computação. A CDN importa principalmente para servir ativos estáticos (frontend, documentação), e os grandes provedores cobram US$ 0,01 a US$ 1,00 por milhão de requisições. No entanto, se sua aplicação de IA entrega mídia gerada (imagens, áudio, vídeo) via CDN, os custos de armazenamento e transferência podem ficar significativos conforme os volumes e tamanhos de arquivo.