Calculadora de custos de IA auto-hospedada
Compare o custo real de auto-hospedar LLMs de código aberto com provedores de API gerenciada — grátis e 100 % privado no seu navegador. Configure sua carga de trabalho, escolha uma opção de infraestrutura de GPU (RunPod, Vast.ai, Lambda, AWS, GCP, própria), adicione o overhead de DevOps e obtenha uma comparação mensal lado a lado, custo por milhão de tokens, verificação de capacidade de throughput e período de equilíbrio da infraestrutura própria.
Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.
Model & Workload
Infrastructure Option
Operational Overhead
Managed API to Compare
Monthly Cost Comparison
$2.2K/mo
$5.99/1M tokens
$90.00/mo
$0.3750/1M tokens (avg)
Self-Host / Mo
$2.2K
API / Mo
$90.00
12-Mo Self-Host
$27.0K
12-Mo API
$1.1K
Self-Hosting Cost Breakdown
Cloud GPU Options Comparison
Sorted by cost| Option | $/hr | Monthly | $/1M tokens |
|---|---|---|---|
Vast.ai - RTX 4090 RTX 4090 | $0.350 | $2.0K | $5.21 |
RunPod - L4 24GB NVIDIA L4 | $0.440 | $2.0K | $5.38 |
GCP g2-standard-4 (L4) NVIDIA L4 | $0.700 | $2.2K | $5.88 |
RunPod - A10G 24GB Selected NVIDIA A10G | $0.760 | $2.2K | $5.99 |
AWS g5.xlarge (A10G) NVIDIA A10G | $1.006 | $2.4K | $6.46 |
Lambda - A100 40GB NVIDIA A100 | $1.290 | $2.6K | $7.01 |
Vast.ai - A100 80GB NVIDIA A100 | $1.400 | $2.7K | $7.22 |
RunPod - A100 80GB NVIDIA A100 | $1.640 | $2.9K | $7.68 |
RunPod - H100 SXM NVIDIA H100 | $3.490 | $4.2K | $11.23 |
Azure NC A100 v4 NVIDIA A100 | $3.670 | $4.3K | $11.58 |
| OpenAI - GPT-4o Mini Managed API | pay-per-use | $90.00 | $0.3750 |
O custo real vai além do preço da GPU
O aluguel por hora é apenas a parte mais visível. Tempo de engenharia, rede e armazenamento costumam somar 30 a 60 % ao custo bruto.
Comparar só a tarifa de GPU com o preço por token de uma API leva a conclusões erradas.
- GPU: tarifa horária × horas do mês.
- DevOps: horas de engenharia × custo por hora carregado.
- Extras: rede, armazenamento e configuração do framework.
Utilização e quantização
O custo efetivo por token depende tanto da utilização quanto do preço por hora. Uma GPU pela metade dobra seu custo unitário.
- Utilização baixa = custo por token proporcionalmente maior.
- Batching e vLLM melhoram a utilização em produção.
- INT4/Q4 corta VRAM e permite modelos maiores em GPUs mais baratas.
Quando cada opção vence
A nuvem vence em cargas variáveis ou projeto curto. Hardware próprio vence com uso alto e constante por anos.
- Estime seus tokens diários e a utilização sustentável.
- Calcule o custo mensal auto-hospedado com GPU e DevOps.
- Compare com o preço de uma API gerenciada para a mesma carga.
- Se o uso é estável e alto, calcule a amortização própria em 3-4 anos.
Perguntas frequentes
Ela estima o custo mensal total de rodar LLMs de código aberto na sua própria infraestrutura de GPU — incluindo aluguel de GPU ou custo amortizado de hardware, mão de obra de DevOps e overhead operacional — e compara com o preço de uma API gerenciada para a mesma carga de trabalho.
O ponto de equilíbrio depende do modelo, da eficiência da GPU e do overhead de operações. Para modelos pequenos como Llama 3.1 8B, a auto-hospedagem fica competitiva em cerca de 500 mil a 2 milhões de tokens/dia. Para modelos 70B, o equilíbrio costuma ficar entre 5 e 20 milhões de tokens/dia.
A tarifa horária da GPU é só parte do custo real. Tempo de engenharia de DevOps (US$ 500-3.000/mês), rede, armazenamento e configuração do framework de serving somam 30-60 % ao custo bruto de GPU. Sempre os inclua ao comparar com o preço de API.
É o percentual de computação da GPU processando requisições ativamente. Com 30 % de utilização, seu custo efetivo por token é 3× maior que com 90 %. Batching de requisições e frameworks como vLLM são essenciais para alta utilização e competitividade econômica.
A quantização (INT4/Q4) reduz os requisitos de VRAM em cerca de 70 %, permitindo modelos maiores em GPUs mais baratas. A contrapartida é redução de throughput de 10-20 % e leve queda de qualidade. Para a maioria das cargas de inferência em produção, é um bom trade-off quando a VRAM é o gargalo.
Para uma implantação simples de um único modelo na nuvem, orce 5-20 horas/mês de engenheiro. A US$ 80-150/h de custo total, isso dá US$ 400-3.000/mês. Use 10-20 horas/mês no início e acompanhe o tempo real no primeiro trimestre para refinar a projeção.
Sim. A calculadora roda inteiramente no seu navegador. Volumes de carga, escolhas de infraestrutura e todos os resultados são processados localmente no seu dispositivo e nunca enviados a servidor algum, armazenados ou compartilhados. Não exige login.
Para modelos pequenos de baixo custo: Vast.ai (~US$ 0,35/h RTX 4090) e RunPod (~US$ 0,44/h L4). Para inferência 7-13B em produção: RunPod ou Lambda (A10G/A100 a US$ 0,76-1,64/h). Para modelos 70B+: RunPod H100 (US$ 3,49/h). Para cargas estáveis e econômicas: hardware próprio amortizado em 3-4 anos.