Pular para o conteúdo
Aback Tools Logo

Calculadora de custos de IA auto-hospedada

Compare o custo real de auto-hospedar LLMs de código aberto com provedores de API gerenciada — grátis e 100 % privado no seu navegador. Configure sua carga de trabalho, escolha uma opção de infraestrutura de GPU (RunPod, Vast.ai, Lambda, AWS, GCP, própria), adicione o overhead de DevOps e obtenha uma comparação mensal lado a lado, custo por milhão de tokens, verificação de capacidade de throughput e período de equilíbrio da infraestrutura própria.

Self-Hosted AI Cost Calculator

Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.

Model & Workload

Min VRAM: 16GBQuantized: ~5GBSpeed: ~120 tok/sGPU: A10G / L4 / RTX 4090
req/d
tok
tok
Monthly tokens: 375.0M ·  Tokens/request: 2,500

Infrastructure Option

GPU: NVIDIA A10G · On-demand: $0.76/hr
hrs/d
%

Operational Overhead

$/mo
$/mo

Managed API to Compare

In/1M: $0.15Out/1M: $0.60Per request: $0.000600
3 months12 months36 months
⚠️ Capacity gap: At 60% utilization, this setup handles ~2,488 req/day but you need 5,000. You may need ~3× this instance to meet demand.

Monthly Cost Comparison

Self-Hosted

$2.2K/mo

$5.99/1M tokens

OpenAI API

$90.00/mo

$0.3750/1M tokens (avg)

📡 Managed API saves $2.2K/mo at this workload - self-hosting becomes cost-effective at higher volumes

Self-Host / Mo

$2.2K

API / Mo

$90.00

12-Mo Self-Host

$27.0K

12-Mo API

$1.1K

Self-Hosting Cost Breakdown

Cloud GPU Rental$547.20/mo (24%)
ML Ops / DevOps Labour$1.5K/mo (67%)
Misc. Infra & Networking$200.00/mo (9%)

Cloud GPU Options Comparison

Sorted by cost
Option$/hrMonthly$/1M tokens
Vast.ai - RTX 4090
RTX 4090
$0.350$2.0K$5.21
RunPod - L4 24GB
NVIDIA L4
$0.440$2.0K$5.38
GCP g2-standard-4 (L4)
NVIDIA L4
$0.700$2.2K$5.88
RunPod - A10G 24GB Selected
NVIDIA A10G
$0.760$2.2K$5.99
AWS g5.xlarge (A10G)
NVIDIA A10G
$1.006$2.4K$6.46
Lambda - A100 40GB
NVIDIA A100
$1.290$2.6K$7.01
Vast.ai - A100 80GB
NVIDIA A100
$1.400$2.7K$7.22
RunPod - A100 80GB
NVIDIA A100
$1.640$2.9K$7.68
RunPod - H100 SXM
NVIDIA H100
$3.490$4.2K$11.23
Azure NC A100 v4
NVIDIA A100
$3.670$4.3K$11.58
OpenAI - GPT-4o Mini
Managed API
pay-per-use$90.00$0.3750
Disclaimer: Cost estimates use current market pricing and typical throughput benchmarks. Actual self-hosting costs depend on your model, serving framework, batching efficiency, GPU availability, and ops overhead. API pricing changes frequently - always verify with official provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

O custo real vai além do preço da GPU

O aluguel por hora é apenas a parte mais visível. Tempo de engenharia, rede e armazenamento costumam somar 30 a 60 % ao custo bruto.

Comparar só a tarifa de GPU com o preço por token de uma API leva a conclusões erradas.

  • GPU: tarifa horária × horas do mês.
  • DevOps: horas de engenharia × custo por hora carregado.
  • Extras: rede, armazenamento e configuração do framework.

Utilização e quantização

O custo efetivo por token depende tanto da utilização quanto do preço por hora. Uma GPU pela metade dobra seu custo unitário.

  • Utilização baixa = custo por token proporcionalmente maior.
  • Batching e vLLM melhoram a utilização em produção.
  • INT4/Q4 corta VRAM e permite modelos maiores em GPUs mais baratas.

Quando cada opção vence

A nuvem vence em cargas variáveis ou projeto curto. Hardware próprio vence com uso alto e constante por anos.

  1. Estime seus tokens diários e a utilização sustentável.
  2. Calcule o custo mensal auto-hospedado com GPU e DevOps.
  3. Compare com o preço de uma API gerenciada para a mesma carga.
  4. Se o uso é estável e alto, calcule a amortização própria em 3-4 anos.

Perguntas frequentes

Ela estima o custo mensal total de rodar LLMs de código aberto na sua própria infraestrutura de GPU — incluindo aluguel de GPU ou custo amortizado de hardware, mão de obra de DevOps e overhead operacional — e compara com o preço de uma API gerenciada para a mesma carga de trabalho.

O ponto de equilíbrio depende do modelo, da eficiência da GPU e do overhead de operações. Para modelos pequenos como Llama 3.1 8B, a auto-hospedagem fica competitiva em cerca de 500 mil a 2 milhões de tokens/dia. Para modelos 70B, o equilíbrio costuma ficar entre 5 e 20 milhões de tokens/dia.

A tarifa horária da GPU é só parte do custo real. Tempo de engenharia de DevOps (US$ 500-3.000/mês), rede, armazenamento e configuração do framework de serving somam 30-60 % ao custo bruto de GPU. Sempre os inclua ao comparar com o preço de API.

É o percentual de computação da GPU processando requisições ativamente. Com 30 % de utilização, seu custo efetivo por token é 3× maior que com 90 %. Batching de requisições e frameworks como vLLM são essenciais para alta utilização e competitividade econômica.

A quantização (INT4/Q4) reduz os requisitos de VRAM em cerca de 70 %, permitindo modelos maiores em GPUs mais baratas. A contrapartida é redução de throughput de 10-20 % e leve queda de qualidade. Para a maioria das cargas de inferência em produção, é um bom trade-off quando a VRAM é o gargalo.

Para uma implantação simples de um único modelo na nuvem, orce 5-20 horas/mês de engenheiro. A US$ 80-150/h de custo total, isso dá US$ 400-3.000/mês. Use 10-20 horas/mês no início e acompanhe o tempo real no primeiro trimestre para refinar a projeção.

Sim. A calculadora roda inteiramente no seu navegador. Volumes de carga, escolhas de infraestrutura e todos os resultados são processados localmente no seu dispositivo e nunca enviados a servidor algum, armazenados ou compartilhados. Não exige login.

Para modelos pequenos de baixo custo: Vast.ai (~US$ 0,35/h RTX 4090) e RunPod (~US$ 0,44/h L4). Para inferência 7-13B em produção: RunPod ou Lambda (A10G/A100 a US$ 0,76-1,64/h). Para modelos 70B+: RunPod H100 (US$ 3,49/h). Para cargas estáveis e econômicas: hardware próprio amortizado em 3-4 anos.