Calculadora de custos de hospedagem de LLM
Calcule o custo de infraestrutura para auto-hospedar um grande modelo de linguagem — grátis e 100 % privado no seu navegador. Compare aluguéis de GPU na nuvem (RunPod, Vast.ai, Lambda Labs, AWS), inferência serverless gerenciada (Together AI, Groq, Fireworks AI, DeepInfra) e hardware próprio para modelos abertos populares como Llama 3.1, Mistral, Qwen, DeepSeek e Gemma. Inclui verificação de compatibilidade de VRAM, dimensionamento por quantização, estimativas de custo por requisição e uma tabela comparativa completa.
Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.
Model to Host
Strong open-source frontier model
Deployment Option
Cloud GPU (Self-Managed)
Managed Inference (Serverless)
On-Premises Hardware
Usage & Scale
RunPod - A100 80GB
Monthly Cost
$787.20
Annual Cost
$9,577.60
Cost / Request
$0.0052
Cost / 1K Tokens
$0.0028
Monthly Cost Breakdown
All Options - Monthly Estimate
Sorted by cost| Option | Type | Monthly | Fits Model |
|---|---|---|---|
Groq - Llama 3.1 70B | Managed | $180.15 | ✓ Serverless |
DeepInfra - Llama 3.1 70B | Managed | $185.25 | ✓ Serverless |
Together AI - Llama 3.1 70B | Managed | $250.80 | ✓ Serverless |
Fireworks AI - Llama 3.1 70B | Managed | $256.50 | ✓ Serverless |
Vast.ai - A100 80GB | Cloud GPU | $672.00 | ✓ 80 GB VRAM |
RunPod - A100 80GB Selected | Cloud GPU | $787.20 | ✓ 80 GB VRAM |
On-Prem - A100 80GB Server | On-Prem | $850.00 | ✓ 80 GB VRAM |
RunPod - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
Lambda Labs - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
On-Prem - 8× A100 DGX | On-Prem | $5,833.33 | ✓ 5120 GB VRAM |
AWS p4d.24xlarge - 8× A100 | Cloud GPU | $15,732.48 | ✓ 320 GB VRAM |
On-Prem - RTX 4090 (×1) | On-Prem | - | ✗ 72GB needed |
Vast.ai - RTX 4090 | Cloud GPU | - | ✗ 72GB needed |
AWS g5.xlarge - A10G | Cloud GPU | - | ✗ 72GB needed |
Throughput Estimate
Tokens / Sec
132
Tokens / Day
7,603,200
Req / Sec
0.3
Max Daily Req
19,008
Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.
As três formas de hospedar um LLM
Auto-hospedar não é uma coisa só: você pode alugar GPUs por hora, pagar inferência gerenciada por token ou comprar hardware. Cada modelo de custo vence em um cenário diferente.
A escolha depende sobretudo da regularidade da sua carga: uma GPU alugada custa o mesmo ocupada ou não.
- Aluguel de GPU: tarifa horária fixa, você gerencia o stack.
- Inferência gerenciada: pagamento por token, sem custos ociosos.
- Hardware próprio: investimento inicial, custo por hora menor no longo prazo.
VRAM e quantização
Antes de comparar preços, verifique se o modelo cabe na GPU considerada. A quantização é a alavanca mais direta para reduzir a VRAM necessária.
- FP16/BF16: 2 bytes por parâmetro.
- INT8: metade da VRAM, perda mínima de qualidade.
- INT4: um quarto da VRAM, com 1-5 % menos qualidade conforme o benchmark.
Utilização e custo por requisição
O preço por hora é só metade da história. A utilização real determina quanto dessa tarifa vira trabalho útil.
- Estime seus tokens diários e as requisições por minuto no pico.
- Calcule a utilização esperada conforme seu padrão de tráfego.
- Divida o custo horário pelas requisições realmente atendidas.
- Compare esse custo por requisição com o de uma API gerenciada.
Perguntas frequentes
Ela estima os gastos de infraestrutura de executar um grande modelo de linguagem por conta própria — em GPUs alugadas na nuvem, APIs de inferência serverless gerenciada ou hardware próprio. Ajuda desenvolvedores e equipes a comparar opções de implantação, calcular custos por requisição e mensais, verificar requisitos de VRAM e decidir se auto-hospedar é mais econômico que usar APIs gerenciadas. Nossa calculadora roda 100 % no navegador e não exige cadastro.
O ponto de equilíbrio depende do volume de requisições e do modelo escolhido. Em volume baixo (menos de 500 mil tokens/dia), APIs gerenciadas costumam ser mais baratas porque você evita custos de GPU ociosa. Em volume alto (mais de 5 milhões de tokens/dia), aluguel de GPU dedicada ou hardware próprio custa tipicamente 60-90 % menos por token que APIs gerenciadas para modelos abertos equivalentes.
O Llama 3.1 70B exige cerca de 140 GB de VRAM em FP16/BF16 (2× A100 80GB), ~72 GB em INT8 (1× H100 80GB) e ~40 GB em quantização INT4 (1× A100 80GB). Nossa calculadora mostra os requisitos de VRAM automaticamente ao selecionar um modelo e nível de quantização, e indica quais opções de implantação são compatíveis.
É o percentual do tempo em que a GPU está processando de fato requisições de inferência durante as horas ativas. Utilização baixa (20-30 %) significa que você paga por computação ociosa, elevando o custo efetivo por requisição. Utilização alta (70-90 %) amortiza melhor a tarifa horária entre mais requisições. Servidores de inferência em produção com batching contínuo (vLLM, TGI) costumam alcançar 50-80 % sob carga constante.
O aluguel de GPU na nuvem (RunPod, Vast.ai, Lambda Labs, AWS) oferece uma GPU dedicada por tarifa horária fixa: você instala e gerencia seu próprio stack de serviço. A inferência gerenciada (Together AI, Groq, Fireworks AI) cuida de toda a infraestrutura e cobra por token consumido, sem custos ociosos. O aluguel de GPU é melhor para cargas altas e constantes; a inferência gerenciada, para uso imprevisível ou de baixo volume.
A quantização reduz a precisão dos pesos de FP16 (2 bytes/parâmetro) para INT8 (1 byte) ou INT4 (0,5 byte), cortando os requisitos de VRAM em 50-75 %. Isso permite rodar um modelo 70B em hardware mais barato ou encaixar um modelo maior na mesma GPU. A quantização INT4 (GGUF Q4, AWQ, GPTQ) reduz a qualidade em 1-5 % na maioria dos benchmarks — aceitável para muitos casos de produção.
Baseiam-se em números de benchmark publicados para cada modelo em hardware H100 SXM, escalados por número de GPUs e utilização. O throughput real depende do seu framework de serviço (vLLM, TGI, Ollama), tamanho de lote, comprimento de contexto e configuração de hardware. Trate-as como estimativas de ordem de grandeza para planejamento de capacidade; um profiling real dará números exatos.
Sim. A calculadora roda inteiramente no seu navegador com JavaScript do lado do cliente. Escolhas de modelo, volumes de uso, custos de infraestrutura e todos os resultados calculados são processados localmente no seu dispositivo e nunca transmitidos a servidor algum. Não exige conta e nenhum dado é armazenado. Seu planejamento de infraestrutura fica totalmente privado e seguro.