Pular para o conteúdo
Aback Tools Logo

Calculadora de custos de hospedagem de LLM

Calcule o custo de infraestrutura para auto-hospedar um grande modelo de linguagem — grátis e 100 % privado no seu navegador. Compare aluguéis de GPU na nuvem (RunPod, Vast.ai, Lambda Labs, AWS), inferência serverless gerenciada (Together AI, Groq, Fireworks AI, DeepInfra) e hardware próprio para modelos abertos populares como Llama 3.1, Mistral, Qwen, DeepSeek e Gemma. Inclui verificação de compatibilidade de VRAM, dimensionamento por quantização, estimativas de custo por requisição e uma tabela comparativa completa.

LLM Hosting Cost Calculator

Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.

Model to Host

Strong open-source frontier model

VRAM Required72 GB
✓ Fits in A100 80GB (80 GB available)

Deployment Option

Cloud GPU (Self-Managed)

Managed Inference (Serverless)

On-Premises Hardware

Usage & Scale

hrs/day
%
reqs/day
tokens
tokens

RunPod - A100 80GB

Monthly Cost

$787.20

Annual Cost

$9,577.60

Cost / Request

$0.0052

Cost / 1K Tokens

$0.0028

Rate: $1.640/hr ·  Daily: $26.24 ·  16h/day active

Monthly Cost Breakdown

GPU Rental$787.20/mo
Networking / egress (est.)$23.62/mo
Total Monthly Estimate$787.20/mo

All Options - Monthly Estimate

Sorted by cost
OptionTypeMonthlyFits Model
Groq - Llama 3.1 70B
Managed$180.15✓ Serverless
DeepInfra - Llama 3.1 70B
Managed$185.25✓ Serverless
Together AI - Llama 3.1 70B
Managed$250.80✓ Serverless
Fireworks AI - Llama 3.1 70B
Managed$256.50✓ Serverless
Vast.ai - A100 80GB
Cloud GPU$672.00✓ 80 GB VRAM
RunPod - A100 80GB Selected
Cloud GPU$787.20✓ 80 GB VRAM
On-Prem - A100 80GB Server
On-Prem$850.00✓ 80 GB VRAM
RunPod - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
Lambda Labs - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
On-Prem - 8× A100 DGX
On-Prem$5,833.33✓ 5120 GB VRAM
AWS p4d.24xlarge - 8× A100
Cloud GPU$15,732.48✓ 320 GB VRAM
On-Prem - RTX 4090 (×1)
On-Prem-✗ 72GB needed
Vast.ai - RTX 4090
Cloud GPU-✗ 72GB needed
AWS g5.xlarge - A10G
Cloud GPU-✗ 72GB needed

Throughput Estimate

Tokens / Sec

132

Tokens / Day

7,603,200

Req / Sec

0.3

Max Daily Req

19,008

Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.

Disclaimer: Prices reflect publicly available on-demand rates and are indicative only. Actual costs depend on reserved/spot pricing, network egress, storage, software licensing (e.g. vLLM, TGI), and negotiated enterprise discounts. On-prem costs exclude engineering time, maintenance, and facility overheads. All calculations run locally in your browser - no data is sent to any server.

As três formas de hospedar um LLM

Auto-hospedar não é uma coisa só: você pode alugar GPUs por hora, pagar inferência gerenciada por token ou comprar hardware. Cada modelo de custo vence em um cenário diferente.

A escolha depende sobretudo da regularidade da sua carga: uma GPU alugada custa o mesmo ocupada ou não.

  • Aluguel de GPU: tarifa horária fixa, você gerencia o stack.
  • Inferência gerenciada: pagamento por token, sem custos ociosos.
  • Hardware próprio: investimento inicial, custo por hora menor no longo prazo.

VRAM e quantização

Antes de comparar preços, verifique se o modelo cabe na GPU considerada. A quantização é a alavanca mais direta para reduzir a VRAM necessária.

  • FP16/BF16: 2 bytes por parâmetro.
  • INT8: metade da VRAM, perda mínima de qualidade.
  • INT4: um quarto da VRAM, com 1-5 % menos qualidade conforme o benchmark.

Utilização e custo por requisição

O preço por hora é só metade da história. A utilização real determina quanto dessa tarifa vira trabalho útil.

  1. Estime seus tokens diários e as requisições por minuto no pico.
  2. Calcule a utilização esperada conforme seu padrão de tráfego.
  3. Divida o custo horário pelas requisições realmente atendidas.
  4. Compare esse custo por requisição com o de uma API gerenciada.

Perguntas frequentes

Ela estima os gastos de infraestrutura de executar um grande modelo de linguagem por conta própria — em GPUs alugadas na nuvem, APIs de inferência serverless gerenciada ou hardware próprio. Ajuda desenvolvedores e equipes a comparar opções de implantação, calcular custos por requisição e mensais, verificar requisitos de VRAM e decidir se auto-hospedar é mais econômico que usar APIs gerenciadas. Nossa calculadora roda 100 % no navegador e não exige cadastro.

O ponto de equilíbrio depende do volume de requisições e do modelo escolhido. Em volume baixo (menos de 500 mil tokens/dia), APIs gerenciadas costumam ser mais baratas porque você evita custos de GPU ociosa. Em volume alto (mais de 5 milhões de tokens/dia), aluguel de GPU dedicada ou hardware próprio custa tipicamente 60-90 % menos por token que APIs gerenciadas para modelos abertos equivalentes.

O Llama 3.1 70B exige cerca de 140 GB de VRAM em FP16/BF16 (2× A100 80GB), ~72 GB em INT8 (1× H100 80GB) e ~40 GB em quantização INT4 (1× A100 80GB). Nossa calculadora mostra os requisitos de VRAM automaticamente ao selecionar um modelo e nível de quantização, e indica quais opções de implantação são compatíveis.

É o percentual do tempo em que a GPU está processando de fato requisições de inferência durante as horas ativas. Utilização baixa (20-30 %) significa que você paga por computação ociosa, elevando o custo efetivo por requisição. Utilização alta (70-90 %) amortiza melhor a tarifa horária entre mais requisições. Servidores de inferência em produção com batching contínuo (vLLM, TGI) costumam alcançar 50-80 % sob carga constante.

O aluguel de GPU na nuvem (RunPod, Vast.ai, Lambda Labs, AWS) oferece uma GPU dedicada por tarifa horária fixa: você instala e gerencia seu próprio stack de serviço. A inferência gerenciada (Together AI, Groq, Fireworks AI) cuida de toda a infraestrutura e cobra por token consumido, sem custos ociosos. O aluguel de GPU é melhor para cargas altas e constantes; a inferência gerenciada, para uso imprevisível ou de baixo volume.

A quantização reduz a precisão dos pesos de FP16 (2 bytes/parâmetro) para INT8 (1 byte) ou INT4 (0,5 byte), cortando os requisitos de VRAM em 50-75 %. Isso permite rodar um modelo 70B em hardware mais barato ou encaixar um modelo maior na mesma GPU. A quantização INT4 (GGUF Q4, AWQ, GPTQ) reduz a qualidade em 1-5 % na maioria dos benchmarks — aceitável para muitos casos de produção.

Baseiam-se em números de benchmark publicados para cada modelo em hardware H100 SXM, escalados por número de GPUs e utilização. O throughput real depende do seu framework de serviço (vLLM, TGI, Ollama), tamanho de lote, comprimento de contexto e configuração de hardware. Trate-as como estimativas de ordem de grandeza para planejamento de capacidade; um profiling real dará números exatos.

Sim. A calculadora roda inteiramente no seu navegador com JavaScript do lado do cliente. Escolhas de modelo, volumes de uso, custos de infraestrutura e todos os resultados calculados são processados localmente no seu dispositivo e nunca transmitidos a servidor algum. Não exige conta e nenhum dado é armazenado. Seu planejamento de infraestrutura fica totalmente privado e seguro.