Calculadora de custos de GPU
Estime os custos de infraestrutura de GPU em provedores de nuvem e hardware próprio. Compare preços de instâncias H100, A100, L4, RTX 4090 e MI300X da AWS, GCP, Azure, Lambda Labs, RunPod e Vast.ai — com modelagem de descontos spot, análise de utilização de GPU e comparação do ponto de equilíbrio com hardware próprio. Roda 100 % no seu navegador.
Estimate GPU infrastructure costs across cloud providers and on-prem hardware. Compare hourly rates, spot discounts, and monthly totals for any GPU workload - runs privately in your browser.
Cloud Instance / GPU
GPU Specs: NVIDIA A10G
Workload Profile
Estimated Monthly GPU Cost
Annual Cost
$8,691.84
Per GPU-Hour
$1.006
Active Hours/Mo
720
Cost/Compute Hr
$1.44
Instance Cost Comparison
Same workload · sorted by monthly cost| Instance | $/hr | Monthly | Annual |
|---|---|---|---|
Vast.ai1× RTX 4090 24GB VRAM · 1 GPU | $0.350 | $252.00 | $3,024.00 |
GCPg2-standard-4 24GB VRAM · 1 GPU | $0.700 | $504.00 | $6,048.00 |
AWSg5.xlarge Selected 24GB VRAM · 1 GPU | $1.006 | $724.32 | $8,691.84 |
Lambda Labs1× A100 40GB 40GB VRAM · 1 GPU | $1.290 | $928.80 | $11,145.60 |
Vast.ai1× A100 80GB 80GB VRAM · 1 GPU | $1.400 | $1,008.00 | $12,096.00 |
RunPod1× A100 80GB 80GB VRAM · 1 GPU | $1.640 | $1,180.80 | $14,169.60 |
RunPod1× H100 SXM 80GB VRAM · 1 GPU | $3.490 | $2,512.80 | $30,153.60 |
AzureNC A100 v4 80GB VRAM · 1 GPU | $3.670 | $2,642.40 | $31,708.80 |
Lambda Labs8× H100 SXM5 80GB 80GB VRAM · 8 GPUs | $26.800 | $19,296.00 | $231,552.00 |
AWSp4d.24xlarge 40GB VRAM · 8 GPUs | $32.770 | $23,594.40 | $283,132.80 |
GCPa2-highgpu-8g 40GB VRAM · 8 GPUs | $32.770 | $23,594.40 | $283,132.80 |
AWSp4de.24xlarge 80GB VRAM · 8 GPUs | $40.970 | $29,498.40 | $353,980.80 |
O que determina a fatura de GPU
A fatura não depende só do tipo de GPU: as horas diárias de uso, o número de placas e o desconto aplicável pesam tanto quanto o preço por hora.
Selecione a instância, as horas de uso por dia, o número de GPUs e o desconto spot para obter o custo mensal e anual, e a versão em horas de computação efetiva.
- Horas cobradas = instância em execução, mesmo com a GPU ociosa.
- Spot e preemptible reduzem 50-70 % o preço, ao custo de possíveis interrupções.
- A utilização real converte horas cobradas em horas de computação útil.
Escolher GPU conforme a carga de trabalho
A GPU mais potente nem sempre é a mais rentável. A decisão depende de sua carga ser limitada por throughput, memória ou latência.
- Cargas limitadas por throughput (treinamento com lotes grandes): a H100 costuma compensar.
- Cargas limitadas por memória (inferência com lotes pequenos): A100 ou L40S podem sair mais baratas.
- VRAM necessária em FP16: os pesos do modelo mais 20-30 % de folga para o contexto.
Comparar nuvem e hardware próprio
A compra só vence com utilização alta e sustentada. Se o uso é intermitente, o custo fixo do hardware é pago sem ser aproveitado.
- Estime suas horas de GPU por mês e a utilização média real.
- Calcule o custo de nuvem equivalente com e sem desconto spot.
- Compare com depreciação mais energia do hardware próprio em 18-36 meses.
- Decida pelo ponto de equilíbrio e pela sua tolerância ao risco de interrupção.
Perguntas frequentes
Ela estima o custo financeiro de executar cargas aceleradas por GPU em infraestrutura de nuvem ou hardware próprio. Calcula despesas por hora, mês e ano com base no tipo de instância, horas de uso diárias, número de GPUs e descontos spot opcionais, dando um orçamento completo de infraestrutura antes de comprometer recursos.
Instâncias spot (AWS) e VMs preemptible (GCP) usam capacidade ociosa da nuvem com grandes descontos, normalmente 50-70 % abaixo do preço sob demanda. A contrapartida é que a instância pode ser interrompida com 2 minutos de aviso quando o provedor precisa da capacidade. São ideais para treinamentos com checkpointing, inferência em lote e qualquer carga que tolere reinícios.
Guia aproximado para pesos em FP16: 7B parâmetros ≈ 14 GB de VRAM, 13B ≈ 26 GB, 34B ≈ 68 GB, 70B ≈ 140 GB. A quantização INT8 reduz esses requisitos pela metade e INT4/GPTQ a um quarto. Sempre inclua 20-30 % de folga para o cache KV e as ativações na inferência. Para treinamento, normalmente são necessárias 3-4× a VRAM de inferência por causa dos estados do otimizador e dos gradientes.
A H100 SXM oferece cerca de 3× o throughput FP16 e ~1,7× a largura de banda de memória da A100 80GB. Porém, também custa 3-4× mais por hora. Para cargas limitadas por throughput (treinamento com lotes grandes), a H100 costuma ter melhor custo-eficiência. Para cargas limitadas por memória (inferência com lotes pequenos), o custo por resultado útil pode não justificar o prêmio — uma A100 ou L40S pode ser mais econômica.
O hardware próprio vence quando a utilização de GPU é consistentemente alta (60 %+) por um longo período (18 meses+). Com alta utilização, o custo por hora do hardware próprio (depreciação + energia) costuma ficar abaixo das tarifas sob demanda em 12-18 meses para GPUs da classe H100. A nuvem vence em cargas variáveis, projetos curtos ou quando é preciso escalar sem capital inicial.
GPU-horas (ou horas de relógio) são o que o provedor cobra: o tempo em que a instância está rodando, independentemente da carga real. Horas de computação (ou horas de computação efetiva) consideram a utilização real da GPU nesse período. Uma GPU a 50 % por 10 horas entrega 5 horas de computação efetiva mas é cobrada por 10 GPU-horas.
Os preços refletem tarifas indicativas sob demanda dos principais provedores de nuvem e nuvens especializadas em GPU em meados de 2025. Os preços reais variam conforme região, descontos por compromisso e disponibilidade spot. Sempre confirme o preço atual na página do seu provedor antes de fechar um orçamento. Esta calculadora serve para planejamento e comparação, não como garantia de cobrança.
Totalmente. A calculadora roda 100 % no seu navegador. Todas as entradas — escolha de instância, horas de uso, preços personalizados e custos de hardware próprio — são processadas localmente no seu dispositivo e nunca enviadas a servidor algum. Não é preciso cadastro.