Pular para o conteúdo
Aback Tools Logo

Calculadora de custos de treinamento

Estime gastos de treinamento de modelos com GPUs, épocas e tamanhos de dataset — grátis e 100 % privado no seu navegador. Usa a fórmula FLOP padrão do setor Chinchilla 6ND com utilização de FLOP do modelo configurável. Compare fine-tuning completo, LoRA e QLoRA em mais de 12 instâncias na AWS, GCP, Azure, Lambda Labs, RunPod e Vast.ai. Obtenha custo total, tempo real, tokens por segundo e um comparativo de provedores ordenado.

Training Cost Calculator

Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.

7B model fine-tune on 1B tokens - single 8× A100 node

Training Type

Model & Dataset

B params
B tokens
epochs

Effective Tokens

1.0B

dataset × epochs

GPU Cluster

GPU: NVIDIA A100 40 GBVRAM: 40 GBFP16: 312 TFLOPSOn-Demand: $32.77/hrSpot: $11.47/hr
GPUs
40%
10%70%

Additional Costs

$
$
%

Estimated Total Training Cost

$510.3711.7 hrs wall-clock

Compute Cost

$382.93

Overhead

$57.44

Storage + Network

$70.00

GPU Hours

93

Cheapest option: Vast.ai 1× RTX 4090 (avg) - $35.57 (saves $404.79)

Wall-Clock Time

11.7 hrs

11.7 hrs total

Tokens / Second

23,771

across 8 GPUs

Cost / Billion Tokens

$440.37

compute only

Training Computation Summary

Model Size7B params
Dataset (effective)1.0B tokens
Training TypeFull Fine-Tune
Total FLOPs42.00 EFLOPs
Cluster8× NVIDIA A100 40 GB
Instances1 × p4d.24xlarge (8× A100)
MFU40%
Spot / PreemptibleNo
Effective $/hr$32.77/instance/hr
Instance Hours11.7 hrs

Cloud Instance Comparison

Same GPU count as selected, sorted cheapest first
InstanceWall-ClockCompute CostTotal
Vast.ai1× RTX 4090 (avg)
NVIDIA RTX 4090
3.7 days$30.93$35.57
Lambda Labs8× H100 SXM
NVIDIA H100 SXM
1.8 hrs$49.37$56.78
RunPod1× H100 SXM
NVIDIA H100 SXM
14.7 hrs$51.44$59.15
Vast.ai1× A100 80 GB (avg)
NVIDIA A100 80 GB
3.9 days$130.88$150.51
RunPod1× A100 80 GB
NVIDIA A100 80 GB
3.9 days$153.31$176.31
AWSp5.48xlarge (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
GCPa3-highgpu-8g (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureND H100 v5 (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureNC A100 v4 (1× A100)
NVIDIA A100 80 GB
3.9 days$343.08$394.54
AWSp4d.24xlarge (8× A100) Selected
NVIDIA A100 40 GB
11.7 hrs$382.93$440.37

* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.

Disclaimer: Training cost estimates use the Chinchilla 6ND FLOPs approximation and may differ from actual results depending on architecture-specific overheads, communication patterns, optimizer choice, and hardware-specific MFU. Cloud prices are approximate and change frequently - verify with provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Como a computação de treinamento é estimada

O ponto de partida é a fórmula Chinchilla 6ND: FLOP = 6 × parâmetros × tokens de treinamento. Daí se derivam tempo e custo.

A MFU é o fator de correção principal: converte FLOP teóricos em tempo real.

  • FLOP = 6 × parâmetros do modelo × tokens de treinamento.
  • Tempo = FLOP ÷ (TFLOPS de pico × MFU × número de GPUs).
  • Custo = tempo × preço por hora da instância.

Fine-tuning completo vs LoRA e QLoRA

O ajuste completo atualiza todos os pesos e exige muita memória e computação. LoRA e QLoRA treinam uma fração mínima de parâmetros e reduzem drasticamente o custo.

  • Fine-tuning completo: qualidade máxima, custo máximo.
  • LoRA: treina matrizes adaptadoras, custo bem menor.
  • QLoRA: quantiza a base e reduz também a VRAM necessária.

Escolher instância e modo de pagamento

Compare provedores e tipos de instância antes de iniciar o trabalho. A diferença de preço por hora entre provedores pode ser enorme para o mesmo treinamento.

  1. Defina tamanho do modelo, tokens de treinamento e tipo de ajuste.
  2. Escolha o cluster de GPU e uma MFU realista.
  3. Compare o custo total entre provedores e instâncias.
  4. Considere spot se puder tolerar interrupções com checkpoints frequentes.

Perguntas frequentes

Ela estima a despesa total de computação para treinar ou ajustar um modelo de machine learning. Usa a fórmula FLOP do Chinchilla 6ND (FLOP = 6 × parâmetros × tokens de treinamento), combinada com as especificações do cluster de GPU e a utilização de FLOP do modelo, para estimar tempo e custo total de computação em nuvem.

A lei de escala Chinchilla (Hoffmann et al., 2022) estabeleceu que treinar um transformer exige aproximadamente 6 × N × D FLOP, onde N é o número de parâmetros e D o número de tokens de treinamento. A fórmula cobre a passada forward (2ND FLOP) e a backward (4ND FLOP). É a base padrão de qualquer calculadora séria de custo de treinamento.

A MFU é a fração do TFLOPS de pico teórico que o treinamento realmente alcança. Uma execução perfeitamente otimizada em H100 chega a 50-55 % de MFU. Execuções de produção multinó costumam atingir 40-50 %. Execuções mal otimizadas ou limitadas por memória caem para 25-35 %. Para estimativa conservadora use 35-40 %; com FlashAttention e pipelines eficientes, 45-50 % é realista.

Na escala ótima do Chinchilla (7B parâmetros × ~140B tokens), com 8× A100 80GB na Lambda Labs (~US$ 10,32/h por nó): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. A 40 % de MFU em 8× A100 (312 TFLOPS cada): ~165 horas → ~US$ 1.700 de computação. Com instâncias spot da AWS, cai para ~US$ 600. Esta calculadora gera essas estimativas automaticamente.

O LoRA (Low-Rank Adaptation) congela os pesos base e adiciona pequenas matrizes adaptadoras treináveis. Como só 0,1-5 % dos parâmetros têm gradientes, os FLOP da passada backward caem drasticamente. Para um 7B com 1 % de parâmetros treináveis sobre 500M de tokens, os FLOP efetivos do LoRA são cerca de 1/50 do fine-tuning completo, reduzindo o tempo de dias para horas em uma única A100.

Instâncias spot economizam 55-70 %, mas podem ser interrompidas pelo provedor. Servem para trabalhos com checkpointing frequente (a cada 30-60 minutos) e lógica de reinício. Para treinamentos críticos com prazos apertados, sob demanda é mais seguro. Para experimentos com orçamento limitado e ajustes de até 24 horas, as spot costumam dar melhor ROI.

Sim. Ela roda 100 % no seu navegador. Tamanho do modelo, parâmetros do dataset, configurações de GPU e todas as projeções de custo são calculados localmente e nunca enviados a servidor algum. Não exige conta e não retém dados.

São direcionalmente corretas para planejamento. Os custos reais dependem da MFU atingida, da disponibilidade spot, do overhead de checkpoints e de reinícios por falha. Para maior precisão, rode um piloto curto (1.000 passos), meça a MFU real e tokens/segundo e extrapole. A calculadora aceita sua MFU medida.