Calculadora de custos de treinamento
Estime gastos de treinamento de modelos com GPUs, épocas e tamanhos de dataset — grátis e 100 % privado no seu navegador. Usa a fórmula FLOP padrão do setor Chinchilla 6ND com utilização de FLOP do modelo configurável. Compare fine-tuning completo, LoRA e QLoRA em mais de 12 instâncias na AWS, GCP, Azure, Lambda Labs, RunPod e Vast.ai. Obtenha custo total, tempo real, tokens por segundo e um comparativo de provedores ordenado.
Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.
7B model fine-tune on 1B tokens - single 8× A100 node
Training Type
Model & Dataset
Effective Tokens
1.0B
dataset × epochs
GPU Cluster
Additional Costs
Estimated Total Training Cost
Compute Cost
$382.93
Overhead
$57.44
Storage + Network
$70.00
GPU Hours
93
Wall-Clock Time
11.7 hrs
11.7 hrs total
Tokens / Second
23,771
across 8 GPUs
Cost / Billion Tokens
$440.37
compute only
Training Computation Summary
Cloud Instance Comparison
Same GPU count as selected, sorted cheapest first| Instance | Wall-Clock | Compute Cost | Total |
|---|---|---|---|
Vast.ai1× RTX 4090 (avg) NVIDIA RTX 4090 | 3.7 days | $30.93 | $35.57 |
Lambda Labs8× H100 SXM NVIDIA H100 SXM | 1.8 hrs | $49.37 | $56.78 |
RunPod1× H100 SXM NVIDIA H100 SXM | 14.7 hrs | $51.44 | $59.15 |
Vast.ai1× A100 80 GB (avg) NVIDIA A100 80 GB | 3.9 days | $130.88 | $150.51 |
RunPod1× A100 80 GB NVIDIA A100 80 GB | 3.9 days | $153.31 | $176.31 |
AWSp5.48xlarge (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
GCPa3-highgpu-8g (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureND H100 v5 (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureNC A100 v4 (1× A100) NVIDIA A100 80 GB | 3.9 days | $343.08 | $394.54 |
AWSp4d.24xlarge (8× A100) Selected NVIDIA A100 40 GB | 11.7 hrs | $382.93 | $440.37 |
* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.
Como a computação de treinamento é estimada
O ponto de partida é a fórmula Chinchilla 6ND: FLOP = 6 × parâmetros × tokens de treinamento. Daí se derivam tempo e custo.
A MFU é o fator de correção principal: converte FLOP teóricos em tempo real.
- FLOP = 6 × parâmetros do modelo × tokens de treinamento.
- Tempo = FLOP ÷ (TFLOPS de pico × MFU × número de GPUs).
- Custo = tempo × preço por hora da instância.
Fine-tuning completo vs LoRA e QLoRA
O ajuste completo atualiza todos os pesos e exige muita memória e computação. LoRA e QLoRA treinam uma fração mínima de parâmetros e reduzem drasticamente o custo.
- Fine-tuning completo: qualidade máxima, custo máximo.
- LoRA: treina matrizes adaptadoras, custo bem menor.
- QLoRA: quantiza a base e reduz também a VRAM necessária.
Escolher instância e modo de pagamento
Compare provedores e tipos de instância antes de iniciar o trabalho. A diferença de preço por hora entre provedores pode ser enorme para o mesmo treinamento.
- Defina tamanho do modelo, tokens de treinamento e tipo de ajuste.
- Escolha o cluster de GPU e uma MFU realista.
- Compare o custo total entre provedores e instâncias.
- Considere spot se puder tolerar interrupções com checkpoints frequentes.
Perguntas frequentes
Ela estima a despesa total de computação para treinar ou ajustar um modelo de machine learning. Usa a fórmula FLOP do Chinchilla 6ND (FLOP = 6 × parâmetros × tokens de treinamento), combinada com as especificações do cluster de GPU e a utilização de FLOP do modelo, para estimar tempo e custo total de computação em nuvem.
A lei de escala Chinchilla (Hoffmann et al., 2022) estabeleceu que treinar um transformer exige aproximadamente 6 × N × D FLOP, onde N é o número de parâmetros e D o número de tokens de treinamento. A fórmula cobre a passada forward (2ND FLOP) e a backward (4ND FLOP). É a base padrão de qualquer calculadora séria de custo de treinamento.
A MFU é a fração do TFLOPS de pico teórico que o treinamento realmente alcança. Uma execução perfeitamente otimizada em H100 chega a 50-55 % de MFU. Execuções de produção multinó costumam atingir 40-50 %. Execuções mal otimizadas ou limitadas por memória caem para 25-35 %. Para estimativa conservadora use 35-40 %; com FlashAttention e pipelines eficientes, 45-50 % é realista.
Na escala ótima do Chinchilla (7B parâmetros × ~140B tokens), com 8× A100 80GB na Lambda Labs (~US$ 10,32/h por nó): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. A 40 % de MFU em 8× A100 (312 TFLOPS cada): ~165 horas → ~US$ 1.700 de computação. Com instâncias spot da AWS, cai para ~US$ 600. Esta calculadora gera essas estimativas automaticamente.
O LoRA (Low-Rank Adaptation) congela os pesos base e adiciona pequenas matrizes adaptadoras treináveis. Como só 0,1-5 % dos parâmetros têm gradientes, os FLOP da passada backward caem drasticamente. Para um 7B com 1 % de parâmetros treináveis sobre 500M de tokens, os FLOP efetivos do LoRA são cerca de 1/50 do fine-tuning completo, reduzindo o tempo de dias para horas em uma única A100.
Instâncias spot economizam 55-70 %, mas podem ser interrompidas pelo provedor. Servem para trabalhos com checkpointing frequente (a cada 30-60 minutos) e lógica de reinício. Para treinamentos críticos com prazos apertados, sob demanda é mais seguro. Para experimentos com orçamento limitado e ajustes de até 24 horas, as spot costumam dar melhor ROI.
Sim. Ela roda 100 % no seu navegador. Tamanho do modelo, parâmetros do dataset, configurações de GPU e todas as projeções de custo são calculados localmente e nunca enviados a servidor algum. Não exige conta e não retém dados.
São direcionalmente corretas para planejamento. Os custos reais dependem da MFU atingida, da disponibilidade spot, do overhead de checkpoints e de reinícios por falha. Para maior precisão, rode um piloto curto (1.000 passos), meça a MFU real e tokens/segundo e extrapole. A calculadora aceita sua MFU medida.