Aller au contenu
Aback Tools Logo

Calculateur de coûts d'entraînement

Estimez les frais d'entraînement de modèles à partir des GPU, époques et tailles de jeux de données - gratuit et 100 % privé dans votre navigateur. Utilise la formule FLOP standard Chinchilla 6ND avec une utilisation FLOP du modèle configurable. Comparez le fine-tuning complet, LoRA et QLoRA sur 12+ instances cloud d'AWS, GCP, Azure, Lambda Labs, RunPod et Vast.ai. Obtenez le coût total, la durée réelle, les tokens par seconde et un comparatif fournisseurs classé.

Training Cost Calculator

Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.

7B model fine-tune on 1B tokens - single 8× A100 node

Training Type

Model & Dataset

B params
B tokens
epochs

Effective Tokens

1.0B

dataset × epochs

GPU Cluster

GPU: NVIDIA A100 40 GBVRAM: 40 GBFP16: 312 TFLOPSOn-Demand: $32.77/hrSpot: $11.47/hr
GPUs
40%
10%70%

Additional Costs

$
$
%

Estimated Total Training Cost

$510.3711.7 hrs wall-clock

Compute Cost

$382.93

Overhead

$57.44

Storage + Network

$70.00

GPU Hours

93

Cheapest option: Vast.ai 1× RTX 4090 (avg) - $35.57 (saves $404.79)

Wall-Clock Time

11.7 hrs

11.7 hrs total

Tokens / Second

23,771

across 8 GPUs

Cost / Billion Tokens

$440.37

compute only

Training Computation Summary

Model Size7B params
Dataset (effective)1.0B tokens
Training TypeFull Fine-Tune
Total FLOPs42.00 EFLOPs
Cluster8× NVIDIA A100 40 GB
Instances1 × p4d.24xlarge (8× A100)
MFU40%
Spot / PreemptibleNo
Effective $/hr$32.77/instance/hr
Instance Hours11.7 hrs

Cloud Instance Comparison

Same GPU count as selected, sorted cheapest first
InstanceWall-ClockCompute CostTotal
Vast.ai1× RTX 4090 (avg)
NVIDIA RTX 4090
3.7 days$30.93$35.57
Lambda Labs8× H100 SXM
NVIDIA H100 SXM
1.8 hrs$49.37$56.78
RunPod1× H100 SXM
NVIDIA H100 SXM
14.7 hrs$51.44$59.15
Vast.ai1× A100 80 GB (avg)
NVIDIA A100 80 GB
3.9 days$130.88$150.51
RunPod1× A100 80 GB
NVIDIA A100 80 GB
3.9 days$153.31$176.31
AWSp5.48xlarge (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
GCPa3-highgpu-8g (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureND H100 v5 (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureNC A100 v4 (1× A100)
NVIDIA A100 80 GB
3.9 days$343.08$394.54
AWSp4d.24xlarge (8× A100) Selected
NVIDIA A100 40 GB
11.7 hrs$382.93$440.37

* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.

Disclaimer: Training cost estimates use the Chinchilla 6ND FLOPs approximation and may differ from actual results depending on architecture-specific overheads, communication patterns, optimizer choice, and hardware-specific MFU. Cloud prices are approximate and change frequently - verify with provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Comment le calcul d'entraînement est estimé

Le point de départ est la formule Chinchilla 6ND : FLOP = 6 × paramètres × tokens d'entraînement. On en déduit la durée et le coût.

La MFU est le facteur de correction clé : elle convertit les FLOP théoriques en temps réel.

  • FLOP = 6 × paramètres du modèle × tokens d'entraînement.
  • Durée = FLOP ÷ (TFLOPS de crête × MFU × nombre de GPU).
  • Coût = durée × prix horaire de l'instance.

Fine-tuning complet vs LoRA et QLoRA

Le fine-tuning complet met à jour tous les poids et exige beaucoup de mémoire et de calcul. LoRA et QLoRA n'entraînent qu'une fraction minimale de paramètres et réduisent fortement le coût.

  • Fine-tuning complet : qualité maximale, coût maximal.
  • LoRA : entraîne des matrices adaptatrices, coût bien moindre.
  • QLoRA : quantifie la base et réduit aussi la VRAM nécessaire.

Choisir l'instance et le mode de paiement

Comparez fournisseurs et types d'instances avant de lancer le job. L'écart de prix horaire entre fournisseurs peut être énorme pour un même entraînement.

  1. Définissez taille de modèle, tokens d'entraînement et type d'ajustement.
  2. Choisissez le cluster GPU et une MFU réaliste.
  3. Comparez le coût total entre fournisseurs et instances.
  4. Envisagez le spot si vous tolerez les interruptions avec checkpoints fréquents.

Foire aux questions

Il estime la dépense de calcul totale pour entraîner ou affiner un modèle de machine learning. Il utilise la formule FLOP Chinchilla 6ND (FLOP = 6 × paramètres × tokens d'entraînement), combinée aux spécifications du cluster GPU et à l'utilisation FLOP du modèle, pour estimer la durée et le coût de calcul cloud total.

La loi d'échelle Chinchilla (Hoffmann et al., 2022) a établi qu'entraîner un transformer nécessite environ 6 × N × D FLOP, où N est le nombre de paramètres et D le nombre de tokens d'entraînement. Elle couvre la passe avant (2ND FLOP) et la passe arrière (4ND FLOP). C'est la base standard de tout calculateur sérieux.

La MFU est la fraction du pic TFLOPS théorique réellement atteinte. Un run parfaitement optimisé sur H100 atteint 50-55 % de MFU. Les runs de production multi-nœuds atteignent souvent 40-50 %. Les runs mal optimisés ou limités par la mémoire tombent à 25-35 %. Pour une estimation prudente, utilisez 35-40 % ; avec FlashAttention et des pipelines efficaces, 45-50 % est réaliste.

À l'échelle Chinchilla optimale (7B paramètres × ~140B tokens), avec 8× A100 80 Go sur Lambda Labs (~10,32 $/h par nœud) : FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. À 40 % de MFU sur 8× A100 (312 TFLOPS chacune) : ~165 heures → ~1 700 $ de calcul. Avec des instances spot AWS, ~600 $. Ce calculateur produit ces estimations automatiquement.

LoRA (Low-Rank Adaptation) gèle les poids de base et ajoute de petites matrices adaptatrices entraînables. Comme seulement 0,1-5 % des paramètres ont des gradients, les FLOP de la passe arrière chutent. Pour un 7B avec 1 % de paramètres entraînables sur 500M de tokens, les FLOP effectifs de LoRA sont environ 1/50 du fine-tuning complet - réduisant la durée de plusieurs jours à quelques heures sur une seule A100.

Les instances spot offrent 55-70 % d'économies mais peuvent être interrompues. Elles conviennent aux travaux avec checkpointing fréquent (toutes les 30-60 minutes) et logique de reprise. Pour des entraînements critiques avec délais serrés, l'à-la-demande est plus sûr. Pour les expériences budgétées et les ajustements de moins de 24 heures, les spot offrent souvent un meilleur ROI.

Oui. Il fonctionne 100 % dans votre navigateur. Taille du modèle, paramètres du jeu de données, configurations GPU et projections de coûts sont calculés localement sur votre appareil et jamais envoyés à un serveur. Aucun compte requis, aucune donnée conservée.

Elles sont directionnellement justes pour la planification. Les coûts réels dépendent de la MFU atteinte, de la disponibilité spot, de la surcharge de checkpoints et des redémarrages. Pour affiner, lancez un pilote court (1 000 pas), mesurez la MFU réelle et les tokens/seconde, puis extrapolez. Le calculateur accepte votre MFU mesurée.