Trainingskostenrechner
Schätzen Sie Modell-Trainingskosten über GPUs, Epochen und Datensatzgrößen – kostenlos und 100 % privat im Browser. Nutzt die branchenübliche Chinchilla-6ND-FLOP-Formel mit konfigurierbarer Model-FLOP-Utilisation. Vergleichen Sie Full-Fine-Tuning, LoRA und QLoRA über 12+ Cloud-Instanzen von AWS, GCP, Azure, Lambda Labs, RunPod und Vast.ai. Erhalten Sie Gesamtkosten, Wanduhrzeit, Tokens pro Sekunde und einen gerankten Anbietervergleich.
Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.
7B model fine-tune on 1B tokens - single 8× A100 node
Training Type
Model & Dataset
Effective Tokens
1.0B
dataset × epochs
GPU Cluster
Additional Costs
Estimated Total Training Cost
Compute Cost
$382.93
Overhead
$57.44
Storage + Network
$70.00
GPU Hours
93
Wall-Clock Time
11.7 hrs
11.7 hrs total
Tokens / Second
23,771
across 8 GPUs
Cost / Billion Tokens
$440.37
compute only
Training Computation Summary
Cloud Instance Comparison
Same GPU count as selected, sorted cheapest first| Instance | Wall-Clock | Compute Cost | Total |
|---|---|---|---|
Vast.ai1× RTX 4090 (avg) NVIDIA RTX 4090 | 3.7 days | $30.93 | $35.57 |
Lambda Labs8× H100 SXM NVIDIA H100 SXM | 1.8 hrs | $49.37 | $56.78 |
RunPod1× H100 SXM NVIDIA H100 SXM | 14.7 hrs | $51.44 | $59.15 |
Vast.ai1× A100 80 GB (avg) NVIDIA A100 80 GB | 3.9 days | $130.88 | $150.51 |
RunPod1× A100 80 GB NVIDIA A100 80 GB | 3.9 days | $153.31 | $176.31 |
AWSp5.48xlarge (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
GCPa3-highgpu-8g (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureND H100 v5 (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureNC A100 v4 (1× A100) NVIDIA A100 80 GB | 3.9 days | $343.08 | $394.54 |
AWSp4d.24xlarge (8× A100) Selected NVIDIA A100 40 GB | 11.7 hrs | $382.93 | $440.37 |
* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.
Wie die Trainings-Compute geschätzt wird
Ausgangspunkt ist die Chinchilla-6ND-Formel: FLOPs = 6 × Parameter × Trainings-Tokens. Daraus ergeben sich Zeit und Kosten.
Die MFU ist der entscheidende Korrekturfaktor: Sie wandelt theoretische FLOPs in reale Zeit um.
- FLOPs = 6 × Modellparameter × Trainings-Tokens.
- Zeit = FLOPs ÷ (Peak-TFLOPS × MFU × Anzahl GPUs).
- Kosten = Zeit × Stundensatz der Instanz.
Full-Fine-Tuning vs. LoRA und QLoRA
Full-Fine-Tuning aktualisiert alle Gewichte und erfordert viel Speicher und Compute. LoRA und QLoRA trainieren nur einen minimalen Parameteranteil und senken die Kosten stark.
- Full-Fine-Tuning: maximale Qualität, maximale Kosten.
- LoRA: trainiert Adapter-Matrizen, deutlich geringere Kosten.
- QLoRA: quantisiert die Basis und senkt zusätzlich den VRAM-Bedarf.
Instanz und Zahlungsmodell wählen
Vergleichen Sie Anbieter und Instanztypen vor dem Start. Der Stundensatzunterschied zwischen Anbietern kann enorm sein.
- Legen Sie Modellgröße, Trainings-Tokens und Fine-Tuning-Typ fest.
- Wählen Sie das GPU-Cluster und eine realistische MFU.
- Vergleichen Sie die Gesamtkosten zwischen Anbietern und Instanzen.
- Erwägen Sie Spot, wenn Sie Unterbrechungen mit häufigem Checkpointing tolerieren.
Häufig gestellte Fragen
Er schätzt die gesamten Compute-Kosten für das Training oder Fine-Tuning eines ML-Modells. Er nutzt die Chinchilla-6ND-FLOP-Formel (FLOPs = 6 × Parameter × Trainings-Tokens) kombiniert mit GPU-Cluster-Spezifikationen und Model-FLOP-Utilisation, um Wanduhrzeit und Gesamtkosten der Cloud-Compute zu schätzen.
Das Chinchilla-Scaling-Gesetz (Hoffmann et al., 2022) zeigt, dass das Training eines Transformers etwa 6 × N × D FLOPs benötigt, wobei N die Parameterzahl und D die Anzahl der Trainings-Tokens ist. Sie umfasst Vorwärtspass (2ND FLOPs) und Rückwärtspass (4ND FLOPs). Sie ist die Standardgrundlage jedes seriösen Trainingskostenrechners.
Die MFU ist der Anteil der theoretischen Peak-TFLOPS, den ein Trainingslauf tatsächlich erreicht. Ein perfekt optimierter Lauf auf H100 erreicht 50-55 % MFU. Produktionsläufe mit Multinode-Kommunikation erreichen meist 40-50 %. Schlecht optimierte oder speichergebundene Läufe fallen auf 25-35 %. Für eine konservative Schätzung 35-40 % nutzen; mit FlashAttention und effizienten Datenpipelines sind 45-50 % realistisch.
Bei Chinchilla-optimalem Maßstab (7B × ~140B Tokens) mit 8× A100 80GB auf Lambda Labs (~10,32 $/h pro Knoten): FLOPs ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. Bei 40 % MFU auf 8× A100 (je 312 TFLOPS): ~165 Stunden → ~1.700 $ Compute. Mit AWS-Spot-Instanzen sinken die Kosten auf ~600 $.
LoRA (Low-Rank Adaptation) friert die Basismodellgewichte ein und fügt kleine trainierbare Adapter-Matrizen hinzu. Da nur 0,1-5 % der Parameter Gradienten haben, sinkt die FLOP-Zahl im Rückwärtspass drastisch. Für ein 7B-Modell mit 1 % trainierbaren Parametern und 500M Tokens betragen die effektiven LoRA-FLOPs etwa 1/50 des Full-Fine-Tunings – von Tagen auf Stunden auf einer A100.
Spot-Instanzen sparen 55-70 %, können aber vom Anbieter unterbrochen werden. Sie eignen sich für Jobs mit häufigem Checkpointing (alle 30-60 Minuten) und Neustartlogik. Für kritische Trainingsläufe mit engem Zeitplan ist On-Demand sicherer. Für budgetbewusste Experimente und Fine-Tunings unter 24 Stunden bieten Spot-Instanzen meist besseren ROI.
Ja. Er läuft 100 % im Browser. Modellgröße, Datensatzparameter, GPU-Konfigurationen und Kostenprojektionen werden lokal auf Ihrem Gerät berechnet und nie an einen Server gesendet. Kein Konto erforderlich, keine Daten werden gespeichert.
Sie sind für die Planung richtungsweisend genau. Tatsächliche Kosten hängen von der erreichten MFU, Spot-Verfügbarkeit, Checkpoint-Overhead und Neustarts ab. Für eine genauere Schätzung führen Sie einen kurzen Pilotlauf (1.000 Schritte) durch, messen MFU und Tokens/Sekunde und extrapolieren. Der Rechner akzeptiert Ihre gemessene MFU.