Kalkulator Biaya Pelatihan
Estimasi biaya pelatihan model memakai GPU, epoch, dan ukuran dataset — gratis dan 100 % privat di browser Anda. Memakai formula FLOP standar industri Chinchilla 6ND dengan utilisasi FLOP model yang dapat dikonfigurasi. Bandingkan full fine-tuning, LoRA, dan QLoRA di 12+ instans cloud dari AWS, GCP, Azure, Lambda Labs, RunPod, dan Vast.ai. Dapatkan total biaya pelatihan, waktu nyata, token per detik, dan perbandingan penyedia berperingkat.
Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.
7B model fine-tune on 1B tokens - single 8× A100 node
Training Type
Model & Dataset
Effective Tokens
1.0B
dataset × epochs
GPU Cluster
Additional Costs
Estimated Total Training Cost
Compute Cost
$382.93
Overhead
$57.44
Storage + Network
$70.00
GPU Hours
93
Wall-Clock Time
11.7 hrs
11.7 hrs total
Tokens / Second
23,771
across 8 GPUs
Cost / Billion Tokens
$440.37
compute only
Training Computation Summary
Cloud Instance Comparison
Same GPU count as selected, sorted cheapest first| Instance | Wall-Clock | Compute Cost | Total |
|---|---|---|---|
Vast.ai1× RTX 4090 (avg) NVIDIA RTX 4090 | 3.7 days | $30.93 | $35.57 |
Lambda Labs8× H100 SXM NVIDIA H100 SXM | 1.8 hrs | $49.37 | $56.78 |
RunPod1× H100 SXM NVIDIA H100 SXM | 14.7 hrs | $51.44 | $59.15 |
Vast.ai1× A100 80 GB (avg) NVIDIA A100 80 GB | 3.9 days | $130.88 | $150.51 |
RunPod1× A100 80 GB NVIDIA A100 80 GB | 3.9 days | $153.31 | $176.31 |
AWSp5.48xlarge (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
GCPa3-highgpu-8g (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureND H100 v5 (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureNC A100 v4 (1× A100) NVIDIA A100 80 GB | 3.9 days | $343.08 | $394.54 |
AWSp4d.24xlarge (8× A100) Selected NVIDIA A100 40 GB | 11.7 hrs | $382.93 | $440.37 |
* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.
Bagaimana komputasi pelatihan diestimasi
Titik awalnya adalah formula Chinchilla 6ND: FLOP = 6 × parameter × token pelatihan. Dari sana diturunkan waktu dan biaya.
MFU adalah faktor koreksi kunci: mengubah FLOP teoretis menjadi waktu nyata.
- FLOP = 6 × parameter model × token pelatihan.
- Waktu = FLOP ÷ (TFLOPS puncak × MFU × jumlah GPU).
- Biaya = waktu × harga per jam instans.
Full fine-tuning vs LoRA dan QLoRA
Fine-tuning penuh memperbarui semua bobot dan menuntut memori serta komputasi besar. LoRA dan QLoRA hanya melatih sebagian kecil parameter dan menekan biaya drastis.
- Full fine-tuning: kualitas maksimal, biaya maksimal.
- LoRA: melatih matriks adaptor, biaya jauh lebih rendah.
- QLoRA: mengkuantisasi basis dan juga menurunkan kebutuhan VRAM.
Memilih instans dan cara pembayaran
Bandingkan penyedia dan jenis instans sebelum memulai. Selisih harga per jam antar penyedia bisa sangat besar untuk pelatihan yang sama.
- Tentukan ukuran model, token pelatihan, dan jenis fine-tuning.
- Pilih cluster GPU dan MFU yang realistis.
- Bandingkan total biaya antar penyedia dan instans.
- Pertimbangkan spot bila Anda toleran interupsi dengan checkpoint sering.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan total biaya komputasi untuk melatih atau menyempurnakan model machine learning. Alat ini memakai formula FLOP Chinchilla 6ND (FLOP = 6 × parameter × token pelatihan) dikombinasikan dengan spesifikasi cluster GPU dan utilisasi FLOP model untuk mengestimasi waktu nyata dan total biaya komputasi cloud.
Hukum skala Chinchilla (Hoffmann et al., 2022) menetapkan bahwa melatih transformer membutuhkan sekitar 6 × N × D FLOP, dengan N jumlah parameter dan D jumlah token pelatihan. Formula ini mencakup forward pass (2ND FLOP) dan backward pass (4ND FLOP). Ini dasar standar setiap kalkulator biaya pelatihan yang serius.
MFU adalah fraksi TFLOPS puncak teoretis yang benar-benar dicapai pelatihan. Pelatihan yang dioptimalkan sempurna di H100 mencapai 50-55 % MFU. Pelatihan produksi dengan komunikasi multi-node biasanya 40-50 %. Pelatihan yang kurang optimal atau terikat memori bisa turun ke 25-35 %. Untuk estimasi konservatif, pakai 35-40 %; dengan FlashAttention dan pipeline data efisien, 45-50 % realistis.
Pada skala optimal Chinchilla (7B parameter × ~140B token), memakai 8× A100 80GB di Lambda Labs (~US$ 10,32/jam per node): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. Pada 40 % MFU dengan 8× A100 (312 TFLOPS masing-masing): ~165 jam → ~US$ 1.700 komputasi. Dengan instans spot AWS, turun ke ~US$ 600.
LoRA (Low-Rank Adaptation) membekukan bobot model dasar dan menambahkan matriks adaptor kecil yang dapat dilatih. Karena hanya 0,1-5 % parameter yang punya gradien, jumlah FLOP backward pass turun drastis. Untuk model 7B dengan 1 % parameter terlatih pada 500M token, FLOP efektif LoRA sekitar 1/50 dari full fine-tuning — memangkas waktu dari hari menjadi jam di satu A100.
Instans spot menghemat 55-70 % tetapi bisa dihentikan penyedia. Cocok untuk pekerjaan dengan checkpointing sering (setiap 30-60 menit) dan logika restart. Untuk pelatihan kritis dengan tenggat ketat, on-demand lebih aman. Untuk eksperimen beranggaran ketat dan fine-tuning di bawah 24 jam, spot biasanya memberi ROI lebih baik.
Ya. Alat ini berjalan 100 % di browser Anda. Ukuran model, parameter dataset, konfigurasi GPU, dan semua proyeksi biaya dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak perlu akun dan tidak ada data yang disimpan.
Estimasi akurat secara arah untuk perencanaan. Biaya nyata bergantung pada MFU yang dicapai, ketersediaan spot, overhead checkpoint, dan restart karena kegagalan. Untuk estimasi lebih ketat, jalankan pilot singkat (1.000 langkah), ukur MFU nyata dan token/detik, lalu ekstrapolasi. Kalkulator memungkinkan Anda memasukkan MFU terukur.