Lompat ke konten
Aback Tools Logo

Kalkulator Biaya Pelatihan

Estimasi biaya pelatihan model memakai GPU, epoch, dan ukuran dataset — gratis dan 100 % privat di browser Anda. Memakai formula FLOP standar industri Chinchilla 6ND dengan utilisasi FLOP model yang dapat dikonfigurasi. Bandingkan full fine-tuning, LoRA, dan QLoRA di 12+ instans cloud dari AWS, GCP, Azure, Lambda Labs, RunPod, dan Vast.ai. Dapatkan total biaya pelatihan, waktu nyata, token per detik, dan perbandingan penyedia berperingkat.

Training Cost Calculator

Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.

7B model fine-tune on 1B tokens - single 8× A100 node

Training Type

Model & Dataset

B params
B tokens
epochs

Effective Tokens

1.0B

dataset × epochs

GPU Cluster

GPU: NVIDIA A100 40 GBVRAM: 40 GBFP16: 312 TFLOPSOn-Demand: $32.77/hrSpot: $11.47/hr
GPUs
40%
10%70%

Additional Costs

$
$
%

Estimated Total Training Cost

$510.3711.7 hrs wall-clock

Compute Cost

$382.93

Overhead

$57.44

Storage + Network

$70.00

GPU Hours

93

Cheapest option: Vast.ai 1× RTX 4090 (avg) - $35.57 (saves $404.79)

Wall-Clock Time

11.7 hrs

11.7 hrs total

Tokens / Second

23,771

across 8 GPUs

Cost / Billion Tokens

$440.37

compute only

Training Computation Summary

Model Size7B params
Dataset (effective)1.0B tokens
Training TypeFull Fine-Tune
Total FLOPs42.00 EFLOPs
Cluster8× NVIDIA A100 40 GB
Instances1 × p4d.24xlarge (8× A100)
MFU40%
Spot / PreemptibleNo
Effective $/hr$32.77/instance/hr
Instance Hours11.7 hrs

Cloud Instance Comparison

Same GPU count as selected, sorted cheapest first
InstanceWall-ClockCompute CostTotal
Vast.ai1× RTX 4090 (avg)
NVIDIA RTX 4090
3.7 days$30.93$35.57
Lambda Labs8× H100 SXM
NVIDIA H100 SXM
1.8 hrs$49.37$56.78
RunPod1× H100 SXM
NVIDIA H100 SXM
14.7 hrs$51.44$59.15
Vast.ai1× A100 80 GB (avg)
NVIDIA A100 80 GB
3.9 days$130.88$150.51
RunPod1× A100 80 GB
NVIDIA A100 80 GB
3.9 days$153.31$176.31
AWSp5.48xlarge (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
GCPa3-highgpu-8g (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureND H100 v5 (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureNC A100 v4 (1× A100)
NVIDIA A100 80 GB
3.9 days$343.08$394.54
AWSp4d.24xlarge (8× A100) Selected
NVIDIA A100 40 GB
11.7 hrs$382.93$440.37

* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.

Disclaimer: Training cost estimates use the Chinchilla 6ND FLOPs approximation and may differ from actual results depending on architecture-specific overheads, communication patterns, optimizer choice, and hardware-specific MFU. Cloud prices are approximate and change frequently - verify with provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Bagaimana komputasi pelatihan diestimasi

Titik awalnya adalah formula Chinchilla 6ND: FLOP = 6 × parameter × token pelatihan. Dari sana diturunkan waktu dan biaya.

MFU adalah faktor koreksi kunci: mengubah FLOP teoretis menjadi waktu nyata.

  • FLOP = 6 × parameter model × token pelatihan.
  • Waktu = FLOP ÷ (TFLOPS puncak × MFU × jumlah GPU).
  • Biaya = waktu × harga per jam instans.

Full fine-tuning vs LoRA dan QLoRA

Fine-tuning penuh memperbarui semua bobot dan menuntut memori serta komputasi besar. LoRA dan QLoRA hanya melatih sebagian kecil parameter dan menekan biaya drastis.

  • Full fine-tuning: kualitas maksimal, biaya maksimal.
  • LoRA: melatih matriks adaptor, biaya jauh lebih rendah.
  • QLoRA: mengkuantisasi basis dan juga menurunkan kebutuhan VRAM.

Memilih instans dan cara pembayaran

Bandingkan penyedia dan jenis instans sebelum memulai. Selisih harga per jam antar penyedia bisa sangat besar untuk pelatihan yang sama.

  1. Tentukan ukuran model, token pelatihan, dan jenis fine-tuning.
  2. Pilih cluster GPU dan MFU yang realistis.
  3. Bandingkan total biaya antar penyedia dan instans.
  4. Pertimbangkan spot bila Anda toleran interupsi dengan checkpoint sering.

Pertanyaan yang Sering Diajukan

Alat ini memperkirakan total biaya komputasi untuk melatih atau menyempurnakan model machine learning. Alat ini memakai formula FLOP Chinchilla 6ND (FLOP = 6 × parameter × token pelatihan) dikombinasikan dengan spesifikasi cluster GPU dan utilisasi FLOP model untuk mengestimasi waktu nyata dan total biaya komputasi cloud.

Hukum skala Chinchilla (Hoffmann et al., 2022) menetapkan bahwa melatih transformer membutuhkan sekitar 6 × N × D FLOP, dengan N jumlah parameter dan D jumlah token pelatihan. Formula ini mencakup forward pass (2ND FLOP) dan backward pass (4ND FLOP). Ini dasar standar setiap kalkulator biaya pelatihan yang serius.

MFU adalah fraksi TFLOPS puncak teoretis yang benar-benar dicapai pelatihan. Pelatihan yang dioptimalkan sempurna di H100 mencapai 50-55 % MFU. Pelatihan produksi dengan komunikasi multi-node biasanya 40-50 %. Pelatihan yang kurang optimal atau terikat memori bisa turun ke 25-35 %. Untuk estimasi konservatif, pakai 35-40 %; dengan FlashAttention dan pipeline data efisien, 45-50 % realistis.

Pada skala optimal Chinchilla (7B parameter × ~140B token), memakai 8× A100 80GB di Lambda Labs (~US$ 10,32/jam per node): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. Pada 40 % MFU dengan 8× A100 (312 TFLOPS masing-masing): ~165 jam → ~US$ 1.700 komputasi. Dengan instans spot AWS, turun ke ~US$ 600.

LoRA (Low-Rank Adaptation) membekukan bobot model dasar dan menambahkan matriks adaptor kecil yang dapat dilatih. Karena hanya 0,1-5 % parameter yang punya gradien, jumlah FLOP backward pass turun drastis. Untuk model 7B dengan 1 % parameter terlatih pada 500M token, FLOP efektif LoRA sekitar 1/50 dari full fine-tuning — memangkas waktu dari hari menjadi jam di satu A100.

Instans spot menghemat 55-70 % tetapi bisa dihentikan penyedia. Cocok untuk pekerjaan dengan checkpointing sering (setiap 30-60 menit) dan logika restart. Untuk pelatihan kritis dengan tenggat ketat, on-demand lebih aman. Untuk eksperimen beranggaran ketat dan fine-tuning di bawah 24 jam, spot biasanya memberi ROI lebih baik.

Ya. Alat ini berjalan 100 % di browser Anda. Ukuran model, parameter dataset, konfigurasi GPU, dan semua proyeksi biaya dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak perlu akun dan tidak ada data yang disimpan.

Estimasi akurat secara arah untuk perencanaan. Biaya nyata bergantung pada MFU yang dicapai, ketersediaan spot, overhead checkpoint, dan restart karena kegagalan. Untuk estimasi lebih ketat, jalankan pilot singkat (1.000 langkah), ukur MFU nyata dan token/detik, lalu ekstrapolasi. Kalkulator memungkinkan Anda memasukkan MFU terukur.