Перейти к содержимому
Aback Tools Logo

Калькулятор стоимости обучения

Оцените расходы на обучение модели по GPU, эпохам и размерам датасета — бесплатно и на 100 % приватно в браузере. Используется отраслевая формула FLOP Chinchilla 6ND с настраиваемой утилизацией FLOP модели. Сравните полный fine-tuning, LoRA и QLoRA по 12+ облачным инстансам AWS, GCP, Azure, Lambda Labs, RunPod и Vast.ai. Получите общую стоимость, время по настенным часам, токены в секунду и ранжированное сравнение провайдеров.

Training Cost Calculator

Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.

7B model fine-tune on 1B tokens - single 8× A100 node

Training Type

Model & Dataset

B params
B tokens
epochs

Effective Tokens

1.0B

dataset × epochs

GPU Cluster

GPU: NVIDIA A100 40 GBVRAM: 40 GBFP16: 312 TFLOPSOn-Demand: $32.77/hrSpot: $11.47/hr
GPUs
40%
10%70%

Additional Costs

$
$
%

Estimated Total Training Cost

$510.3711.7 hrs wall-clock

Compute Cost

$382.93

Overhead

$57.44

Storage + Network

$70.00

GPU Hours

93

Cheapest option: Vast.ai 1× RTX 4090 (avg) - $35.57 (saves $404.79)

Wall-Clock Time

11.7 hrs

11.7 hrs total

Tokens / Second

23,771

across 8 GPUs

Cost / Billion Tokens

$440.37

compute only

Training Computation Summary

Model Size7B params
Dataset (effective)1.0B tokens
Training TypeFull Fine-Tune
Total FLOPs42.00 EFLOPs
Cluster8× NVIDIA A100 40 GB
Instances1 × p4d.24xlarge (8× A100)
MFU40%
Spot / PreemptibleNo
Effective $/hr$32.77/instance/hr
Instance Hours11.7 hrs

Cloud Instance Comparison

Same GPU count as selected, sorted cheapest first
InstanceWall-ClockCompute CostTotal
Vast.ai1× RTX 4090 (avg)
NVIDIA RTX 4090
3.7 days$30.93$35.57
Lambda Labs8× H100 SXM
NVIDIA H100 SXM
1.8 hrs$49.37$56.78
RunPod1× H100 SXM
NVIDIA H100 SXM
14.7 hrs$51.44$59.15
Vast.ai1× A100 80 GB (avg)
NVIDIA A100 80 GB
3.9 days$130.88$150.51
RunPod1× A100 80 GB
NVIDIA A100 80 GB
3.9 days$153.31$176.31
AWSp5.48xlarge (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
GCPa3-highgpu-8g (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureND H100 v5 (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureNC A100 v4 (1× A100)
NVIDIA A100 80 GB
3.9 days$343.08$394.54
AWSp4d.24xlarge (8× A100) Selected
NVIDIA A100 40 GB
11.7 hrs$382.93$440.37

* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.

Disclaimer: Training cost estimates use the Chinchilla 6ND FLOPs approximation and may differ from actual results depending on architecture-specific overheads, communication patterns, optimizer choice, and hardware-specific MFU. Cloud prices are approximate and change frequently - verify with provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Как оцениваются вычислительные затраты на обучение

Отправная точка — формула Chinchilla 6ND: FLOP = 6 × параметры × токены обучения. Из неё выводятся время и стоимость.

MFU — ключевой поправочный коэффициент: он превращает теоретические FLOP в реальное время.

  • FLOP = 6 × параметры модели × токены обучения.
  • Время = FLOP ÷ (пиковые TFLOPS × MFU × число GPU).
  • Стоимость = время × цена часа инстанса.

Полный fine-tuning против LoRA и QLoRA

Полное дообучение обновляет все веса и требует много памяти и вычислений. LoRA и QLoRA обучают минимальную долю параметров и резко снижают стоимость.

  • Полный fine-tuning: максимальное качество, максимальная цена.
  • LoRA: обучает матрицы-адаптеры, стоимость намного ниже.
  • QLoRA: квантизует базу и дополнительно снижает потребность в VRAM.

Выбор инстанса и способа оплаты

Сравните провайдеров и типы инстансов до запуска. Разница в цене часа между провайдерами для одного и того же обучения может быть огромной.

  1. Задайте размер модели, токены обучения и тип дообучения.
  2. Выберите GPU-кластер и реалистичную MFU.
  3. Сравните общую стоимость по провайдерам и инстансам.
  4. Рассмотрите spot, если терпите прерывания при частых чекпойнтах.

Часто задаваемые вопросы

Он оценивает общие вычислительные расходы на обучение или дообучение ML-модели. Используется формула FLOP Chinchilla 6ND (FLOP = 6 × параметры × токены обучения) вместе с характеристиками GPU-кластера и утилизацией FLOP модели, чтобы оценить время и общую стоимость облачных вычислений.

Закон масштабирования Chinchilla (Hoffmann et al., 2022) установил, что обучение трансформера требует примерно 6 × N × D FLOP, где N — число параметров, D — число токенов обучения. Формула учитывает прямой проход (2ND FLOP) и обратный (4ND FLOP). Это стандартная основа любого серьёзного калькулятора стоимости обучения.

MFU — доля теоретического пика TFLOPS, которую реально достигает обучение. Идеально оптимизированный запуск на H100 достигает 50–55 % MFU. Продакшн-запуски с многоузловой коммуникацией обычно дают 40–50 %. Плохо оптимизированные или ограниченные памятью падают до 25–35 %. Для консервативной оценки берите 35–40 %; с FlashAttention и эффективными пайплайнами данных реально 45–50 %.

При оптимальном по Chinchilla масштабе (7B × ~140B токенов) на 8× A100 80GB в Lambda Labs (~10,32 $/ч за узел): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. При 40 % MFU на 8× A100 (по 312 TFLOPS): ~165 часов → ~1 700 $ вычислений. На spot-инстансах AWS — около 600 $.

LoRA (Low-Rank Adaptation) замораживает базовые веса и добавляет небольшие обучаемые матрицы-адаптеры. Поскольку градиенты есть лишь у 0,1–5 % параметров, число FLOP в обратном проходе резко падает. Для 7B с 1 % обучаемых параметров на 500M токенов эффективные FLOP LoRA примерно в 50 раз меньше полного fine-tuning — время сокращается с дней до часов на одной A100.

Spot-инстансы экономят 55–70 %, но могут быть прерваны провайдером. Они подходят для задач с частыми чекпойнтами (каждые 30–60 минут) и логикой перезапуска. Для критичных обучений с жёсткими сроками безопаснее режим по требованию. Для бюджетных экспериментов и дообучения до 24 часов spot обычно дают лучшую отдачу.

Да. Он работает на 100 % в браузере. Размер модели, параметры датасета, конфигурации GPU и прогнозы затрат рассчитываются локально на устройстве и никогда не отправляются на сервер. Аккаунт не требуется, данные не сохраняются.

Они верны по направлению для планирования. Реальные затраты зависят от достигнутой MFU, наличия spot, накладных расходов на чекпойнты и перезапусков. Для большей точности запустите короткий пилот (1 000 шагов), измерьте MFU и токены/с и экстраполируйте. Калькулятор позволяет ввести измеренную MFU.