Калькулятор стоимости обучения
Оцените расходы на обучение модели по GPU, эпохам и размерам датасета — бесплатно и на 100 % приватно в браузере. Используется отраслевая формула FLOP Chinchilla 6ND с настраиваемой утилизацией FLOP модели. Сравните полный fine-tuning, LoRA и QLoRA по 12+ облачным инстансам AWS, GCP, Azure, Lambda Labs, RunPod и Vast.ai. Получите общую стоимость, время по настенным часам, токены в секунду и ранжированное сравнение провайдеров.
Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.
7B model fine-tune on 1B tokens - single 8× A100 node
Training Type
Model & Dataset
Effective Tokens
1.0B
dataset × epochs
GPU Cluster
Additional Costs
Estimated Total Training Cost
Compute Cost
$382.93
Overhead
$57.44
Storage + Network
$70.00
GPU Hours
93
Wall-Clock Time
11.7 hrs
11.7 hrs total
Tokens / Second
23,771
across 8 GPUs
Cost / Billion Tokens
$440.37
compute only
Training Computation Summary
Cloud Instance Comparison
Same GPU count as selected, sorted cheapest first| Instance | Wall-Clock | Compute Cost | Total |
|---|---|---|---|
Vast.ai1× RTX 4090 (avg) NVIDIA RTX 4090 | 3.7 days | $30.93 | $35.57 |
Lambda Labs8× H100 SXM NVIDIA H100 SXM | 1.8 hrs | $49.37 | $56.78 |
RunPod1× H100 SXM NVIDIA H100 SXM | 14.7 hrs | $51.44 | $59.15 |
Vast.ai1× A100 80 GB (avg) NVIDIA A100 80 GB | 3.9 days | $130.88 | $150.51 |
RunPod1× A100 80 GB NVIDIA A100 80 GB | 3.9 days | $153.31 | $176.31 |
AWSp5.48xlarge (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
GCPa3-highgpu-8g (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureND H100 v5 (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureNC A100 v4 (1× A100) NVIDIA A100 80 GB | 3.9 days | $343.08 | $394.54 |
AWSp4d.24xlarge (8× A100) Selected NVIDIA A100 40 GB | 11.7 hrs | $382.93 | $440.37 |
* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.
Как оцениваются вычислительные затраты на обучение
Отправная точка — формула Chinchilla 6ND: FLOP = 6 × параметры × токены обучения. Из неё выводятся время и стоимость.
MFU — ключевой поправочный коэффициент: он превращает теоретические FLOP в реальное время.
- FLOP = 6 × параметры модели × токены обучения.
- Время = FLOP ÷ (пиковые TFLOPS × MFU × число GPU).
- Стоимость = время × цена часа инстанса.
Полный fine-tuning против LoRA и QLoRA
Полное дообучение обновляет все веса и требует много памяти и вычислений. LoRA и QLoRA обучают минимальную долю параметров и резко снижают стоимость.
- Полный fine-tuning: максимальное качество, максимальная цена.
- LoRA: обучает матрицы-адаптеры, стоимость намного ниже.
- QLoRA: квантизует базу и дополнительно снижает потребность в VRAM.
Выбор инстанса и способа оплаты
Сравните провайдеров и типы инстансов до запуска. Разница в цене часа между провайдерами для одного и того же обучения может быть огромной.
- Задайте размер модели, токены обучения и тип дообучения.
- Выберите GPU-кластер и реалистичную MFU.
- Сравните общую стоимость по провайдерам и инстансам.
- Рассмотрите spot, если терпите прерывания при частых чекпойнтах.
Часто задаваемые вопросы
Он оценивает общие вычислительные расходы на обучение или дообучение ML-модели. Используется формула FLOP Chinchilla 6ND (FLOP = 6 × параметры × токены обучения) вместе с характеристиками GPU-кластера и утилизацией FLOP модели, чтобы оценить время и общую стоимость облачных вычислений.
Закон масштабирования Chinchilla (Hoffmann et al., 2022) установил, что обучение трансформера требует примерно 6 × N × D FLOP, где N — число параметров, D — число токенов обучения. Формула учитывает прямой проход (2ND FLOP) и обратный (4ND FLOP). Это стандартная основа любого серьёзного калькулятора стоимости обучения.
MFU — доля теоретического пика TFLOPS, которую реально достигает обучение. Идеально оптимизированный запуск на H100 достигает 50–55 % MFU. Продакшн-запуски с многоузловой коммуникацией обычно дают 40–50 %. Плохо оптимизированные или ограниченные памятью падают до 25–35 %. Для консервативной оценки берите 35–40 %; с FlashAttention и эффективными пайплайнами данных реально 45–50 %.
При оптимальном по Chinchilla масштабе (7B × ~140B токенов) на 8× A100 80GB в Lambda Labs (~10,32 $/ч за узел): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21. При 40 % MFU на 8× A100 (по 312 TFLOPS): ~165 часов → ~1 700 $ вычислений. На spot-инстансах AWS — около 600 $.
LoRA (Low-Rank Adaptation) замораживает базовые веса и добавляет небольшие обучаемые матрицы-адаптеры. Поскольку градиенты есть лишь у 0,1–5 % параметров, число FLOP в обратном проходе резко падает. Для 7B с 1 % обучаемых параметров на 500M токенов эффективные FLOP LoRA примерно в 50 раз меньше полного fine-tuning — время сокращается с дней до часов на одной A100.
Spot-инстансы экономят 55–70 %, но могут быть прерваны провайдером. Они подходят для задач с частыми чекпойнтами (каждые 30–60 минут) и логикой перезапуска. Для критичных обучений с жёсткими сроками безопаснее режим по требованию. Для бюджетных экспериментов и дообучения до 24 часов spot обычно дают лучшую отдачу.
Да. Он работает на 100 % в браузере. Размер модели, параметры датасета, конфигурации GPU и прогнозы затрат рассчитываются локально на устройстве и никогда не отправляются на сервер. Аккаунт не требуется, данные не сохраняются.
Они верны по направлению для планирования. Реальные затраты зависят от достигнутой MFU, наличия spot, накладных расходов на чекпойнты и перезапусков. Для большей точности запустите короткий пилот (1 000 шагов), измерьте MFU и токены/с и экстраполируйте. Калькулятор позволяет ввести измеренную MFU.