Калькулятор стоимости хостинга LLM
Рассчитайте стоимость инфраструктуры для самостоятельного размещения большой языковой модели — бесплатно и на 100 % приватно в браузере. Сравните аренду облачных GPU (RunPod, Vast.ai, Lambda Labs, AWS), управляемый serverless-инференс (Together AI, Groq, Fireworks AI, DeepInfra) и собственное железо для популярных открытых моделей: Llama 3.1, Mistral, Qwen, DeepSeek и Gemma. Включены проверка совместимости по VRAM, расчёт с учётом квантизации, оценка стоимости запроса и полная сравнительная таблица.
Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.
Model to Host
Strong open-source frontier model
Deployment Option
Cloud GPU (Self-Managed)
Managed Inference (Serverless)
On-Premises Hardware
Usage & Scale
RunPod - A100 80GB
Monthly Cost
$787.20
Annual Cost
$9,577.60
Cost / Request
$0.0052
Cost / 1K Tokens
$0.0028
Monthly Cost Breakdown
All Options - Monthly Estimate
Sorted by cost| Option | Type | Monthly | Fits Model |
|---|---|---|---|
Groq - Llama 3.1 70B | Managed | $180.15 | ✓ Serverless |
DeepInfra - Llama 3.1 70B | Managed | $185.25 | ✓ Serverless |
Together AI - Llama 3.1 70B | Managed | $250.80 | ✓ Serverless |
Fireworks AI - Llama 3.1 70B | Managed | $256.50 | ✓ Serverless |
Vast.ai - A100 80GB | Cloud GPU | $672.00 | ✓ 80 GB VRAM |
RunPod - A100 80GB Selected | Cloud GPU | $787.20 | ✓ 80 GB VRAM |
On-Prem - A100 80GB Server | On-Prem | $850.00 | ✓ 80 GB VRAM |
RunPod - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
Lambda Labs - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
On-Prem - 8× A100 DGX | On-Prem | $5,833.33 | ✓ 5120 GB VRAM |
AWS p4d.24xlarge - 8× A100 | Cloud GPU | $15,732.48 | ✓ 320 GB VRAM |
On-Prem - RTX 4090 (×1) | On-Prem | - | ✗ 72GB needed |
Vast.ai - RTX 4090 | Cloud GPU | - | ✗ 72GB needed |
AWS g5.xlarge - A10G | Cloud GPU | - | ✗ 72GB needed |
Throughput Estimate
Tokens / Sec
132
Tokens / Day
7,603,200
Req / Sec
0.3
Max Daily Req
19,008
Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.
Три способа хостинга LLM
Самостоятельный хостинг — не одно и то же: можно арендовать GPU по часам, платить за управляемый инференс по токенам или купить железо. Каждая модель затрат выигрывает в своём сценарии.
Выбор в первую очередь зависит от постоянства нагрузки: арендованная GPU стоит одинаково и когда занята, и когда простаивает.
- Аренда GPU: фиксированный часовой тариф, стек обслуживаете вы.
- Управляемый инференс: оплата за токены, без затрат на простой.
- Своё железо: начальные вложения, ниже стоимость часа в долгую.
VRAM и квантизация
Прежде чем сравнивать цены, проверьте, влезает ли модель в рассматриваемую GPU. Квантизация — самый прямой рычаг снижения потребности в VRAM.
- FP16/BF16: 2 байта на параметр.
- INT8: вдвое меньше VRAM, минимальная потеря качества.
- INT4: четверть VRAM, на 1–5 % ниже качество по бенчмаркам.
Загрузка и стоимость запроса
Цена за час — лишь половина картины. Реальная загрузка определяет, какая доля тарифа превращается в полезную работу.
- Оцените суточные токены и запросы в минуту в часы пик.
- Рассчитайте ожидаемую загрузку по вашему профилю трафика.
- Разделите часовые затраты на фактически обслуженные запросы.
- Сравните эту стоимость запроса с управляемым API.
Часто задаваемые вопросы
Он оценивает инфраструктурные расходы на самостоятельный запуск большой языковой модели: на арендованных облачных GPU, управляемых serverless-API инференса или собственном железе. Он помогает разработчикам и командам сравнивать варианты развёртывания, считать затраты за запрос и за месяц, проверять требования к VRAM и решать, выгоднее ли свой хостинг, чем управляемые API. Калькулятор работает на 100 % в браузере без регистрации.
Точка окупаемости зависит от объёма запросов и выбора модели. При малом объёме (менее 500 тыс. токенов в день) управляемые API обычно дешевле, так как нет затрат на простаивающие GPU. При большом объёме (более 5 млн токенов в день) аренда выделенной GPU или своё железо обходится обычно на 60–90 % дешевле за токен, чем управляемые API для сопоставимых открытых моделей.
Llama 3.1 70B требует примерно 140 ГБ VRAM в точности FP16/BF16 (2× A100 80GB), ~72 ГБ в INT8 (1× H100 80GB) и ~40 ГБ в квантизации INT4 (1× A100 80GB). Наш калькулятор автоматически показывает требования к VRAM при выборе модели и уровня квантизации и отмечает совместимые варианты развёртывания.
Это доля активного времени, когда GPU реально обрабатывает запросы инференса. Низкая загрузка (20–30 %) означает, что вы платите за простой вычислений, увеличивая эффективную стоимость запроса. Высокая загрузка (70–90 %) лучше амортизирует часовой тариф по большему числу запросов. Продакшн-серверы инференса с непрерывным батчингом (vLLM, TGI) обычно достигают 50–80 % при постоянной нагрузке.
Аренда облачной GPU (RunPod, Vast.ai, Lambda Labs, AWS) даёт выделенную GPU по фиксированному часовому тарифу: вы сами устанавливаете и обслуживаете стек сервинга. Управляемый инференс (Together AI, Groq, Fireworks AI) берёт на себя всю инфраструктуру и берёт плату за потреблённые токены, без затрат на простой. Аренда GPU лучше для стабильных высоких нагрузок; управляемый инференс — для непредсказуемого или небольшого использования.
Квантизация снижает точность весов с FP16 (2 байта/параметр) до INT8 (1 байт) или INT4 (0,5 байта), сокращая потребность в VRAM на 50–75 %. Это позволяет запускать модель 70B на более дешёвом железе или уместить более крупную модель на той же GPU. Квантизация INT4 (GGUF Q4, AWQ, GPTQ) снижает качество на 1–5 % в большинстве бенчмарков — приемлемо для многих продакшн-сценариев.
Они основаны на опубликованных бенчмарках для каждой модели на железе H100 SXM с масштабированием по числу GPU и загрузке. Реальная пропускная способность зависит от вашего фреймворка (vLLM, TGI, Ollama), размера батча, длины контекста и конфигурации железа. Считайте их оценками порядка величины для планирования мощности.
Да. Калькулятор работает полностью в браузере на клиентском JavaScript. Выбор моделей, объёмы использования, инфраструктурные затраты и все результаты вычисляются локально на вашем устройстве и никогда не передаются на сервер. Аккаунт не требуется, данные нигде не сохраняются. Ваше планирование инфраструктуры остаётся полностью приватным и безопасным.