Перейти к содержимому
Aback Tools Logo

Калькулятор стоимости хостинга LLM

Рассчитайте стоимость инфраструктуры для самостоятельного размещения большой языковой модели — бесплатно и на 100 % приватно в браузере. Сравните аренду облачных GPU (RunPod, Vast.ai, Lambda Labs, AWS), управляемый serverless-инференс (Together AI, Groq, Fireworks AI, DeepInfra) и собственное железо для популярных открытых моделей: Llama 3.1, Mistral, Qwen, DeepSeek и Gemma. Включены проверка совместимости по VRAM, расчёт с учётом квантизации, оценка стоимости запроса и полная сравнительная таблица.

LLM Hosting Cost Calculator

Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.

Model to Host

Strong open-source frontier model

VRAM Required72 GB
✓ Fits in A100 80GB (80 GB available)

Deployment Option

Cloud GPU (Self-Managed)

Managed Inference (Serverless)

On-Premises Hardware

Usage & Scale

hrs/day
%
reqs/day
tokens
tokens

RunPod - A100 80GB

Monthly Cost

$787.20

Annual Cost

$9,577.60

Cost / Request

$0.0052

Cost / 1K Tokens

$0.0028

Rate: $1.640/hr ·  Daily: $26.24 ·  16h/day active

Monthly Cost Breakdown

GPU Rental$787.20/mo
Networking / egress (est.)$23.62/mo
Total Monthly Estimate$787.20/mo

All Options - Monthly Estimate

Sorted by cost
OptionTypeMonthlyFits Model
Groq - Llama 3.1 70B
Managed$180.15✓ Serverless
DeepInfra - Llama 3.1 70B
Managed$185.25✓ Serverless
Together AI - Llama 3.1 70B
Managed$250.80✓ Serverless
Fireworks AI - Llama 3.1 70B
Managed$256.50✓ Serverless
Vast.ai - A100 80GB
Cloud GPU$672.00✓ 80 GB VRAM
RunPod - A100 80GB Selected
Cloud GPU$787.20✓ 80 GB VRAM
On-Prem - A100 80GB Server
On-Prem$850.00✓ 80 GB VRAM
RunPod - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
Lambda Labs - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
On-Prem - 8× A100 DGX
On-Prem$5,833.33✓ 5120 GB VRAM
AWS p4d.24xlarge - 8× A100
Cloud GPU$15,732.48✓ 320 GB VRAM
On-Prem - RTX 4090 (×1)
On-Prem-✗ 72GB needed
Vast.ai - RTX 4090
Cloud GPU-✗ 72GB needed
AWS g5.xlarge - A10G
Cloud GPU-✗ 72GB needed

Throughput Estimate

Tokens / Sec

132

Tokens / Day

7,603,200

Req / Sec

0.3

Max Daily Req

19,008

Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.

Disclaimer: Prices reflect publicly available on-demand rates and are indicative only. Actual costs depend on reserved/spot pricing, network egress, storage, software licensing (e.g. vLLM, TGI), and negotiated enterprise discounts. On-prem costs exclude engineering time, maintenance, and facility overheads. All calculations run locally in your browser - no data is sent to any server.

Три способа хостинга LLM

Самостоятельный хостинг — не одно и то же: можно арендовать GPU по часам, платить за управляемый инференс по токенам или купить железо. Каждая модель затрат выигрывает в своём сценарии.

Выбор в первую очередь зависит от постоянства нагрузки: арендованная GPU стоит одинаково и когда занята, и когда простаивает.

  • Аренда GPU: фиксированный часовой тариф, стек обслуживаете вы.
  • Управляемый инференс: оплата за токены, без затрат на простой.
  • Своё железо: начальные вложения, ниже стоимость часа в долгую.

VRAM и квантизация

Прежде чем сравнивать цены, проверьте, влезает ли модель в рассматриваемую GPU. Квантизация — самый прямой рычаг снижения потребности в VRAM.

  • FP16/BF16: 2 байта на параметр.
  • INT8: вдвое меньше VRAM, минимальная потеря качества.
  • INT4: четверть VRAM, на 1–5 % ниже качество по бенчмаркам.

Загрузка и стоимость запроса

Цена за час — лишь половина картины. Реальная загрузка определяет, какая доля тарифа превращается в полезную работу.

  1. Оцените суточные токены и запросы в минуту в часы пик.
  2. Рассчитайте ожидаемую загрузку по вашему профилю трафика.
  3. Разделите часовые затраты на фактически обслуженные запросы.
  4. Сравните эту стоимость запроса с управляемым API.

Часто задаваемые вопросы

Он оценивает инфраструктурные расходы на самостоятельный запуск большой языковой модели: на арендованных облачных GPU, управляемых serverless-API инференса или собственном железе. Он помогает разработчикам и командам сравнивать варианты развёртывания, считать затраты за запрос и за месяц, проверять требования к VRAM и решать, выгоднее ли свой хостинг, чем управляемые API. Калькулятор работает на 100 % в браузере без регистрации.

Точка окупаемости зависит от объёма запросов и выбора модели. При малом объёме (менее 500 тыс. токенов в день) управляемые API обычно дешевле, так как нет затрат на простаивающие GPU. При большом объёме (более 5 млн токенов в день) аренда выделенной GPU или своё железо обходится обычно на 60–90 % дешевле за токен, чем управляемые API для сопоставимых открытых моделей.

Llama 3.1 70B требует примерно 140 ГБ VRAM в точности FP16/BF16 (2× A100 80GB), ~72 ГБ в INT8 (1× H100 80GB) и ~40 ГБ в квантизации INT4 (1× A100 80GB). Наш калькулятор автоматически показывает требования к VRAM при выборе модели и уровня квантизации и отмечает совместимые варианты развёртывания.

Это доля активного времени, когда GPU реально обрабатывает запросы инференса. Низкая загрузка (20–30 %) означает, что вы платите за простой вычислений, увеличивая эффективную стоимость запроса. Высокая загрузка (70–90 %) лучше амортизирует часовой тариф по большему числу запросов. Продакшн-серверы инференса с непрерывным батчингом (vLLM, TGI) обычно достигают 50–80 % при постоянной нагрузке.

Аренда облачной GPU (RunPod, Vast.ai, Lambda Labs, AWS) даёт выделенную GPU по фиксированному часовому тарифу: вы сами устанавливаете и обслуживаете стек сервинга. Управляемый инференс (Together AI, Groq, Fireworks AI) берёт на себя всю инфраструктуру и берёт плату за потреблённые токены, без затрат на простой. Аренда GPU лучше для стабильных высоких нагрузок; управляемый инференс — для непредсказуемого или небольшого использования.

Квантизация снижает точность весов с FP16 (2 байта/параметр) до INT8 (1 байт) или INT4 (0,5 байта), сокращая потребность в VRAM на 50–75 %. Это позволяет запускать модель 70B на более дешёвом железе или уместить более крупную модель на той же GPU. Квантизация INT4 (GGUF Q4, AWQ, GPTQ) снижает качество на 1–5 % в большинстве бенчмарков — приемлемо для многих продакшн-сценариев.

Они основаны на опубликованных бенчмарках для каждой модели на железе H100 SXM с масштабированием по числу GPU и загрузке. Реальная пропускная способность зависит от вашего фреймворка (vLLM, TGI, Ollama), размера батча, длины контекста и конфигурации железа. Считайте их оценками порядка величины для планирования мощности.

Да. Калькулятор работает полностью в браузере на клиентском JavaScript. Выбор моделей, объёмы использования, инфраструктурные затраты и все результаты вычисляются локально на вашем устройстве и никогда не передаются на сервер. Аккаунт не требуется, данные нигде не сохраняются. Ваше планирование инфраструктуры остаётся полностью приватным и безопасным.