Калькулятор стоимости своего ИИ
Сравните реальные затраты на собственное размещение открытых LLM с провайдерами управляемых API — бесплатно и на 100 % приватно в браузере. Настройте нагрузку, выберите вариант GPU-инфраструктуры (RunPod, Vast.ai, Lambda, AWS, GCP, своё железо), добавьте накладные расходы DevOps и получите прямое сравнение за месяц, цену за миллион токенов, проверку пропускной способности и срок окупаемости своего железа.
Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.
Model & Workload
Infrastructure Option
Operational Overhead
Managed API to Compare
Monthly Cost Comparison
$2.2K/mo
$5.99/1M tokens
$90.00/mo
$0.3750/1M tokens (avg)
Self-Host / Mo
$2.2K
API / Mo
$90.00
12-Mo Self-Host
$27.0K
12-Mo API
$1.1K
Self-Hosting Cost Breakdown
Cloud GPU Options Comparison
Sorted by cost| Option | $/hr | Monthly | $/1M tokens |
|---|---|---|---|
Vast.ai - RTX 4090 RTX 4090 | $0.350 | $2.0K | $5.21 |
RunPod - L4 24GB NVIDIA L4 | $0.440 | $2.0K | $5.38 |
GCP g2-standard-4 (L4) NVIDIA L4 | $0.700 | $2.2K | $5.88 |
RunPod - A10G 24GB Selected NVIDIA A10G | $0.760 | $2.2K | $5.99 |
AWS g5.xlarge (A10G) NVIDIA A10G | $1.006 | $2.4K | $6.46 |
Lambda - A100 40GB NVIDIA A100 | $1.290 | $2.6K | $7.01 |
Vast.ai - A100 80GB NVIDIA A100 | $1.400 | $2.7K | $7.22 |
RunPod - A100 80GB NVIDIA A100 | $1.640 | $2.9K | $7.68 |
RunPod - H100 SXM NVIDIA H100 | $3.490 | $4.2K | $11.23 |
Azure NC A100 v4 NVIDIA A100 | $3.670 | $4.3K | $11.58 |
| OpenAI - GPT-4o Mini Managed API | pay-per-use | $90.00 | $0.3750 |
Реальные затраты выше цены GPU
Почасовая аренда — лишь самая заметная статья. Инженерное время, сеть и хранение часто добавляют 30–60 % к чистым затратам.
Сравнивать только тариф GPU с ценой за токен у API — значит прийти к неверным выводам.
- GPU: часовой тариф × часы в месяце.
- DevOps: инженерные часы × полная стоимость часа.
- Дополнительно: сеть, хранение и настройка фреймворка.
Загрузка и квантизация
Эффективная цена за токен зависит и от загрузки, и от цены за час. Полупустая GPU удваивает удельные затраты.
- Низкая загрузка = пропорционально более высокая цена за токен.
- Батчинг и vLLM повышают загрузку в продакшене.
- INT4/Q4 сокращает VRAM и позволяет крупные модели на дешёвых GPU.
Когда выигрывает каждый вариант
Облако выигрывает при переменных нагрузках или коротком проекте. Своё железо выигрывает при высокой постоянной нагрузке в течение лет.
- Оцените суточные токены и устойчивую загрузку.
- Рассчитайте месячные затраты своего хостинга с GPU и DevOps.
- Сравните с ценой управляемого API для той же нагрузки.
- При стабильно высокой нагрузке посчитайте амортизацию своего железа на 3–4 года.
Часто задаваемые вопросы
Он оценивает полные месячные затраты на запуск открытых LLM на собственной GPU-инфраструктуре — включая аренду GPU или амортизацию железа, трудозатраты DevOps и операционные накладные расходы — и сравнивает их с ценами управляемых API для той же нагрузки.
Точка окупаемости зависит от модели, эффективности GPU и накладных расходов на эксплуатацию. Для небольших моделей вроде Llama 3.1 8B собственный хостинг становится конкурентоспособным примерно с 500 тыс. — 2 млн токенов в день. Для моделей 70B порог обычно составляет 5–20 млн токенов в день.
Часовой тариф GPU — лишь часть реальных затрат. Инженерное время DevOps (500–3 000 $/мес), сеть, хранение и настройка фреймворка сервинга добавляют 30–60 % к чистым затратам на GPU. Всегда учитывайте их при сравнении с ценами API.
Это доля вычислительной мощности GPU, активно обрабатывающей запросы. При загрузке 30 % эффективная цена за токен в 3 раза выше, чем при 90 %. Батчинг запросов и фреймворки вроде vLLM критичны для высокой загрузки и экономической конкурентоспособности.
Квантизация (INT4/Q4) снижает потребность в VRAM примерно на 70 %, позволяя запускать крупные модели на более дешёвых GPU. Взамен — снижение пропускной способности на 10–20 % и небольшое падение качества. Для большинства продакшн-нагрузок это хороший компромисс, когда узкое место — VRAM.
Для простого облачного развёртывания одной модели закладывайте 5–20 часов в месяц инженерного времени. При полной ставке 80–150 $/ч это 400–3 000 $/мес. Начните с 10–20 часов в месяц и отслеживайте фактическое время в первом квартале.
Да. Калькулятор работает полностью в браузере. Объёмы нагрузки, выбор инфраструктуры и все результаты обрабатываются локально на устройстве и никогда не отправляются на сервер, не сохраняются и не передаются. Вход не требуется.
Для дешёвых небольших моделей: Vast.ai (~0,35 $/ч RTX 4090) и RunPod (~0,44 $/ч L4). Для продакшн-инференса 7–13B: RunPod или Lambda (A10G/A100 по 0,76–1,64 $/ч). Для моделей 70B+: RunPod H100 (3,49 $/ч). Для стабильных экономичных нагрузок: своё железо с амортизацией на 3–4 года.