Перейти к содержимому
Aback Tools Logo

Калькулятор стоимости своего ИИ

Сравните реальные затраты на собственное размещение открытых LLM с провайдерами управляемых API — бесплатно и на 100 % приватно в браузере. Настройте нагрузку, выберите вариант GPU-инфраструктуры (RunPod, Vast.ai, Lambda, AWS, GCP, своё железо), добавьте накладные расходы DevOps и получите прямое сравнение за месяц, цену за миллион токенов, проверку пропускной способности и срок окупаемости своего железа.

Self-Hosted AI Cost Calculator

Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.

Model & Workload

Min VRAM: 16GBQuantized: ~5GBSpeed: ~120 tok/sGPU: A10G / L4 / RTX 4090
req/d
tok
tok
Monthly tokens: 375.0M ·  Tokens/request: 2,500

Infrastructure Option

GPU: NVIDIA A10G · On-demand: $0.76/hr
hrs/d
%

Operational Overhead

$/mo
$/mo

Managed API to Compare

In/1M: $0.15Out/1M: $0.60Per request: $0.000600
3 months12 months36 months
⚠️ Capacity gap: At 60% utilization, this setup handles ~2,488 req/day but you need 5,000. You may need ~3× this instance to meet demand.

Monthly Cost Comparison

Self-Hosted

$2.2K/mo

$5.99/1M tokens

OpenAI API

$90.00/mo

$0.3750/1M tokens (avg)

📡 Managed API saves $2.2K/mo at this workload - self-hosting becomes cost-effective at higher volumes

Self-Host / Mo

$2.2K

API / Mo

$90.00

12-Mo Self-Host

$27.0K

12-Mo API

$1.1K

Self-Hosting Cost Breakdown

Cloud GPU Rental$547.20/mo (24%)
ML Ops / DevOps Labour$1.5K/mo (67%)
Misc. Infra & Networking$200.00/mo (9%)

Cloud GPU Options Comparison

Sorted by cost
Option$/hrMonthly$/1M tokens
Vast.ai - RTX 4090
RTX 4090
$0.350$2.0K$5.21
RunPod - L4 24GB
NVIDIA L4
$0.440$2.0K$5.38
GCP g2-standard-4 (L4)
NVIDIA L4
$0.700$2.2K$5.88
RunPod - A10G 24GB Selected
NVIDIA A10G
$0.760$2.2K$5.99
AWS g5.xlarge (A10G)
NVIDIA A10G
$1.006$2.4K$6.46
Lambda - A100 40GB
NVIDIA A100
$1.290$2.6K$7.01
Vast.ai - A100 80GB
NVIDIA A100
$1.400$2.7K$7.22
RunPod - A100 80GB
NVIDIA A100
$1.640$2.9K$7.68
RunPod - H100 SXM
NVIDIA H100
$3.490$4.2K$11.23
Azure NC A100 v4
NVIDIA A100
$3.670$4.3K$11.58
OpenAI - GPT-4o Mini
Managed API
pay-per-use$90.00$0.3750
Disclaimer: Cost estimates use current market pricing and typical throughput benchmarks. Actual self-hosting costs depend on your model, serving framework, batching efficiency, GPU availability, and ops overhead. API pricing changes frequently - always verify with official provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Реальные затраты выше цены GPU

Почасовая аренда — лишь самая заметная статья. Инженерное время, сеть и хранение часто добавляют 30–60 % к чистым затратам.

Сравнивать только тариф GPU с ценой за токен у API — значит прийти к неверным выводам.

  • GPU: часовой тариф × часы в месяце.
  • DevOps: инженерные часы × полная стоимость часа.
  • Дополнительно: сеть, хранение и настройка фреймворка.

Загрузка и квантизация

Эффективная цена за токен зависит и от загрузки, и от цены за час. Полупустая GPU удваивает удельные затраты.

  • Низкая загрузка = пропорционально более высокая цена за токен.
  • Батчинг и vLLM повышают загрузку в продакшене.
  • INT4/Q4 сокращает VRAM и позволяет крупные модели на дешёвых GPU.

Когда выигрывает каждый вариант

Облако выигрывает при переменных нагрузках или коротком проекте. Своё железо выигрывает при высокой постоянной нагрузке в течение лет.

  1. Оцените суточные токены и устойчивую загрузку.
  2. Рассчитайте месячные затраты своего хостинга с GPU и DevOps.
  3. Сравните с ценой управляемого API для той же нагрузки.
  4. При стабильно высокой нагрузке посчитайте амортизацию своего железа на 3–4 года.

Часто задаваемые вопросы

Он оценивает полные месячные затраты на запуск открытых LLM на собственной GPU-инфраструктуре — включая аренду GPU или амортизацию железа, трудозатраты DevOps и операционные накладные расходы — и сравнивает их с ценами управляемых API для той же нагрузки.

Точка окупаемости зависит от модели, эффективности GPU и накладных расходов на эксплуатацию. Для небольших моделей вроде Llama 3.1 8B собственный хостинг становится конкурентоспособным примерно с 500 тыс. — 2 млн токенов в день. Для моделей 70B порог обычно составляет 5–20 млн токенов в день.

Часовой тариф GPU — лишь часть реальных затрат. Инженерное время DevOps (500–3 000 $/мес), сеть, хранение и настройка фреймворка сервинга добавляют 30–60 % к чистым затратам на GPU. Всегда учитывайте их при сравнении с ценами API.

Это доля вычислительной мощности GPU, активно обрабатывающей запросы. При загрузке 30 % эффективная цена за токен в 3 раза выше, чем при 90 %. Батчинг запросов и фреймворки вроде vLLM критичны для высокой загрузки и экономической конкурентоспособности.

Квантизация (INT4/Q4) снижает потребность в VRAM примерно на 70 %, позволяя запускать крупные модели на более дешёвых GPU. Взамен — снижение пропускной способности на 10–20 % и небольшое падение качества. Для большинства продакшн-нагрузок это хороший компромисс, когда узкое место — VRAM.

Для простого облачного развёртывания одной модели закладывайте 5–20 часов в месяц инженерного времени. При полной ставке 80–150 $/ч это 400–3 000 $/мес. Начните с 10–20 часов в месяц и отслеживайте фактическое время в первом квартале.

Да. Калькулятор работает полностью в браузере. Объёмы нагрузки, выбор инфраструктуры и все результаты обрабатываются локально на устройстве и никогда не отправляются на сервер, не сохраняются и не передаются. Вход не требуется.

Для дешёвых небольших моделей: Vast.ai (~0,35 $/ч RTX 4090) и RunPod (~0,44 $/ч L4). Для продакшн-инференса 7–13B: RunPod или Lambda (A10G/A100 по 0,76–1,64 $/ч). Для моделей 70B+: RunPod H100 (3,49 $/ч). Для стабильных экономичных нагрузок: своё железо с амортизацией на 3–4 года.