Перейти к содержимому
Aback Tools Logo

Калькулятор стоимости ИИ-инфраструктуры

Бесплатно оцените онлайн общие инфраструктурные расходы ваших ИИ-приложений. Смоделируйте стоимость токенов API LLM, вычислений на GPU, векторных баз данных, хранилища, сетевого трафика, серверов приложений, наблюдаемости и другого — с представлением за месяц и год, упорядоченной разбивкой расходов и настраиваемым резервом на непредвиденное.

AI Infrastructure Cost Calculator

Estimate total monthly and annual infrastructure expenses for your AI application - covering LLM APIs, GPU compute, storage, networking, orchestration, and observability.

LLM API Usage

$
$
Monthly LLM API cost$410.94

Embedding API

$
Monthly embedding cost$1.22

GPU / Self-Hosted Compute

×
$
hrs
Monthly GPU cost$0

Total AI Infrastructure Cost (Monthly)

$979.06= $11.7K/yr

Compute

$412.16

42.1%

Storage

$18.80

1.9%

Networking

$9.10

0.9%

Ops + Overhead

$539.01

55.1%

All Cost Components - Ranked by Spend

LLM API (Input)23.3%
$228.30
App Servers20.4%
$200.00
LLM API (Output)18.7%
$182.64
Orchestration10.2%
$100.00
Support10.2%
$100.00
Overhead / Contingency9.1%
$89.01
Monitoring5.1%
$50.00
Object Storage1.2%
$11.50
Egress0.9%
$9.00
Vector Database0.5%
$5.00
Database0.2%
$2.30
Embeddings API0.1%
$1.22
CDN0.0%
$0.10
Total Monthly$979.06

Compute (LLM + GPU)

$412.16/mo

Storage

$18.80/mo

Networking

$9.10/mo

Ops + Overhead

$539.01/mo

Overhead & Contingency

10%= $89.01/mo

Added to subtotal to cover unexpected usage spikes, support escalations, and untracked minor services.

Уровни затрат ИИ-приложения

Затраты ИИ-приложения не сводятся к токенам LLM. Векторные базы, вычисления, хранилище, исходящий трафик и наблюдаемость быстро накапливаются и часто забываются в первых оценках.

Пройдите по каждой вкладке и укажите реальные объёмы токенов, инстансов, гигабайтов и запросов, чтобы получить полную картину месячных и годовых расходов.

  • API LLM: входные и выходные токены в зависимости от модели и объёма запросов.
  • Вычисления на GPU: часы инстансов и загрузка для своей инференции или обучения.
  • Векторные базы и хранилище: векторы, индексы, метаданные и полезная нагрузка.
  • Сеть: исходящий трафик, CDN и межзональная передача.
  • Серверы приложений, оркестрация и наблюдаемость: остальная часть эксплуатационного стека.

Как использовать разбивку расходов

Инструмент сортирует категории от самой дорогой к самой дешёвой — начинайте сверху, чтобы найти наибольший резерв оптимизации.

  1. Укажите объём токенов и модель, чтобы рассчитать расходы на API LLM.
  2. Добавьте вычисления, векторные базы, хранилище, сеть и серверы приложений.
  3. Включите наблюдаемость и резерв 10–15 % на непредвиденное.
  4. Проверьте разбивку и представления за месяц и год, чтобы утвердить бюджет.

Управляемый API или собственный хостинг

Собственный хостинг моделей может заметно снизить стоимость токена при высокой и стабильной загрузке, но обходится дорого, если GPU часто простаивает. Сравните оба сценария на своих объёмах перед решением.

  • При загрузке GPU ниже 60 % управляемые API обычно дешевле.
  • При высокой и стабильной нагрузке выделенная GPU резко снижает стоимость токена.
  • Учитывайте затраты на инженерию и поддержку собственного хостинга, а не только инстанс.
  • Заложите резерв на всплески трафика и ботов.

Часто задаваемые вопросы

Калькулятор стоимости ИИ-инфраструктуры оценивает общие регулярные расходы на работу ИИ-приложения по всем слоям инфраструктуры: API LLM, API эмбеддингов, вычисления на GPU, векторные базы данных, объектное хранилище, реляционные базы, CDN, исходящий трафик, серверы приложений, оркестрация и наблюдаемость. Он помогает разработчикам и продуктовым командам планировать реалистичные бюджеты до выхода в продакшн. Работает полностью в браузере, без регистрации.

Процент накладных расходов добавляет резерв к смоделированным затратам для учёта небольших неучтённых сервисов, неожиданных всплесков нагрузки (вирусный момент или трафик ботов), изменения цен поставщиков, эскалаций в поддержку и прочих трудно прогнозируемых платежей. Резерв 10–15 % — распространённая инженерная практика при оценке облачных расходов.

Нет. Калькулятор работает на 100 % на стороне клиента, в вашем браузере. Объёмы токенов, количество инстансов, размеры хранилища и все входные данные обрабатываются локально на вашем устройстве и никогда не отправляются на сервер. Данные вашей инфраструктуры полностью приватны и защищены.

Собственная инференция обычно становится конкурентной по цене, когда загрузка GPU стабильно превышает 60–70 %. При низкой загрузке вы платите за простой GPU, чего управляемые API избегают. При большом масштабе и стабильной нагрузке одна A100 за 3 $/час обрабатывает сопоставимые объёмы токенов значительно дешевле, чем оплата за токен. Используйте вкладку вычислений, чтобы сравнить оба сценария на своих объёмах.

В системе RAG расходы на эмбеддинги складываются из двух источников: разовая загрузка корпуса (векторизация всех документов) и постоянная векторизация запросов во время работы. Для регулярных расходов умножьте суточное число запросов на среднюю длину запроса в токенах и примените тариф провайдера за миллион токенов. text-embedding-3-small от OpenAI стоит 0,02 $ за млн токенов — очень дёшево по сравнению с расходами на генерацию LLM.

Расходы на исходящий трафик сильно зависят от провайдера. AWS берёт ~0,09 $/ГБ за трафик в интернет, GCP ~0,08 $/ГБ, Azure ~0,087 $/ГБ. У Cloudflare Workers и R2 нет платы за исходящий трафик, что делает их привлекательными как слой кэширования. ИИ-приложения, транслирующие длинные ответы или отдающие синтезированные аудио и изображения, могут генерировать 50–500 ГБ/мес трафика в масштабе, что быстро сказывается у традиционных облачных провайдеров.

Приблизительная оценка: для 1 млн документов по 512 токенов с 1536-мерными эмбеддингами float32 сами векторы занимают около 6 ГБ до накладных расходов индекса HNSW (которые добавляют 10–30 %). С метаданными и полезной нагрузкой рассчитывайте ~10 ГБ на миллион документов. Квантизация int8 (поддерживается Qdrant) уменьшает объём в 4 раза, бинарная — в 32 раза, с небольшими потерями полноты.

Для большинства ИИ-приложений расходы на CDN минимальны по сравнению с API LLM и вычислениями. CDN важен прежде всего для отдачи статики (фронтенд, документация), и крупные провайдеры берут 0,01–1,00 $ за миллион запросов. Однако если приложение отдаёт через CDN сгенерированные медиа (изображения, аудио, видео), расходы на хранение и передачу могут стать значительными в зависимости от объёмов и размера файлов.