Калькулятор стоимости ИИ-инфраструктуры
Бесплатно оцените онлайн общие инфраструктурные расходы ваших ИИ-приложений. Смоделируйте стоимость токенов API LLM, вычислений на GPU, векторных баз данных, хранилища, сетевого трафика, серверов приложений, наблюдаемости и другого — с представлением за месяц и год, упорядоченной разбивкой расходов и настраиваемым резервом на непредвиденное.
Estimate total monthly and annual infrastructure expenses for your AI application - covering LLM APIs, GPU compute, storage, networking, orchestration, and observability.
LLM API Usage
Embedding API
GPU / Self-Hosted Compute
Total AI Infrastructure Cost (Monthly)
Compute
$412.16
42.1%
Storage
$18.80
1.9%
Networking
$9.10
0.9%
Ops + Overhead
$539.01
55.1%
All Cost Components - Ranked by Spend
Compute (LLM + GPU)
$412.16/mo
Storage
$18.80/mo
Networking
$9.10/mo
Ops + Overhead
$539.01/mo
Overhead & Contingency
Added to subtotal to cover unexpected usage spikes, support escalations, and untracked minor services.
Уровни затрат ИИ-приложения
Затраты ИИ-приложения не сводятся к токенам LLM. Векторные базы, вычисления, хранилище, исходящий трафик и наблюдаемость быстро накапливаются и часто забываются в первых оценках.
Пройдите по каждой вкладке и укажите реальные объёмы токенов, инстансов, гигабайтов и запросов, чтобы получить полную картину месячных и годовых расходов.
- API LLM: входные и выходные токены в зависимости от модели и объёма запросов.
- Вычисления на GPU: часы инстансов и загрузка для своей инференции или обучения.
- Векторные базы и хранилище: векторы, индексы, метаданные и полезная нагрузка.
- Сеть: исходящий трафик, CDN и межзональная передача.
- Серверы приложений, оркестрация и наблюдаемость: остальная часть эксплуатационного стека.
Как использовать разбивку расходов
Инструмент сортирует категории от самой дорогой к самой дешёвой — начинайте сверху, чтобы найти наибольший резерв оптимизации.
- Укажите объём токенов и модель, чтобы рассчитать расходы на API LLM.
- Добавьте вычисления, векторные базы, хранилище, сеть и серверы приложений.
- Включите наблюдаемость и резерв 10–15 % на непредвиденное.
- Проверьте разбивку и представления за месяц и год, чтобы утвердить бюджет.
Управляемый API или собственный хостинг
Собственный хостинг моделей может заметно снизить стоимость токена при высокой и стабильной загрузке, но обходится дорого, если GPU часто простаивает. Сравните оба сценария на своих объёмах перед решением.
- При загрузке GPU ниже 60 % управляемые API обычно дешевле.
- При высокой и стабильной нагрузке выделенная GPU резко снижает стоимость токена.
- Учитывайте затраты на инженерию и поддержку собственного хостинга, а не только инстанс.
- Заложите резерв на всплески трафика и ботов.
Часто задаваемые вопросы
Калькулятор стоимости ИИ-инфраструктуры оценивает общие регулярные расходы на работу ИИ-приложения по всем слоям инфраструктуры: API LLM, API эмбеддингов, вычисления на GPU, векторные базы данных, объектное хранилище, реляционные базы, CDN, исходящий трафик, серверы приложений, оркестрация и наблюдаемость. Он помогает разработчикам и продуктовым командам планировать реалистичные бюджеты до выхода в продакшн. Работает полностью в браузере, без регистрации.
Процент накладных расходов добавляет резерв к смоделированным затратам для учёта небольших неучтённых сервисов, неожиданных всплесков нагрузки (вирусный момент или трафик ботов), изменения цен поставщиков, эскалаций в поддержку и прочих трудно прогнозируемых платежей. Резерв 10–15 % — распространённая инженерная практика при оценке облачных расходов.
Нет. Калькулятор работает на 100 % на стороне клиента, в вашем браузере. Объёмы токенов, количество инстансов, размеры хранилища и все входные данные обрабатываются локально на вашем устройстве и никогда не отправляются на сервер. Данные вашей инфраструктуры полностью приватны и защищены.
Собственная инференция обычно становится конкурентной по цене, когда загрузка GPU стабильно превышает 60–70 %. При низкой загрузке вы платите за простой GPU, чего управляемые API избегают. При большом масштабе и стабильной нагрузке одна A100 за 3 $/час обрабатывает сопоставимые объёмы токенов значительно дешевле, чем оплата за токен. Используйте вкладку вычислений, чтобы сравнить оба сценария на своих объёмах.
В системе RAG расходы на эмбеддинги складываются из двух источников: разовая загрузка корпуса (векторизация всех документов) и постоянная векторизация запросов во время работы. Для регулярных расходов умножьте суточное число запросов на среднюю длину запроса в токенах и примените тариф провайдера за миллион токенов. text-embedding-3-small от OpenAI стоит 0,02 $ за млн токенов — очень дёшево по сравнению с расходами на генерацию LLM.
Расходы на исходящий трафик сильно зависят от провайдера. AWS берёт ~0,09 $/ГБ за трафик в интернет, GCP ~0,08 $/ГБ, Azure ~0,087 $/ГБ. У Cloudflare Workers и R2 нет платы за исходящий трафик, что делает их привлекательными как слой кэширования. ИИ-приложения, транслирующие длинные ответы или отдающие синтезированные аудио и изображения, могут генерировать 50–500 ГБ/мес трафика в масштабе, что быстро сказывается у традиционных облачных провайдеров.
Приблизительная оценка: для 1 млн документов по 512 токенов с 1536-мерными эмбеддингами float32 сами векторы занимают около 6 ГБ до накладных расходов индекса HNSW (которые добавляют 10–30 %). С метаданными и полезной нагрузкой рассчитывайте ~10 ГБ на миллион документов. Квантизация int8 (поддерживается Qdrant) уменьшает объём в 4 раза, бинарная — в 32 раза, с небольшими потерями полноты.
Для большинства ИИ-приложений расходы на CDN минимальны по сравнению с API LLM и вычислениями. CDN важен прежде всего для отдачи статики (фронтенд, документация), и крупные провайдеры берут 0,01–1,00 $ за миллион запросов. Однако если приложение отдаёт через CDN сгенерированные медиа (изображения, аудио, видео), расходы на хранение и передачу могут стать значительными в зависимости от объёмов и размера файлов.