Калькулятор стоимости инференса
Бесплатно оцените онлайн расходы на инференс LLM по запросам, задержке и объёму токенов. Смоделируйте скидки кеша промптов, экономию Batch API, накладные расходы на повторы и мощность одновременной пропускной способности — затем сравните стоимость и задержку по 14 моделям. Работает на 100 % в браузере.
Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.
Real-time user-facing chat with sub-2s latency SLA
Token Sizes per Request
Request Volume & Latency
Cost Optimizations
Projected Monthly Inference Cost
Cost / Request
$0.000330
Cost / 1K Req
$0.3300
Est. Latency
3.8s
Max RPS
13.3
Per-Request Cost Breakdown
Model Cost & Latency Comparison
Sorted by lowest monthly cost| Model | $/req | Monthly Cost | Latency | SLA |
|---|---|---|---|---|
Llama 3.1 8BBudget Groq/Together · 600 tok/s · TTFT 80ms | $0.00006800 | $41.62 | 663ms | ✓ Met |
Mistral Small 3.2Budget Mistral · 160 tok/s · TTFT 160ms | $0.000185 | $113.22 | 2.3s | ✗ Breach |
GPT-4o miniBudget Selected OpenAI · 100 tok/s · TTFT 250ms | $0.000330 | $201.96 | 3.8s | ✗ Breach |
DeepSeek-V3Budget DeepSeek · 90 tok/s · TTFT 300ms | $0.000601 | $367.81 | 4.2s | ✗ Breach |
Llama 3.3 70BBudget Groq/Togther · 250 tok/s · TTFT 120ms | $0.000749 | $458.08 | 1.5s | ✗ Breach |
Gemini 2.5 FlashBudget Google · 150 tok/s · TTFT 180ms | $0.001115 | $682.38 | 2.5s | ✗ Breach |
Grok 4.3 xAI · 80 tok/s · TTFT 350ms | $0.001875 | $1,147.50 | 4.7s | ✗ Breach |
Claude 3.5 HaikuBudget Anthropic · 130 tok/s · TTFT 200ms | $0.002040 | $1,248.48 | 2.9s | ✗ Breach |
o4-mini OpenAI · 50 tok/s · TTFT 600ms | $0.002420 | $1,481.04 | 7.6s | ✗ Breach |
Mistral Large 3 Mistral · 70 tok/s · TTFT 380ms | $0.003700 | $2,264.40 | 5.4s | ✗ Breach |
o3Capable OpenAI · 45 tok/s · TTFT 700ms | $0.004400 | $2,692.80 | 8.5s | ✗ Breach |
Gemini 2.5 Pro Google · 65 tok/s · TTFT 450ms | $0.004500 | $2,754.00 | 5.8s | ✗ Breach |
GPT-4oCapable OpenAI · 60 tok/s · TTFT 400ms | $0.005500 | $3,366.00 | 6.2s | ✗ Breach |
Claude Sonnet 4.6Capable Anthropic · 55 tok/s · TTFT 500ms | $0.007650 | $4,681.80 | 6.9s | ✗ Breach |
Из чего складывается стоимость инференса
Стоимость инференса зависит от числа запросов, размера входа и выхода каждого из них и выбранной модели. Сочетание этих трёх факторов полностью меняет результат.
Поскольку выходные токены дороже входных, длинный ответ при коротком промпте может стоить больше, чем наоборот.
- Суточные запросы × стоимость запроса = базовые суточные расходы.
- Выходные токены дороже: следите за длиной ответов.
- Целевая задержка определяет, какую модель вы можете себе позволить.
Скидки кеша и пакетов
Кеш промптов и Batch API — два главных рычага снижения счёта без потери качества. Каждый подходит для своего характера трафика.
- Кеш промптов: полезен при большом повторяющемся системном промпте или контексте.
- Batch API: около 50 % скидки для асинхронных задач.
- Повторы: пропорционально увеличивают объём и общую стоимость.
Проверка SLA по задержке
Низкая цена бесполезна, если страдает опыт пользователя. Оценка задержки складывается из TTFT плюс время генерации выходных токенов.
- Определите TTFT и скорость генерации рассматриваемой модели.
- Рассчитайте задержку «конец-в-конец» для типичного размера выхода.
- Сравните результат с вашей целью по SLA.
- Если не проходит — возьмите более быструю модель или сократите длину вывода.
Часто задаваемые вопросы
Он оценивает, сколько вы платите за выполнение живых запросов к LLM в заданном масштабе. Он берёт ваше количество входных и выходных токенов, суточный объём запросов и выбранную модель, чтобы спрогнозировать стоимость запроса и итог за день, месяц или год. Наш инструмент также моделирует соблюдение SLA по задержке, пропускную способность, кеш промптов, скидки Batch API и накладные расходы на повторы — локально в браузере и без регистрации.
Стоимость обучения — разовые расходы на создание или дообучение модели с использованием GPU. Стоимость инференса — повторяющиеся расходы на каждый запрос, когда пользователь или конвейер отправляет промпт и получает ответ. В большинстве продакшн-приложений инференс определяет основные постоянные расходы на ИИ: они растут прямо вместе с базой пользователей и объёмом запросов.
Да. Калькулятор работает полностью на стороне клиента, в браузере, на JavaScript. Размеры токенов, объёмы запросов, целевые задержки и прогнозы затрат обрабатываются локально на вашем устройстве и никогда не передаются на сервер и не сохраняются. Ваши данные остаются на 100 % приватными в течение всей сессии.
Задержка «конец-в-конец» оценивается так: время до первого токена (TTFT) + (выходные токены ÷ скорость генерации в токенах/с). Например, модель с TTFT 300 мс, генерирующая 500 токенов со скоростью 100 токенов/с, даёт оценку 300 мс + 5 000 мс = 5,3 секунды. Значения TTFT и скорости — репрезентативные медианы; фактические зависят от региона провайдера, нагрузки на сервер и размера запроса.
TTFT — это время между отправкой запроса и получением первого токена ответа. Оно определяет, как быстро приложение начнёт показывать результат пользователю. Низкий TTFT (менее 200 мс) критичен для интерактивных чатов. Меньшие и более квантованные модели обычно имеют более низкий TTFT, чем крупные фронтирные модели.
Кеш промптов хранит состояние KV-внимания для повторяющегося префикса промпта, поэтому последующие запросы с тем же префиксом тарифицируются примерно по 25 % стандартной ставки за вход. Это особенно эффективно, когда системный промпт или контекст документа большой и общий для множества запросов.
Используйте Batch API для нагрузок, не чувствительных к задержке: массовое резюмирование документов, офлайн-обогащение данных, крупномасштабная классификация, ночная генерация отчётов. Batch API берёт примерно 50 % стандартного тарифа реального времени. Инференс в реальном времени необходим для любого интерактивного пользовательского функционала.
Типичная доля — 2–5 % для продакшн-нагрузок на API LLM, с учётом ошибок лимитов, временных таймаутов и ошибок 5xx на стороне провайдера. Высоконагруженные приложения, часто работающие у пределов лимитов, могут давать 5–15 %. Доля повторов пропорционально увеличивает общее число запросов и затраты.