Перейти к содержимому
Aback Tools Logo

Калькулятор стоимости инференса

Бесплатно оцените онлайн расходы на инференс LLM по запросам, задержке и объёму токенов. Смоделируйте скидки кеша промптов, экономию Batch API, накладные расходы на повторы и мощность одновременной пропускной способности — затем сравните стоимость и задержку по 14 моделям. Работает на 100 % в браузере.

Inference Cost Calculator

Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.

Real-time user-facing chat with sub-2s latency SLA

In/1M: $0.15Out/1M: $0.60TTFT: 250msSpeed: 100 tok/s

Token Sizes per Request

tokens
tokens
Total/req: 1,150 tokensIn cost: $0.000120Out cost: $0.000210

Request Volume & Latency

req/day
concurrent
ms

Cost Optimizations

%
%
%
⚠️ SLA Risk: Estimated P95 latency for GPT-4o mini is 3.8s - exceeds your 1.5s target. Consider a faster model or reduce output tokens.

Projected Monthly Inference Cost

$201.96for 612,000 requests

Cost / Request

$0.000330

Cost / 1K Req

$0.3300

Est. Latency

3.8s

Max RPS

13.3

Per-Request Cost Breakdown

Input (standard): $0.000120Input (cached): $0.00Output: $0.000210Retry overhead: $0.00000660

Model Cost & Latency Comparison

Sorted by lowest monthly cost
Model$/reqMonthly CostLatencySLA
Llama 3.1 8BBudget
Groq/Together · 600 tok/s · TTFT 80ms
$0.00006800$41.62663ms✓ Met
Mistral Small 3.2Budget
Mistral · 160 tok/s · TTFT 160ms
$0.000185$113.222.3s✗ Breach
GPT-4o miniBudget Selected
OpenAI · 100 tok/s · TTFT 250ms
$0.000330$201.963.8s✗ Breach
DeepSeek-V3Budget
DeepSeek · 90 tok/s · TTFT 300ms
$0.000601$367.814.2s✗ Breach
Llama 3.3 70BBudget
Groq/Togther · 250 tok/s · TTFT 120ms
$0.000749$458.081.5s✗ Breach
Gemini 2.5 FlashBudget
Google · 150 tok/s · TTFT 180ms
$0.001115$682.382.5s✗ Breach
Grok 4.3
xAI · 80 tok/s · TTFT 350ms
$0.001875$1,147.504.7s✗ Breach
Claude 3.5 HaikuBudget
Anthropic · 130 tok/s · TTFT 200ms
$0.002040$1,248.482.9s✗ Breach
o4-mini
OpenAI · 50 tok/s · TTFT 600ms
$0.002420$1,481.047.6s✗ Breach
Mistral Large 3
Mistral · 70 tok/s · TTFT 380ms
$0.003700$2,264.405.4s✗ Breach
o3Capable
OpenAI · 45 tok/s · TTFT 700ms
$0.004400$2,692.808.5s✗ Breach
Gemini 2.5 Pro
Google · 65 tok/s · TTFT 450ms
$0.004500$2,754.005.8s✗ Breach
GPT-4oCapable
OpenAI · 60 tok/s · TTFT 400ms
$0.005500$3,366.006.2s✗ Breach
Claude Sonnet 4.6Capable
Anthropic · 55 tok/s · TTFT 500ms
$0.007650$4,681.806.9s✗ Breach
Disclaimer:Pricing uses standard Pay-As-You-Go rates. Latency estimates are indicative medians - actual TTFT and throughput vary by region, load, and request size. Batch API discounts are typically ~50% but differ by provider. Always verify rates on each provider's official pricing page. All calculations run locally in your browser; no data is sent to any server.

Из чего складывается стоимость инференса

Стоимость инференса зависит от числа запросов, размера входа и выхода каждого из них и выбранной модели. Сочетание этих трёх факторов полностью меняет результат.

Поскольку выходные токены дороже входных, длинный ответ при коротком промпте может стоить больше, чем наоборот.

  • Суточные запросы × стоимость запроса = базовые суточные расходы.
  • Выходные токены дороже: следите за длиной ответов.
  • Целевая задержка определяет, какую модель вы можете себе позволить.

Скидки кеша и пакетов

Кеш промптов и Batch API — два главных рычага снижения счёта без потери качества. Каждый подходит для своего характера трафика.

  • Кеш промптов: полезен при большом повторяющемся системном промпте или контексте.
  • Batch API: около 50 % скидки для асинхронных задач.
  • Повторы: пропорционально увеличивают объём и общую стоимость.

Проверка SLA по задержке

Низкая цена бесполезна, если страдает опыт пользователя. Оценка задержки складывается из TTFT плюс время генерации выходных токенов.

  1. Определите TTFT и скорость генерации рассматриваемой модели.
  2. Рассчитайте задержку «конец-в-конец» для типичного размера выхода.
  3. Сравните результат с вашей целью по SLA.
  4. Если не проходит — возьмите более быструю модель или сократите длину вывода.

Часто задаваемые вопросы

Он оценивает, сколько вы платите за выполнение живых запросов к LLM в заданном масштабе. Он берёт ваше количество входных и выходных токенов, суточный объём запросов и выбранную модель, чтобы спрогнозировать стоимость запроса и итог за день, месяц или год. Наш инструмент также моделирует соблюдение SLA по задержке, пропускную способность, кеш промптов, скидки Batch API и накладные расходы на повторы — локально в браузере и без регистрации.

Стоимость обучения — разовые расходы на создание или дообучение модели с использованием GPU. Стоимость инференса — повторяющиеся расходы на каждый запрос, когда пользователь или конвейер отправляет промпт и получает ответ. В большинстве продакшн-приложений инференс определяет основные постоянные расходы на ИИ: они растут прямо вместе с базой пользователей и объёмом запросов.

Да. Калькулятор работает полностью на стороне клиента, в браузере, на JavaScript. Размеры токенов, объёмы запросов, целевые задержки и прогнозы затрат обрабатываются локально на вашем устройстве и никогда не передаются на сервер и не сохраняются. Ваши данные остаются на 100 % приватными в течение всей сессии.

Задержка «конец-в-конец» оценивается так: время до первого токена (TTFT) + (выходные токены ÷ скорость генерации в токенах/с). Например, модель с TTFT 300 мс, генерирующая 500 токенов со скоростью 100 токенов/с, даёт оценку 300 мс + 5 000 мс = 5,3 секунды. Значения TTFT и скорости — репрезентативные медианы; фактические зависят от региона провайдера, нагрузки на сервер и размера запроса.

TTFT — это время между отправкой запроса и получением первого токена ответа. Оно определяет, как быстро приложение начнёт показывать результат пользователю. Низкий TTFT (менее 200 мс) критичен для интерактивных чатов. Меньшие и более квантованные модели обычно имеют более низкий TTFT, чем крупные фронтирные модели.

Кеш промптов хранит состояние KV-внимания для повторяющегося префикса промпта, поэтому последующие запросы с тем же префиксом тарифицируются примерно по 25 % стандартной ставки за вход. Это особенно эффективно, когда системный промпт или контекст документа большой и общий для множества запросов.

Используйте Batch API для нагрузок, не чувствительных к задержке: массовое резюмирование документов, офлайн-обогащение данных, крупномасштабная классификация, ночная генерация отчётов. Batch API берёт примерно 50 % стандартного тарифа реального времени. Инференс в реальном времени необходим для любого интерактивного пользовательского функционала.

Типичная доля — 2–5 % для продакшн-нагрузок на API LLM, с учётом ошибок лимитов, временных таймаутов и ошибок 5xx на стороне провайдера. Высоконагруженные приложения, часто работающие у пределов лимитов, могут давать 5–15 %. Доля повторов пропорционально увеличивает общее число запросов и затраты.