Каждый вызов API к GPT, Claude, Gemini или любой другой большой языковой модели имеет стоимость, измеряемую в токенах, и при масштабировании она растёт очень быстро. Калькулятор стоимости запросов переводит токены в деньги, чтобы вы могли точно планировать бюджет, выбирать нужный уровень модели и находить точки оптимизации до того, как месячный счёт за API станет неприятной неожиданностью.
Что такое калькулятор стоимости запросов?
Калькулятор стоимости запросов - инструмент, который оценивает стоимость одного вызова API к большой языковой модели (LLM). Вы задаёте число входных токенов (промпт, контекст и извлечённые документы), ожидаемое число выходных токенов (ответ модели) и целевую модель. Калькулятор умножает каждое значение на опубликованную цену за токен у провайдера и возвращает стоимость одного запроса, а также прогноз за месяц исходя из ожидаемого объёма вызовов.
Главная цель - сделать расходы на ИИ предсказуемыми. Без калькулятора легко недооценить, как быстро накапливаются токены при масштабировании. Запрос за 0,012 $ кажется незначительным, но при 10 000 вызовов в день это 120 $ в день, или 3 600 $ в месяц, из одной точки API. Калькуляторы стоимости запросов показывают это до развёртывания, а не после.
Что показывает калькулятор стоимости запросов
- Стоимость одного запроса - точная сумма за один вызов API при ваших числах токенов и выбранной модели.
- Прогноз на день и месяц - переносит стоимость запроса на ожидаемый объём вызовов.
- Разбивка затрат на ввод и вывод - показывает, какая часть стоимости приходится на промпт, а какая на ответ, поскольку выходные токены дороже.
- Сравнение моделей - некоторые калькуляторы позволяют сразу сравнить стоимость одного и того же запроса в нескольких моделях.
Note
Как работает оплата за токены у LLM
Провайдеры LLM берут плату за токен - единицу текста, примерно равную 0,75 слова в английском (около 4 символов). Цены указывают за миллион токенов ($/M) отдельно для ввода и вывода. Входные токены включают всё, что вы отправляете: системный промпт, историю диалога, сообщение пользователя, фрагменты документов из RAG-конвейеров, схемы функций и инструментов. Выходные токены - сгенерированный моделью ответ.
Входные и выходные токены оплачиваются отдельно. Выходные токены стоят в 3-5 раз дороже входных, потому что генерация текста вычислительно дороже обработки контекста.
Почему выходные токены дороже
При инференсе обработка входных токенов требует одного прямого прохода через модель. Генерация выходных токенов требует авторегрессионного цикла: модель создаёт по одному токену, и каждый шаг зависит от предыдущего. Этот последовательный процесс намного интенсивнее по нагрузке на GPU на каждый токен, поэтому провайдеры берут заметную надбавку за вывод. При ценах GPT-4o ввод стоит 2,50 $/M, а вывод 10,00 $/M - множитель 4. Отсюда прямое практическое следствие: длинные и многословные ответы стоят несоразмерно дороже кратких.
Как число токенов соотносится с реальной длиной промпта
- Короткий промпт + короткий ответ (например, «Классифицируй этот текст»): всего ~50-200 токенов.
- Системное сообщение + запрос с контекстом: ~500-2 000 входных токенов, 100-500 выходных.
- RAG-запрос с фрагментами документов: ~2 000-8 000 входных токенов, 300-1 000 выходных.
- Агентный процесс с результатами инструментов и историей: ~8 000-32 000 входных токенов на вызов.
- Длинная генерация (статья, код): ~1 000-4 000 входных токенов, 1 000-4 000 выходных.
Tip
Как оценить свои расходы на запросы
Точная оценка расходов на запросы требует трёх чисел: среднего числа входных токенов на вызов, среднего числа выходных токенов на вызов и суточного объёма вызовов. Первые два лучше измерять эмпирически - счётчиком токенов провайдера или полем `usage` в ответах API, а не оценивать по количеству слов.
Шаг 1 - Измерьте реальный расход токенов в разработке
Каждый ответ API LLM содержит объект `usage` с полями `prompt_tokens`, `completion_tokens` и `total_tokens`. Логируйте эти значения во время разработки на репрезентативной выборке из 50-100 реальных запросов. Посчитайте среднее и 95-й процентиль для ввода и вывода. Для планирования расходов используйте 95-й процентиль ввода и среднее по выводу: так вы учтёте крупные выбросы контекста, не переоценивая типичный вызов.
Шаг 2 - Оцените месячный объём
Для продакшен-приложений считайте так: активные пользователи в день × среднее число запросов за сессию × вызовы API на запрос. Чат-бот с 1 000 пользователей в день, 5 сообщениями за сессию и 1 вызовом API на сообщение создаёт 5 000 вызовов в день. Умножьте стоимость вызова на суточный объём, а затем на 30 для месячного прогноза. Заложите запас 30-50 % на пики трафика и итерации промпт-инжиниринга.
Шаг 3 - Сравните уровни моделей
Прогоните те же числа токенов через несколько уровней моделей, чтобы понять, где требования к качеству позволяют взять более дешёвую модель. Многие задачи - классификация, извлечение сущностей, простое суммирование, ответы на частые вопросы - дают приемлемое качество на меньшей и более дешёвой модели. Оставлять флагманские модели (класса GPT-4, класса Claude 3.5 Sonnet) для того подмножества задач, где они действительно нужны, и направлять простые задачи на дешёвые модели - обычно самая эффективная мера снижения расходов.
Конвертер JSON в TOON
Преобразуйте JSON в компактный формат TOON и сократите расход токенов LLM на 30-60 % - это напрямую снижает стоимость входных токенов каждого запроса со структурированными JSON-данными.
Сравнение расходов по основным моделям LLM
Цены на модели меняются часто: под давлением конкуренции провайдеры заметно их снизили. Таблица ниже показывает ориентировочные ценовые уровни середины 2026 года, чтобы проиллюстрировать структуру расходов. Всегда проверяйте актуальные цены на официальной странице тарифов провайдера, прежде чем строить производственные прогнозы.
| Уровень модели | Ввод ($/M токенов) | Вывод ($/M токенов) | Для чего лучше |
|---|---|---|---|
| Класс GPT-4o Mini | 0,15-0,50 $ | 0,60-2,00 $ | Классификация, извлечение |
| Класс Gemini Flash | 0,10-0,35 $ | 0,40-1,50 $ | Суммаризация больших объёмов |
| Класс Claude Haiku | 0,25-0,80 $ | 1,25-4,00 $ | Быстрый структурированный вывод |
| Класс GPT-4o | 2,50-5,00 $ | 10-20 $ | Сложные рассуждения, код |
| Класс Claude Sonnet | 3,00-15,00 $ | 15-75 $ | Анализ, длинный контекст |
| Класс o1 / рассуждающие | 15-60 $ | 60-240 $ | Многошаговая логика, математика |
Разница в стоимости между самым дешёвым и самым дорогим уровнями составляет два порядка. Приложение с 10 000 запросов в день на модели класса o1 стоит примерно 60-240 $ в день; то же приложение с GPT-4o Mini стоит 1,50-20 $ в день. Маршрутизация по сложности задачи - классификатор, направляющий каждый вызов на подходящий уровень модели - может снизить общие расходы на API на 60-80 % в конвейерах со смешанной сложностью.
Размер контекстного окна и компромисс по цене
Большие контекстные окна позволяют включать больше информации на запрос, но больше токенов в промпте означает более высокую стоимость ввода. Контекстное окно на 100 000 токенов оправдано только тогда, когда дополнительный контекст действительно улучшает качество ответа для этой задачи. В большинстве RAG-приложений 2 000-4 000 токенов извлечённого контекста дают почти такие же результаты, как 20 000 токенов, при стоимости ввода в 5-10 раз ниже. Всегда сравнивайте качество и длину контекста, прежде чем закреплять большие промпты в продакшене.
Note
Стратегии снижения расходов на запросы
Оптимизация стоимости запросов опирается на два рычага: сокращение числа токенов на запрос и снижение цены за токен. Приведённые стратегии работают с обоими и упорядочены примерно по возрастанию трудозатрат на внедрение.
- Сжимайте входные данные перед подстановкой - конвертируйте нагрузки JSON, CSV или YAML в формат TOON перед включением в промпт. Конвертер JSON в TOON сокращает число токенов на 30-60 % без потери информации.
- Используйте самую дешёвую модель, отвечающую требованиям - проверяйте каждый тип задачи на младших уровнях моделей, прежде чем считать, что нужна флагманская. Многие задачи извлечения, классификации и суммирования хорошо решаются на GPT-4o Mini или Gemini Flash.
- Сокращайте и чистите системные промпты - проверьте системный промпт на избыточные инструкции, длинные примеры форматирования и повторяющиеся оговорки. Каждый убранный токен экономит деньги при каждом вызове API.
- Ограничивайте длину вывода через max_tokens - просите отвечать кратко и задавайте жёсткий потолок max_tokens. Выходные токены стоят в 3-5 раз дороже входных, поэтому сокращение многословных ответов напрямую уменьшает самую дорогую часть счёта.
- Включите кэширование промптов - используйте встроенное кэширование провайдера для статических системных промптов и few-shot примеров. Кэшированные токены у OpenAI и Anthropic стоят на 50-90 % меньше.
- Кэшируйте ответы на частые запросы - для детерминированных или почти детерминированных запросов сохраняйте ответ LLM и отдавайте его на повторяющиеся идентичные входы без вызова API.
Сжатие токенов: самый быстрый путь к экономии
Для приложений, передающих структурированные данные в LLM - каталоги товаров, записи пользователей, аналитические выгрузки, ответы API, - сжатие входных токенов даёт самое быстрое и стабильное снижение расходов. JSON-нагрузка на 2 000 токенов в формате TOON сокращается примерно до 800-1 400 токенов. При 3,00 $/M входных токенов и 50 000 запросов в день это единственное изменение экономит 0,09-0,18 $ в день - примерно 33-66 $ в месяц без потери качества. Для данных CSV конвертер CSV в TOON даёт экономию 40-60 % токенов на табличных наборах, а конвертер YAML в TOON обрабатывает конфигурации и структурированные данные в формате YAML.
Tip
Когда стоимость запросов становится проблемой
Для отдельных разработчиков и небольших проектов расходы на токены редко значимы: 5-20 $ в месяц на эксперименты и разработку. Проблема возникает, когда функция выходит на производственный объём, когда промпты включают большие объёмы контекста или когда конвейер объединяет несколько вызовов API на одно действие пользователя. Именно в этих сценариях расчёты стоимости запросов становятся критичными.
Агентные и многошаговые конвейеры
Агентные процессы, объединяющие несколько вызовов LLM - планирование, использование инструментов, рефлексия, суммирование, - могут накопить 10 000-100 000 токенов в рамках одного запроса пользователя, который выглядит как одно взаимодействие. Результат каждого вызова инструмента и каждая реплика диалога заново подставляются как контекст для следующего вызова, из-за чего число токенов растёт квадратично с числом шагов. Для таких конвейеров оценка стоимости одного запроса пользователя требует умножения стоимости одного вызова на среднее число вызовов LLM за одно исполнение.
RAG-приложения с большими фрагментами документов
Конвейеры генерации с дополнением по поиску вставляют извлечённые фрагменты в каждый промпт. Если стратегия разбиения даёт крупные фрагменты (1 000-4 000 токенов каждый) и на запрос извлекается три-пять фрагментов, число входных токенов может достигать 5 000-20 000 на вызов ещё до включения вопроса пользователя. Сжатие извлечённых фрагментов форматом вроде TOON - или уменьшение их размера в конвейере эмбеддингов - напрямую снижает стоимость запроса без изменения качества поиска. О том, где в таком конвейере находится валидация структурированного вывода, рассказывает руководство по Guardrails AI - там описан слой проверки, идущий после поиска.
Warning
Конвертер CSV в TOON
Преобразуйте наборы данных CSV в компактный формат TOON с экономией токенов 40-60 % - самый быстрый способ снизить стоимость входных токенов запросов, передающих табличные данные в API LLM.
Key takeaways
- Калькулятор стоимости запросов оценивает расход на один вызов API LLM по входным токенам, выходным токенам и модели - необходим для планирования бюджета до вывода ИИ-функции в продакшен.
- Цена LLM делится на входные токены (промпт и контекст) и выходные (ответ), причём вывод стоит в 3-5 раз дороже, потому что генерация вычислительно тяжелее.
- Запрос за 0,012 $ превращается в 3 600 $ в месяц при 10 000 вызовах в день - всегда моделируйте расходы на производственном объёме, а не за один запрос.
- Выбор самого дешёвого уровня модели, отвечающего требованиям качества, - главный рычаг: флагманские модели стоят в 10-100 раз дороже малых на задачах, где справляются обе.
- Сжатие токенов - конвертация нагрузок JSON, CSV или YAML в формат TOON - снижает число входных токенов на 30-60 % без потери качества, с помощью конвертера JSON в TOON или конвертера CSV в TOON.
- Кэширование промптов (доступно у OpenAI и Anthropic) снижает стоимость кэшированных входных токенов на 50-90 % для статических системных промптов - включайте его в любом продакшен-приложении с большим фиксированным системным промптом.
- Всегда измеряйте реальный расход токенов по полю `usage` в ответах API, а не оценивайте по числу слов: код и JSON токенизируются гораздо менее эффективно, чем английский текст.