Перейти к содержимому
Aback Tools Logo

Калькулятор контекстного окна

Визуализируйте, как системный промпт, история диалога, RAG-документы и сообщение пользователя заполняют контекстное окно LLM. Добавляйте свои слоты, смотрите использование и остаток ёмкости, сравнивайте нагрузку по 16 популярным моделям и оценивайте стоимость входа — бесплатно и на 100 % приватно в браузере.

Context Window Calculator

Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Context Slots

System Prompt
0.4%
Conversation History
1.6%
Retrieved Documents (RAG)
3.1%
User Message
0.4%
Output Reserve
0.8%

Add Slot

Context Window Utilization - GPT-4o

6.3% used
System Prompt500
Conversation History2,000
Retrieved Documents (RAG)4,000
User Message500
Output Reserve1,000
Free120,000

Used

8,000

Limit

128,000

Remaining

120,000

Input Cost

$0.0200

Slot Breakdown

SlotTokens% of WindowInput Cost
System Prompt
5000.39%$0.001250
Conversation History
2,0001.56%$0.005000
Retrieved Documents (RAG)
4,0003.13%$0.0100
User Message
5000.39%$0.001250
Output Reserve
1,0000.78%$0.002500
Total8,0006.25%$0.0200

Same Payload Across Models

ModelContext Window% UsedFits?
GPT-4oSelected128,0006.3% Yes
GPT-4o mini128,0006.3% Yes
o3200,0004.0% Yes
o4-mini200,0004.0% Yes
Claude 3.7 Sonnet200,0004.0% Yes
Claude 3.5 Haiku200,0004.0% Yes
Claude Opus 4200,0004.0% Yes
Gemini 2.5 Pro2,000,0000.4% Yes
Gemini 2.5 Flash1,000,0000.8% Yes
DeepSeek-V4-Flash1,048,5760.8% Yes
DeepSeek-V4-Pro1,048,5760.8% Yes
Grok 3131,0726.1% Yes
Grok 3 Mini131,0726.1% Yes
Mistral Large131,0726.1% Yes
Mistral Small131,0726.1% Yes
Codestral256,0003.1% Yes
Note: Token counts entered here are the billable input tokens for each slot. Actual tokenization may vary slightly by model and content type (code vs. prose vs. non-English text). Context window limits shown are the maximum prompt+response window; reserve tokens for your expected output length.

Что действительно занимает ваше контекстное окно

В реальных приложениях системный промпт и история диалога часто расходуют больше контекста, чем документы, приносящие ответ. Визуализация по слотам делает этот дисбаланс заметным.

Добавьте слот на каждый компонент, укажите токены и посмотрите общее использование, остаток ёмкости и то, влезает ли нагрузка в каждую модель.

  • Окно делится между входом и выходом: промпт никогда не может занять его полностью.
  • История диалога растёт с каждой репликой и вытесняет полезные документы.
  • Переполнение подсвечивается красным до обращения к API.

Бюджет токенов на ответ

Самая частая ошибка — рассчитать промпт до последнего токена и забыть про ответ. Резерв под вывод входит в тот же бюджет.

  • Резервируйте 1 000–4 000 токенов для стандартных ответов.
  • Для кода или длинных отчётов резервируйте больше и сокращайте промпт.
  • Если резерв не влезает, сокращайте историю или документы, а не критичную инструкцию.

Сравнение моделей до решения

Одна и та же нагрузка может с запасом влезать в одну модель и переполнять другую. Сравнение нескольких моделей избавляет от смены провайдера после внедрения.

  1. Введите слоты промпта с их токенами.
  2. Задайте резерв под вывод, необходимый вашему сценарию.
  3. Посмотрите итоговое использование по каждой модели в списке.
  4. Выберите модель с нужным запасом при минимальной стоимости входа.

Часто задаваемые вопросы

Это максимальное число токенов, которое большая языковая модель обрабатывает в одном запросе. Оно включает весь промпт (системные инструкции, историю диалога, найденные документы и сообщение пользователя) плюс сгенерированный ответ. Если сумма превышает лимит, модель обрежет или отклонит запрос.

Контекстное окно — общий бюджет токенов на запрос, разделяемый между входом и выходом. Максимальные выходные токены — предельная длина сгенерированного ответа. Например, при окне 128 000 токенов и промпте на 120 000 остаётся только 8 000 токенов на ответ. Всегда резервируйте место под вывод при планировании.

Каждый слот этого калькулятора принимает число токенов напрямую. Если точное значение неизвестно, надёжная оценка — 1 токен на ~3,8–4,0 символа английской прозы, либо используйте наш инструмент подсчёта токенов по вставленному тексту. Для кода коэффициент зависит от языка и плотности символов.

Большинство API вернут ошибку (400 или 413), если промпт превышает лимит контекста модели. Некоторые модели молча обрезают самые старые реплики или начало промпта, что даёт неожиданное поведение. Калькулятор подсвечивает переполнение красным, чтобы вы заметили проблему до вызова API.

Контекстное окно — общий бюджет для промпта и ответа. Если промпт займёт всё окно, у модели не останется токенов на генерацию. Резервируйте как минимум ожидаемую максимальную длину ответа: обычно 1 000–4 000 токенов, больше для длинных генераций.

На середину 2026 года самое большое окно у Google Gemini 2.5 Pro — 2 000 000 токенов. Gemini 2.5 Flash и DeepSeek-V4-Flash поддерживают более 1 000 000 токенов. Модели Claude от Anthropic и o3/o4-mini от OpenAI поддерживают 200 000 токенов. GPT-4o, Grok 3 и модели Mistral обычно предлагают 128 000–131 072 токена.

Да. Калькулятор работает целиком в браузере. Названия слотов, счётчики токенов, выбор модели и все результаты обрабатываются локально на вашем устройстве и никогда не отправляются на сервер. Данные остаются на 100 % приватными — без регистрации, отслеживания и загрузок.