Калькулятор использования контекста
Проанализируйте, сколько контекстного окна модели занимают ваши входные данные — онлайн, бесплатно и на 100 % приватно. Разбейте промпт на именованные сегменты (системный промпт, история, документы, сообщение пользователя), задайте резерв под ответ и мгновенно получите процентную разбивку по сегментам для GPT-4o, Claude, Gemini, Mistral, DeepSeek и других.
Break your prompt into named components - system prompt, conversation history, retrieved documents, user message - and instantly see how much of the selected model's context window each part consumes. Supports all major LLMs with live percentage breakdowns.
Reserve space for the model's reply. Most responses use 500-4,000 tokens. Instruction tasks average ~1,000; code generation averages ~2,000.
Context Window Breakdown - GPT-4o
Segment Breakdown
| Segment | Tokens | % of Context | % of Input | Input Cost |
|---|---|---|---|---|
System Prompt | ~500 | 0% | 4% | $0.001250 |
Conversation History | ~3,000 | 2% | 26% | $0.007500 |
Retrieved Documents | ~8,000 | 6% | 68% | $0.0200 |
User Message | ~200 | 0% | 2% | $0.000500 |
Output Reserve | ~2,000 | 2% | - | - |
| Total | ~13,700 | 10.7% | - | $0.0293 |
Input Tokens
~11,700
Context Remaining
114,300
Context Used
10.7%
Input Cost
$0.0293
Что скрывает заполнение контекста
Знание, что промпт занимает 70 % окна, ничего не говорит о том, какая часть приносит пользу. Разбивка по сегментам показывает, вытесняет ли история диалога найденные документы или системный промпт стал непропорционально большим.
Добавьте по сегменту на каждый компонент промпта и укажите их токены, чтобы увидеть долю каждого и реальную оставшуюся ёмкость.
- Всегда отделяйте системный промпт, историю, документы и сообщение пользователя.
- Каждый токен контекста стоит денег при каждом запросе, а не один раз.
- Резерв под ответ предотвращает ошибки из-за слишком длинного промпта.
Эффект «потеряно в середине»
Длинный контекст обрабатывается неравномерно. Информация в середине обычно меньше влияет на ответ, даже если модель её видит.
- Помещайте критичные инструкции в начало и конец промпта.
- Держите заполнение ниже 80 %, когда важен поиск по контексту.
- Сначала сокращайте историю диалога, а потом найденные документы.
Настройка промпта по данным
Измерение по сегментам превращает настройку промпта в обоснованное решение, а не в слепое урезание при каждой ошибке контекста.
- Вставьте или оцените размер каждого сегмента промпта.
- Проверьте долю каждого и найдите главного потребителя.
- Сократите доминирующий сегмент и посмотрите новое общее заполнение.
- Повторите для других моделей, чтобы увидеть выигранный или потерянный запас.
Часто задаваемые вопросы
Это инструмент, показывающий, сколько контекстного окна языковой модели занимают ваши входные данные, с разбивкой по сегментам. Вы задаёте компоненты промпта (системные инструкции, история диалога, найденные документы, сообщение пользователя), а калькулятор показывает число токенов каждого, их долю от всего окна и вклад в стоимость API. Это помогает проектировать промпты, надёжно вписывающиеся в лимиты модели.
Контекстное окно — максимальное число токенов, которое LLM обрабатывает в одном запросе, включая весь промпт, историю диалога, документы и сгенерированный ответ. Если вход превышает окно, модель обрежет вход или отклонит запрос с ошибкой. Контроль использования контекста критичен для многошаговых чат-ботов, RAG-конвейеров и любых приложений с большими документами.
Оценки точны в пределах ±5–10 % для типичной английской прозы при использовании опубликованного среднего коэффициента символов на токен для семейства моделей. Тексты на других языках, код с обилием символов и контент с плотной пунктуацией могут токенизироваться иначе. Для точных продакшен-значений используйте официальный токенизатор провайдера (tiktoken у OpenAI, countTokens у Anthropic, API countTokens у Google).
Да. В каждой строке сегмента есть переключатель единиц: токены, символы и слова. Калькулятор автоматически переводит символы и слова в оценку токенов по коэффициенту выбранной модели. Это удобно, когда вы знаете число символов документа или слов фрагмента, но не прогоняли текст через токенизатор.
Оно вычитает фиксированное число токенов из доступного контекста с учётом ответа модели. Поскольку окно должно вмещать и вход, и выход, важно оставлять достаточный запас. Типичные резервы: 500–1 000 токенов для коротких ответов, 2 000 для генерации кода и 4 000+ для длинных отчётов.
Исследования и практика показывают, что модели с очень длинным контекстом недооценивают информацию в середине окна — эффект «lost in the middle». Для лучшей работы поиска держите критичные инструкции в начале и в конце промпта и старайтесь не превышать 80 % заполнения.
Да. Калькулятор работает полностью на стороне клиента, в браузере. Текст промпта, размеры сегментов и анализ использования рассчитываются локально на вашем устройстве и никогда не отправляются на сервер. Можно безопасно вставлять конфиденциальные документы, проприетарный код и чувствительные инструкции.