Калькулятор упаковки контекста
Бесплатно оптимизируйте, сколько RAG-чанков помещается в контекстное окно любой модели. Настройте размер чанка, перекрытие, системный промпт, резерв под ответ и запас безопасности для GPT, Claude, Gemini, DeepSeek, Llama и Mistral. Мгновенно смотрите полную разбивку токенов, шкалу контекста и сравнение моделей.
Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.
Fixed Context Overhead
Chunk Configuration
Safety Buffer & Volume
Max Chunks That Fit
326
of 400-token chunks
Tokens for Chunks
114.2K
of 128.0K ctx window
Unused Tokens
0
headroom remaining
Context Window Breakdown - GPT-4o
| Slot | Tokens | % of Window | Notes |
|---|---|---|---|
| System Prompt | 400 | 0% | Fixed overhead |
| User Query | 150 | 0% | Fixed overhead |
| Retrieved Chunks | 114,150 | 89% | 326 × 400 tok |
| Output Reserve | 500 | 0% | Max response |
| Safety Buffer | 12,800 | 10% | 10% headroom |
| Unused / Slack | 0 | 0% | Free headroom |
Monthly RAG Query Cost - 30,000 requests
Per Query (Input)
$0.2880
Per Query (Output)
$0.005000
Total Per Query
$0.2930
Chunks That Fit - All Models
Sorted by most chunks first| Model | Context | Max Chunks | Monthly Cost | Min Met? |
|---|---|---|---|---|
GoogleGemini 2.5 ProCapable | 2.0M | 5,139 | $67,640.62 | Yes |
OpenAIGPT-5.4Capable | 1.0M | 2,568 | $67,792.50 | Yes |
GoogleGemini 2.5 FlashBudget | 1.0M | 2,568 | $8,136.60 | Yes |
GoogleGemini 3.5 FlashBudget | 1.0M | 2,568 | $40,630.50 | Yes |
DeepSeekDeepSeek V4 ProBudget | 1.0M | 2,568 | $11,756.75 | Yes |
DeepSeekDeepSeek V4 FlashBudget | 1.0M | 2,568 | $3,783.78 | Yes |
MetaLlama 4 MaverickBudget | 524.0K | 1,344 | $3,125.10 | Yes |
OpenAIo3 (Reasoning) | 200.0K | 511 | $10,917.00 | Yes |
AnthropicClaude Sonnet 4.6Capable | 200.0K | 511 | $16,420.50 | Yes |
AnthropicClaude Haiku 4.5Budget | 200.0K | 511 | $5,473.50 | Yes |
AnthropicClaude Opus 4.8Capable | 200.0K | 511 | $27,367.50 | Yes |
MistralMistral Large | 131.1K | 333 | $7,149.00 | Yes |
MistralMistral SmallBudget | 131.1K | 333 | $357.45 | Yes |
OpenAIGPT-4o Selected | 128.0K | 326 | $8,790.00 | Yes |
OpenAIGPT-4o MiniBudget | 128.0K | 326 | $527.40 | Yes |
Что расходует бюджет токенов запроса
Контекстное окно доступно не только извлечённым чанкам. Системный промпт, запрос пользователя, форматирование сообщений и ожидаемый ответ расходуют бюджет ещё до того, как попадёт первый документ.
Укажите размер окна, фиксированные токены и размер чанка, чтобы увидеть, сколько чанков реально помещается и сколько контекста остаётся неиспользованным.
- Эффективный контекст = контекстное окно × (1 − запас безопасности).
- Доступно = эффективный контекст − системный промпт − запрос − резерв под ответ.
- Максимум чанков = 1 + floor((доступно − размер) / (размер − перекрытие)).
Баланс между чанками и структурой
Меньший чанк помещается чаще, но даёт меньше контекста. Больший чанк даёт больше контекста на единицу, но сокращает число разных документов.
- Извлекать 3–8 чанков на запрос — отраслевая норма.
- Перекрытие 10–15 % сохраняет непрерывность на границах.
- Слишком малый резерв под ответ — частая причина обрезки вывода.
Настройка системы шаг за шагом
Начните с модели и контекстного окна, затем подбирайте размер чанка, пока не поместится достаточно релевантных документов с комфортным резервом под ответ.
- Выберите модель и задайте запас безопасности, чтобы получить эффективный контекст.
- Вычтите токены системного промпта, запроса и резерва под ответ.
- Настройте размер чанка и перекрытие до нужного числа чанков.
- Проверьте разбивку токенов и сравните с другой моделью перед внедрением.
Часто задаваемые вопросы
Он определяет, сколько извлечённых чанков документов помещается в контекстное окно языковой модели для одного RAG-запроса. Учитываются фиксированные затраты: системный промпт, запрос пользователя и резерв под ответ, после чего по формуле скользящего окна считается максимальное число чанков.
Формула: max_чанков = 1 + floor((доступные_токены − размер_чанка) / (размер_чанка − перекрытие)). Где доступные_токены = эффективный_контекст − токены_системного_промпта − токены_запроса − токены_резерва_ответа, а эффективный_контекст = контекстное_окно × (1 − запас_безопасности).
Большинство продакшен-RAG используют чанки от 256 до 512 токенов. Меньшие чанки повышают точность поиска, но требуют большего числа чанков на тему. Размер 400 токенов с перекрытием 10 % — распространённая отправная точка для RAG общего назначения.
Перекрытие означает, что соседние чанки делят часть токенов на границах. Это сохраняет непрерывность предложений и абзацев: информация, разделённая границей, доступна в обоих чанках, что улучшает полноту поиска. Типичное перекрытие — 10–15 % от размера чанка.
LLM использует одно и то же контекстное окно для входа и выхода. Если заполнить весь контекст токенами промпта, у модели не останется места на ответ. Всегда резервируйте минимум 256–512 токенов для коротких ответов и больше для длинных структурированных выводов.
Запас безопасности резервирует процент контекстного окна как допуск на вариативность токенизации. Реальные значения могут отличаться от оценок на несколько процентов из-за токенов форматирования сообщений и различий токенизаторов. Запас 5–10 % предотвращает ошибки переполнения в продакшене.
Большинство RAG-систем извлекают 3–8 чанков на запрос. Меньше 3 может не дать достаточного разнообразия контекста. Больше 8 размывает релевантность. Оптимум зависит от сценария: фактологический Q&A обычно требует 3–5 чанков, а синтез по документам выигрывает от 8–12.
Полностью. Калькулятор работает целиком в браузере. Размер чанка, счётчики токенов, настройки модели и оценки стоимости обрабатываются локально — ничего не отправляется на сервер. Конфигурация вашего RAG-конвейера остаётся на 100 % приватной.