Перейти к содержимому
Aback Tools Logo

Калькулятор упаковки контекста

Бесплатно оптимизируйте, сколько RAG-чанков помещается в контекстное окно любой модели. Настройте размер чанка, перекрытие, системный промпт, резерв под ответ и запас безопасности для GPT, Claude, Gemini, DeepSeek, Llama и Mistral. Мгновенно смотрите полную разбивку токенов, шкалу контекста и сравнение моделей.

Context Packing Calculator

Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Fixed Context Overhead

tokens
tokens
tokens
Fixed overhead: 1,050 tokens (1% of context)

Chunk Configuration

tokens
tokens
chunks

Safety Buffer & Volume

%
reqs

Max Chunks That Fit

326

of 400-token chunks

Tokens for Chunks

114.2K

of 128.0K ctx window

Unused Tokens

0

headroom remaining

Context Window Breakdown - GPT-4o

System (400)Query (150)Chunks (114.2K)Output (500)Buffer (12.8K)Unused (0)
Used: 115.2K (90%)Effective: 115.2KLimit: 128.0K
SlotTokens% of WindowNotes
System Prompt4000%Fixed overhead
User Query1500%Fixed overhead
Retrieved Chunks114,15089%326 × 400 tok
Output Reserve5000%Max response
Safety Buffer12,80010%10% headroom
Unused / Slack00%Free headroom

Monthly RAG Query Cost - 30,000 requests

$8,790.00GPT-4o

Per Query (Input)

$0.2880

Per Query (Output)

$0.005000

Total Per Query

$0.2930

Chunks That Fit - All Models

Sorted by most chunks first
ModelContextMax ChunksMonthly CostMin Met?
GoogleGemini 2.5 ProCapable
2.0M5,139$67,640.62 Yes
OpenAIGPT-5.4Capable
1.0M2,568$67,792.50 Yes
GoogleGemini 2.5 FlashBudget
1.0M2,568$8,136.60 Yes
GoogleGemini 3.5 FlashBudget
1.0M2,568$40,630.50 Yes
DeepSeekDeepSeek V4 ProBudget
1.0M2,568$11,756.75 Yes
DeepSeekDeepSeek V4 FlashBudget
1.0M2,568$3,783.78 Yes
MetaLlama 4 MaverickBudget
524.0K1,344$3,125.10 Yes
OpenAIo3 (Reasoning)
200.0K511$10,917.00 Yes
AnthropicClaude Sonnet 4.6Capable
200.0K511$16,420.50 Yes
AnthropicClaude Haiku 4.5Budget
200.0K511$5,473.50 Yes
AnthropicClaude Opus 4.8Capable
200.0K511$27,367.50 Yes
MistralMistral Large
131.1K333$7,149.00 Yes
MistralMistral SmallBudget
131.1K333$357.45 Yes
OpenAIGPT-4o Selected
128.0K326$8,790.00 Yes
OpenAIGPT-4o MiniBudget
128.0K326$527.40 Yes
Packing Formula: Chunk capacity = 1 + floor((available_tokens − chunk_size) / (chunk_size − overlap)). Available tokens = effective context − system prompt − query − output reserve. Effective context = context window × (1 − safety buffer%). Actual results may vary slightly due to tokenizer overhead on special tokens and message format wrappers.

Что расходует бюджет токенов запроса

Контекстное окно доступно не только извлечённым чанкам. Системный промпт, запрос пользователя, форматирование сообщений и ожидаемый ответ расходуют бюджет ещё до того, как попадёт первый документ.

Укажите размер окна, фиксированные токены и размер чанка, чтобы увидеть, сколько чанков реально помещается и сколько контекста остаётся неиспользованным.

  • Эффективный контекст = контекстное окно × (1 − запас безопасности).
  • Доступно = эффективный контекст − системный промпт − запрос − резерв под ответ.
  • Максимум чанков = 1 + floor((доступно − размер) / (размер − перекрытие)).

Баланс между чанками и структурой

Меньший чанк помещается чаще, но даёт меньше контекста. Больший чанк даёт больше контекста на единицу, но сокращает число разных документов.

  • Извлекать 3–8 чанков на запрос — отраслевая норма.
  • Перекрытие 10–15 % сохраняет непрерывность на границах.
  • Слишком малый резерв под ответ — частая причина обрезки вывода.

Настройка системы шаг за шагом

Начните с модели и контекстного окна, затем подбирайте размер чанка, пока не поместится достаточно релевантных документов с комфортным резервом под ответ.

  1. Выберите модель и задайте запас безопасности, чтобы получить эффективный контекст.
  2. Вычтите токены системного промпта, запроса и резерва под ответ.
  3. Настройте размер чанка и перекрытие до нужного числа чанков.
  4. Проверьте разбивку токенов и сравните с другой моделью перед внедрением.

Часто задаваемые вопросы

Он определяет, сколько извлечённых чанков документов помещается в контекстное окно языковой модели для одного RAG-запроса. Учитываются фиксированные затраты: системный промпт, запрос пользователя и резерв под ответ, после чего по формуле скользящего окна считается максимальное число чанков.

Формула: max_чанков = 1 + floor((доступные_токены − размер_чанка) / (размер_чанка − перекрытие)). Где доступные_токены = эффективный_контекст − токены_системного_промпта − токены_запроса − токены_резерва_ответа, а эффективный_контекст = контекстное_окно × (1 − запас_безопасности).

Большинство продакшен-RAG используют чанки от 256 до 512 токенов. Меньшие чанки повышают точность поиска, но требуют большего числа чанков на тему. Размер 400 токенов с перекрытием 10 % — распространённая отправная точка для RAG общего назначения.

Перекрытие означает, что соседние чанки делят часть токенов на границах. Это сохраняет непрерывность предложений и абзацев: информация, разделённая границей, доступна в обоих чанках, что улучшает полноту поиска. Типичное перекрытие — 10–15 % от размера чанка.

LLM использует одно и то же контекстное окно для входа и выхода. Если заполнить весь контекст токенами промпта, у модели не останется места на ответ. Всегда резервируйте минимум 256–512 токенов для коротких ответов и больше для длинных структурированных выводов.

Запас безопасности резервирует процент контекстного окна как допуск на вариативность токенизации. Реальные значения могут отличаться от оценок на несколько процентов из-за токенов форматирования сообщений и различий токенизаторов. Запас 5–10 % предотвращает ошибки переполнения в продакшене.

Большинство RAG-систем извлекают 3–8 чанков на запрос. Меньше 3 может не дать достаточного разнообразия контекста. Больше 8 размывает релевантность. Оптимум зависит от сценария: фактологический Q&A обычно требует 3–5 чанков, а синтез по документам выигрывает от 8–12.

Полностью. Калькулятор работает целиком в браузере. Размер чанка, счётчики токенов, настройки модели и оценки стоимости обрабатываются локально — ничего не отправляется на сервер. Конфигурация вашего RAG-конвейера остаётся на 100 % приватной.