Перейти к содержимому
Aback Tools Logo

Калькулятор размера чанка

Бесплатно найдите оптимальный размер чанка и перекрытие для вашего RAG-конвейера. Задайте размер корпуса, тип контента, модель эмбеддингов и контекстное окно LLM, чтобы получить оценки качества, анализ бюджета контекста и прогнозы стоимости эмбеддингов — полностью приватно, без регистрации.

Chunk Size Calculator

Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.

Document Corpus

tokens
docs

Blog posts, documentation, books, reports

Rec. chunk: 512 tokensRec. overlap: 10%

Chunk Configuration

tokens
64 (precise)5122048 (rich)
%

= 51 overlap tokens per chunk boundary

Model Configuration

$0.020/1M tokensMax input: 8,191 tokensRec: 512 tk/chunk
$2.50/1M inputContext: 128,000 tokens

Query Context Budget

tokens
tokens
chunks

Configuration Quality

100/ 100- Excellent

Chunk: 512 tokens

Overlap: 10% (51 tokens)

Chunk Size QualityExcellent (100/100)
Overlap QualityExcellent (100/100)

Chunks / Doc

109

Total Chunks

10,900

Max Chunks in Ctx

247

Context Used

3%

Query Context Breakdown

System Prompt500 tokens (0%)
5 Retrieved Chunks2,560 tokens (2%)
Answer Reserve1,000 tokens (1%)
Total per query4,060 / 128,000 tokens

Indexing Cost (one-time)

$0.1116

10,900 chunks × 512 tokens

Query Input Cost / Call

$0.0102

4,060 tokens on GPT-4o

Chunk Size Comparison

Your overlap: 10% fixed
Chunk SizeChunks/DocTotal ChunksEmbed CostCtx Fits?Quality
128 tokens
43543,500$0.1114✓ YesGood
256 tokens
21821,800$0.1116✓ YesExcellent
512 tokens Current
10910,900$0.1116✓ YesExcellent
768 tokens
737,300$0.1121✓ YesFair
1024 tokens
555,500$0.1126✓ YesGood
1500 tokens
373,700$0.1110✓ YesFair
2048 tokens
282,800$0.1147✓ YesPoor

Как размер чанка меняет качество и стоимость

Меньшие чанки повышают точность поиска, поскольку вектор отражает более узкое понятие, но дают модели меньше контекста. Большие чанки делают обратное: больше контекста на чанк, ниже точность и выше расход контекста на запрос.

Настройте размер корпуса и модель эмбеддингов, чтобы увидеть, как меняются оценка качества, стоимость индексации и расход на запрос.

  • Общая проза: 512 токенов с перекрытием 10–15 % — хороший старт.
  • Вопрос-ответ: 256 токенов; юридические документы: 800–1 024 токена.
  • Код: 256–512 токенов по границам функций с перекрытием 5–10 %.

Бюджет контекста и число чанков

Контекстное окно LLM должно вмещать системный промпт, извлечённые чанки и ожидаемый ответ. Извлекать больше чанков, чем помещается, не улучшает качество — только расходует бюджет.

  • Начните с извлечения 3–5 чанков и корректируйте по выбранному размеру.
  • При чанках по 256 токенов можно извлекать 8–10, не исчерпывая контекст.
  • Следите за лимитом входа модели эмбеддингов: превышение молча обрезает текст.

Итерации до рабочей конфигурации

Оптимум зависит от вашего корпуса и реальных запросов. Считайте калькулятор отправной точкой и проверяйте результат сквозными тестами поиска.

  1. Выберите начальный размер чанка по типу контента.
  2. Рассчитайте число чанков, стоимость индексации и расход на запрос.
  3. Сравните две-три конфигурации и посмотрите относительную оценку качества.
  4. Проверьте лучший вариант на реальных запросах до индексации всего корпуса.

Часто задаваемые вопросы

В RAG-конвейере документы делятся на меньшие сегменты — чанки — прежде чем их векторизуют и сохраняют в векторной базе. Размер чанка в токенах определяет, сколько текста содержит сегмент. Это важно, потому что напрямую влияет на точность поиска, насыщенность контекста, стоимость эмбеддингов и расход контекста LLM на запрос.

Для общей английской прозы часто берут 512 токенов с перекрытием 10–15 %. Документы «вопрос-ответ» выигрывают от чанков в 256 токенов. Юридические документы лучше работают с 800–1 024 токенами. Исходный код стоит делить на 256–512 токенов по границам функций. Всегда проверяйте результат сквозными тестами поиска.

Перекрытие повторяет последние N токенов одного чанка в начале следующего, чтобы контекст не обрывался на границах. Для прозы стандарт — 10–20 % от размера чанка. Слишком малое перекрытие даёт артефакты на границах, слишком большое раздувает векторное хранилище. Для кода обычно берут 5–10 %.

У каждой модели эмбеддингов есть предельный лимит входных токенов. OpenAI text-embedding-3-small поддерживает до 8 191 токена на вход, а Cohere embed-english-v3 — максимум 512. Калькулятор покажет предупреждение, если заданный размер чанка превышает лимит выбранной модели.

Частая отправная точка — 3–5 чанков. При меньших чанках (256 токенов) можно извлекать больше (8–10), не заполняя контекст. Используйте визуализацию бюджета контекста, чтобы убедиться, что системный промпт, извлечённые чанки и резерв под ответ помещаются в контекстное окно LLM.

Стоимость эмбеддингов = всего чанков × размер чанка в токенах × цена за токен модели. Например, 10 000 чанков по 512 токенов с OpenAI text-embedding-3-small (0,020 $/1 млн токенов) ≈ 0,10 $. Это разовая стоимость индексации: переиндексация нужна только при изменении документов или смене модели эмбеддингов.

Да, по обоим пунктам. Калькулятор полностью бесплатный, аккаунт не нужен. Все расчёты выполняются в вашем браузере: ни конфигурация, ни данные о затратах не отправляются на сервер. Дизайн вашего RAG-конвейера остаётся полностью приватным на вашем устройстве.