Калькулятор размера чанка
Бесплатно найдите оптимальный размер чанка и перекрытие для вашего RAG-конвейера. Задайте размер корпуса, тип контента, модель эмбеддингов и контекстное окно LLM, чтобы получить оценки качества, анализ бюджета контекста и прогнозы стоимости эмбеддингов — полностью приватно, без регистрации.
Find the optimal chunk size for your RAG pipeline. Configure document size, content type, embedding model, and LLM context window to get recommended chunk settings, quality scores, and cost projections.
Document Corpus
Blog posts, documentation, books, reports
Chunk Configuration
= 51 overlap tokens per chunk boundary
Model Configuration
Query Context Budget
Configuration Quality
Chunk: 512 tokens
Overlap: 10% (51 tokens)
Chunks / Doc
109
Total Chunks
10,900
Max Chunks in Ctx
247
Context Used
3%
Query Context Breakdown
Indexing Cost (one-time)
$0.1116
10,900 chunks × 512 tokens
Query Input Cost / Call
$0.0102
4,060 tokens on GPT-4o
Chunk Size Comparison
Your overlap: 10% fixed| Chunk Size | Chunks/Doc | Total Chunks | Embed Cost | Ctx Fits? | Quality |
|---|---|---|---|---|---|
128 tokens | 435 | 43,500 | $0.1114 | ✓ Yes | Good |
256 tokens | 218 | 21,800 | $0.1116 | ✓ Yes | Excellent |
512 tokens Current | 109 | 10,900 | $0.1116 | ✓ Yes | Excellent |
768 tokens | 73 | 7,300 | $0.1121 | ✓ Yes | Fair |
1024 tokens | 55 | 5,500 | $0.1126 | ✓ Yes | Good |
1500 tokens | 37 | 3,700 | $0.1110 | ✓ Yes | Fair |
2048 tokens | 28 | 2,800 | $0.1147 | ✓ Yes | Poor |
Как размер чанка меняет качество и стоимость
Меньшие чанки повышают точность поиска, поскольку вектор отражает более узкое понятие, но дают модели меньше контекста. Большие чанки делают обратное: больше контекста на чанк, ниже точность и выше расход контекста на запрос.
Настройте размер корпуса и модель эмбеддингов, чтобы увидеть, как меняются оценка качества, стоимость индексации и расход на запрос.
- Общая проза: 512 токенов с перекрытием 10–15 % — хороший старт.
- Вопрос-ответ: 256 токенов; юридические документы: 800–1 024 токена.
- Код: 256–512 токенов по границам функций с перекрытием 5–10 %.
Бюджет контекста и число чанков
Контекстное окно LLM должно вмещать системный промпт, извлечённые чанки и ожидаемый ответ. Извлекать больше чанков, чем помещается, не улучшает качество — только расходует бюджет.
- Начните с извлечения 3–5 чанков и корректируйте по выбранному размеру.
- При чанках по 256 токенов можно извлекать 8–10, не исчерпывая контекст.
- Следите за лимитом входа модели эмбеддингов: превышение молча обрезает текст.
Итерации до рабочей конфигурации
Оптимум зависит от вашего корпуса и реальных запросов. Считайте калькулятор отправной точкой и проверяйте результат сквозными тестами поиска.
- Выберите начальный размер чанка по типу контента.
- Рассчитайте число чанков, стоимость индексации и расход на запрос.
- Сравните две-три конфигурации и посмотрите относительную оценку качества.
- Проверьте лучший вариант на реальных запросах до индексации всего корпуса.
Часто задаваемые вопросы
В RAG-конвейере документы делятся на меньшие сегменты — чанки — прежде чем их векторизуют и сохраняют в векторной базе. Размер чанка в токенах определяет, сколько текста содержит сегмент. Это важно, потому что напрямую влияет на точность поиска, насыщенность контекста, стоимость эмбеддингов и расход контекста LLM на запрос.
Для общей английской прозы часто берут 512 токенов с перекрытием 10–15 %. Документы «вопрос-ответ» выигрывают от чанков в 256 токенов. Юридические документы лучше работают с 800–1 024 токенами. Исходный код стоит делить на 256–512 токенов по границам функций. Всегда проверяйте результат сквозными тестами поиска.
Перекрытие повторяет последние N токенов одного чанка в начале следующего, чтобы контекст не обрывался на границах. Для прозы стандарт — 10–20 % от размера чанка. Слишком малое перекрытие даёт артефакты на границах, слишком большое раздувает векторное хранилище. Для кода обычно берут 5–10 %.
У каждой модели эмбеддингов есть предельный лимит входных токенов. OpenAI text-embedding-3-small поддерживает до 8 191 токена на вход, а Cohere embed-english-v3 — максимум 512. Калькулятор покажет предупреждение, если заданный размер чанка превышает лимит выбранной модели.
Частая отправная точка — 3–5 чанков. При меньших чанках (256 токенов) можно извлекать больше (8–10), не заполняя контекст. Используйте визуализацию бюджета контекста, чтобы убедиться, что системный промпт, извлечённые чанки и резерв под ответ помещаются в контекстное окно LLM.
Стоимость эмбеддингов = всего чанков × размер чанка в токенах × цена за токен модели. Например, 10 000 чанков по 512 токенов с OpenAI text-embedding-3-small (0,020 $/1 млн токенов) ≈ 0,10 $. Это разовая стоимость индексации: переиндексация нужна только при изменении документов или смене модели эмбеддингов.
Да, по обоим пунктам. Калькулятор полностью бесплатный, аккаунт не нужен. Все расчёты выполняются в вашем браузере: ни конфигурация, ни данные о затратах не отправляются на сервер. Дизайн вашего RAG-конвейера остаётся полностью приватным на вашем устройстве.