Калькулятор количества чанков
Оцените, сколько чанков даст ваш набор документов для RAG-конвейера — бесплатно и полностью приватно в браузере. Задайте число документов, среднее число слов, размер чанка, перекрытие и стратегию (фиксированный размер, скользящее окно, предложения, абзацы, рекурсивная или семантическая). Сразу получите общее число чанков, стоимость эмбеддингов у 5 провайдеров и оценки векторного хранилища.
Estimate how many chunks your dataset produces based on document size, chunk size, overlap, and chunking strategy. See total embedding token counts, embedding costs, and vector storage requirements - instantly in your browser.
Dataset
Splits text into equal-sized chunks. Simple and predictable.
Chunk Parameters
Chunk Count Results
Total Chunks
200
Chunks / Doc
2
Avg Doc Tokens
667
Effective Tokens
462
per chunk
Embedding & Storage Estimates
Tokens to Embed
102,400
chunk_count × chunk_size
Embedding Cost
$0.0020
OpenAI text-embedding-3-small
Vector Storage
1.2 MB
1,536 dims × float32
Strategy Comparison (same dataset & chunk size)
| Strategy | Total Chunks | Embed Cost | vs. Fixed |
|---|---|---|---|
Fixed-Size (no overlap)Selected | 200 | $0.0020 | Baseline |
Sliding Window (with overlap) | 200 | $0.0020 | Baseline |
Sentence-Based | 200 | $0.0020 | Baseline |
Paragraph-Based | 200 | $0.0020 | Baseline |
Recursive Character Split | 200 | $0.0020 | Baseline |
Semantic Chunking | 200 | $0.0020 | Baseline |
Почему число чанков определяет стоимость RAG
В RAG-конвейере число чанков задаёт сразу две статьи затрат: создание эмбеддингов при загрузке и хранение векторов. Неудачная стратегия может умножить обе, не улучшив качество поиска.
Укажите число документов, среднее число слов, размер чанка и перекрытие, чтобы увидеть, сколько чанков получится и сколько будет стоить векторизация.
- Чанки = ceil((токены документа − перекрытие) / (размер чанка − перекрытие)).
- Стоимость эмбеддингов платится один раз при загрузке, но повторяется при смене контента или модели.
- Реальное хранилище превышает грубую оценку из-за метаданных и индексов HNSW.
Выбор стратегии разбиения
Универсально лучшей стратегии нет. Фиксированный размер прост и предсказуем; семантический и рекурсивный подходы лучше сохраняют структуру документа, но дают менее предсказуемые затраты.
- Фиксированный размер и скользящее окно: просто и удобно для бюджета.
- По предложениям и абзацам: сохраняют смысловые единицы, числа менее ровные.
- Рекурсивная и семантическая: лучше поиск, выше и менее предсказуемая стоимость.
Настройка размера и перекрытия
Начните с 512 токенов и перекрытия 50, измерьте качество поиска и корректируйте. Увеличение перекрытия улучшает непрерывность, но удорожает загрузку.
- Оцените число чанков при текущем размере и перекрытии.
- Рассчитайте получающиеся стоимость эмбеддингов и векторное хранилище.
- Проверьте вторую конфигурацию (например, 256 токенов) и сравните сценарии.
- Выберите вариант с лучшим балансом поиска, стоимости и объёма хранилища.
Часто задаваемые вопросы
Чанк — это фрагмент текста фиксированной или переменной длины, получаемый при разбиении большого документа. В RAG-системе документы делятся на чанки, каждый чанк превращается в векторный эмбеддинг, а эмбеддинги хранятся в векторной базе. При запросе выбираются семантически наиболее близкие чанки и вставляются как контекст в промпт LLM.
Для разбиения фиксированного размера: чанки = ceil((токены_документа − перекрытие) / (размер_чанка − перекрытие)). Документ на 1 000 токенов при размере чанка 512 и перекрытии 50 даёт ceil((1000 − 50) / (512 − 50)) = ceil(950 / 462) = 3 чанка на документ. Стратегии по предложениям и абзацам дают немного другие значения из-за выравнивания границ.
Частая отправная точка — 512 токенов с перекрытием 50 для документов с прозой. Меньшие чанки (128–256 токенов) повышают точность поиска, но могут терять контекст. Большие (1024+ токенов) дают более богатый контекст, но снижают релевантность. Оптимум зависит от типа документа, стиля запросов и модели эмбеддингов. Всегда проверяйте качество поиска эмпирически на своих данных.
Токены перекрытия дублируются между соседними чанками. При размере 512 и перекрытии 50 последние 50 токенов чанка N становятся первыми 50 токенами чанка N+1. Это защищает от потери информации на границах и улучшает непрерывность для запросов, пересекающих границы. Перекрытие пропорционально увеличивает общее число чанков и стоимость эмбеддингов.
Стоимость эмбеддингов = всего_чанков × токенов_на_чанк / 1 000 000 × цена_за_миллион_токенов. Например, 1 000 чанков × 512 токенов = 512 000 токенов на векторизацию. При OpenAI text-embedding-3-small (0,020 $/млн токенов) это 0,0102 $. Каждый чанк векторизуется один раз при загрузке — повторно нужно только при изменении контента.
Векторное хранилище = всего_чанков × размерность_эмбеддинга × 4 байта (float32). Для 10 000 чанков с OpenAI text-embedding-3-small (1 536 измерений): 10 000 × 1 536 × 4 = ~61,4 МБ сырых векторов. Реальное хранилище больше из-за метаданных, структур индексации (графы HNSW) и репликации. Квантованные модели (int8) уменьшают оценку вдвое.
Да. Калькулятор работает полностью в браузере. Ни содержимое документов, ни детали набора данных, ни конфигурация не отправляются на сервер. Все расчёты — число чанков, стоимость эмбеддингов, оценка хранилища — выполняются локально на вашем устройстве. Данные остаются на 100 % приватными, регистрация не нужна.