Перейти к содержимому
Aback Tools Logo

Калькулятор количества чанков

Оцените, сколько чанков даст ваш набор документов для RAG-конвейера — бесплатно и полностью приватно в браузере. Задайте число документов, среднее число слов, размер чанка, перекрытие и стратегию (фиксированный размер, скользящее окно, предложения, абзацы, рекурсивная или семантическая). Сразу получите общее число чанков, стоимость эмбеддингов у 5 провайдеров и оценки векторного хранилища.

Chunk Count Calculator

Estimate how many chunks your dataset produces based on document size, chunk size, overlap, and chunking strategy. See total embedding token counts, embedding costs, and vector storage requirements - instantly in your browser.

Dataset

docs
words
w/tok
Avg. tokens / doc: 667 · Total dataset tokens: 66,700

Splits text into equal-sized chunks. Simple and predictable.

Chunk Parameters

tokens
tokens
Cost/1M tokens: $0.020Dimensions: 1,536

Chunk Count Results

Total Chunks

200

Chunks / Doc

2

Avg Doc Tokens

667

Effective Tokens

462

per chunk

Embedding & Storage Estimates

Tokens to Embed

102,400

chunk_count × chunk_size

Embedding Cost

$0.0020

OpenAI text-embedding-3-small

Vector Storage

1.2 MB

1,536 dims × float32

Strategy Comparison (same dataset & chunk size)

StrategyTotal ChunksEmbed Costvs. Fixed
Fixed-Size (no overlap)Selected
200$0.0020Baseline
Sliding Window (with overlap)
200$0.0020Baseline
Sentence-Based
200$0.0020Baseline
Paragraph-Based
200$0.0020Baseline
Recursive Character Split
200$0.0020Baseline
Semantic Chunking
200$0.0020Baseline
Estimation note: Chunk counts are estimates. Sentence-based, paragraph-based, and semantic strategies produce variable chunk sizes depending on content structure. Embedding costs assume each chunk is embedded exactly once. Vector storage uses float32 (4 bytes/dim); actual storage may vary by database (quantization, metadata overhead). All calculations run locally in your browser.

Почему число чанков определяет стоимость RAG

В RAG-конвейере число чанков задаёт сразу две статьи затрат: создание эмбеддингов при загрузке и хранение векторов. Неудачная стратегия может умножить обе, не улучшив качество поиска.

Укажите число документов, среднее число слов, размер чанка и перекрытие, чтобы увидеть, сколько чанков получится и сколько будет стоить векторизация.

  • Чанки = ceil((токены документа − перекрытие) / (размер чанка − перекрытие)).
  • Стоимость эмбеддингов платится один раз при загрузке, но повторяется при смене контента или модели.
  • Реальное хранилище превышает грубую оценку из-за метаданных и индексов HNSW.

Выбор стратегии разбиения

Универсально лучшей стратегии нет. Фиксированный размер прост и предсказуем; семантический и рекурсивный подходы лучше сохраняют структуру документа, но дают менее предсказуемые затраты.

  • Фиксированный размер и скользящее окно: просто и удобно для бюджета.
  • По предложениям и абзацам: сохраняют смысловые единицы, числа менее ровные.
  • Рекурсивная и семантическая: лучше поиск, выше и менее предсказуемая стоимость.

Настройка размера и перекрытия

Начните с 512 токенов и перекрытия 50, измерьте качество поиска и корректируйте. Увеличение перекрытия улучшает непрерывность, но удорожает загрузку.

  1. Оцените число чанков при текущем размере и перекрытии.
  2. Рассчитайте получающиеся стоимость эмбеддингов и векторное хранилище.
  3. Проверьте вторую конфигурацию (например, 256 токенов) и сравните сценарии.
  4. Выберите вариант с лучшим балансом поиска, стоимости и объёма хранилища.

Часто задаваемые вопросы

Чанк — это фрагмент текста фиксированной или переменной длины, получаемый при разбиении большого документа. В RAG-системе документы делятся на чанки, каждый чанк превращается в векторный эмбеддинг, а эмбеддинги хранятся в векторной базе. При запросе выбираются семантически наиболее близкие чанки и вставляются как контекст в промпт LLM.

Для разбиения фиксированного размера: чанки = ceil((токены_документа − перекрытие) / (размер_чанка − перекрытие)). Документ на 1 000 токенов при размере чанка 512 и перекрытии 50 даёт ceil((1000 − 50) / (512 − 50)) = ceil(950 / 462) = 3 чанка на документ. Стратегии по предложениям и абзацам дают немного другие значения из-за выравнивания границ.

Частая отправная точка — 512 токенов с перекрытием 50 для документов с прозой. Меньшие чанки (128–256 токенов) повышают точность поиска, но могут терять контекст. Большие (1024+ токенов) дают более богатый контекст, но снижают релевантность. Оптимум зависит от типа документа, стиля запросов и модели эмбеддингов. Всегда проверяйте качество поиска эмпирически на своих данных.

Токены перекрытия дублируются между соседними чанками. При размере 512 и перекрытии 50 последние 50 токенов чанка N становятся первыми 50 токенами чанка N+1. Это защищает от потери информации на границах и улучшает непрерывность для запросов, пересекающих границы. Перекрытие пропорционально увеличивает общее число чанков и стоимость эмбеддингов.

Стоимость эмбеддингов = всего_чанков × токенов_на_чанк / 1 000 000 × цена_за_миллион_токенов. Например, 1 000 чанков × 512 токенов = 512 000 токенов на векторизацию. При OpenAI text-embedding-3-small (0,020 $/млн токенов) это 0,0102 $. Каждый чанк векторизуется один раз при загрузке — повторно нужно только при изменении контента.

Векторное хранилище = всего_чанков × размерность_эмбеддинга × 4 байта (float32). Для 10 000 чанков с OpenAI text-embedding-3-small (1 536 измерений): 10 000 × 1 536 × 4 = ~61,4 МБ сырых векторов. Реальное хранилище больше из-за метаданных, структур индексации (графы HNSW) и репликации. Квантованные модели (int8) уменьшают оценку вдвое.

Да. Калькулятор работает полностью в браузере. Ни содержимое документов, ни детали набора данных, ни конфигурация не отправляются на сервер. Все расчёты — число чанков, стоимость эмбеддингов, оценка хранилища — выполняются локально на вашем устройстве. Данные остаются на 100 % приватными, регистрация не нужна.