Перейти к содержимому
Aback Tools Logo

Калькулятор размера базы знаний

Оцените требования к хранению, размер векторного индекса и затраты на загрузку эмбеддингов вашей ИИ-базы знаний. Задайте число документов, среднюю длину, размер чанка и перекрытие, чтобы увидеть общее число чанков и размер индекса в ГБ. Сравните 9 моделей эмбеддингов и 7 векторных баз данных и спрогнозируйте рост хранения и затрат на 1–60 месяцев.

Knowledge Base Size Calculator

Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.

Dimensions: 1,536Vector size: 6.1 KBEmbed cost: $0.020/1M tokens

Document Corpus

docs
words

Chunking Strategy

tokens
tokens
Tokens per document667
Chunks per document2
Total chunks (initial)20,000

Vector Database Storage

bytes

Growth & Re-indexing

% / mo
months
days

Current Knowledge Base Snapshot

Total Chunks

20,000

2 per doc

Index Storage

0.120 GB

6.3 KB / chunk

Ingestion Cost

$0.2048

one-time embed

Storage / Month

$0.0397

0.12 GB

Storage Breakdown per Chunk

Vector (1,536d × 4 bytes)6.0 KB (95%)
Vector overhead (ID, pointers)60 B (1%)
Metadata (source, title, timestamps)256 B (4%)
Total per chunk6.3 KB

Growth Projection (12 months, 10%/mo)

MonthTotal DocsTotal ChunksIndex SizeStorage/MoNew Embed Cost
Mo 111,00022,0000.132 GB$0.0437$0.0205
Mo 212,10024,2000.146 GB$0.0480$0.0225
Mo 313,31026,6200.160 GB$0.0529$0.0248
Mo 414,64129,2820.176 GB$0.0581$0.0273
Mo 516,10532,2100.194 GB$0.0639$0.0300
Mo 617,71635,4320.213 GB$0.0703$0.0330
Mo 719,48838,9760.234 GB$0.0774$0.0363
Mo 821,43742,8740.258 GB$0.0851$0.0399
Mo 923,58147,1620.284 GB$0.0936$0.0439
Mo 1025,93951,8780.312 GB$0.1030$0.0483
Mo 1128,53357,0660.343 GB$0.1133$0.0531
Mo 12 Final31,38662,7720.378 GB$0.1246$0.0584

12-Month Total Cost Summary

Initial Ingestion

$0.2048

one-time embed cost

Growth Ingestion

$0.4380

new docs over 12 mo

Re-index Cost

$7.82

every 30 days

Storage (period)

$0.9341

12 mo accumulated

Final Index Size

0.378 GB

62,772 total chunks

Total Period Cost

$9.09

all costs combined

Embedding Model Comparison (initial ingestion)

ModelDimsVector SizeIndex SizeIngestion Cost
text-embedding-3-smallOpenAISelected
1,5366.1 KB0.120 GB$0.2048
text-embedding-3-largeOpenAI
3,07212.1 KB0.235 GB$1.33
text-embedding-ada-002OpenAI
1,5366.1 KB0.120 GB$1.02
embed-english-v3Cohere
1,0244.1 KB0.082 GB$1.02
embed-multilingual-v3Cohere
1,0244.1 KB0.082 GB$1.02
text-embedding-004Google
7683.1 KB0.063 GB$0.2560
voyage-3-liteVoyage
5122.1 KB0.044 GB$0.2048
voyage-3Voyage
1,0244.1 KB0.082 GB$0.6144
voyage-3-largeVoyage
2,0488.1 KB0.158 GB$1.84
Estimation Notes: Document token count uses 0.75 words/token ratio (standard English prose). Vector storage uses float32 (4 bytes/dimension) plus 60 bytes overhead per vector for IDs and pointers. Actual storage may vary by vector database compression, HNSW index overhead (typically +25-50%), and payload indexing. Storage rates are indicative list prices - actual billing depends on plan tier, region, and committed capacity. All calculations run locally in your browser.

Как накапливается векторное хранилище

Размер индекса зависит от того, сколько чанков даёт ваш корпус, и от размерности выбранной модели эмбеддингов. Каждый чанк создаёт вектор, который хранится в векторной базе.

Базовая формула: размерности × 4 байта на вектор плюс фиксированные издержки и сопутствующие метаданные.

  • Чанки = документы × средняя длина ÷ размер чанка с поправкой на перекрытие.
  • Векторы float32: размерности × 4 байта каждый.
  • Метаданные на чанк (URL, даты, заголовок) добавляют байты.

Выбор разбиения и модели

Размер чанка — компромисс между точностью поиска и затратами на хранение и загрузку. Модель определяет и размерность, и цену за миллион токенов.

  1. Выберите размер чанка под плотность ваших документов.
  2. Добавьте перекрытие, чтобы не терять контекст на границах.
  3. Выберите модель эмбеддингов по соотношению цены и качества.
  4. Примените коэффициент накладных расходов HNSW вашей векторной базы.

Прогноз роста и переиндексации

Хранение и затраты растут с каждым новым документом. Прогноз на 1–60 месяцев помогает рассчитать инфраструктуру до того, как это станет проблемой.

  • Месячный рост увеличивает число чанков, векторов и объём хранения.
  • Переиндексация — только при смене модели или стратегии разбиения.
  • Обновления документов лучше покрывать инкрементальной индексацией.

Часто задаваемые вопросы

Он оценивает хранение векторного индекса, число чанков, затраты на загрузку эмбеддингов и месячные прогнозы роста для систем RAG и семантического поиска. Он моделирует, сколько чанков даёт ваш корпус, сколько места занимает каждый чанк в векторной базе и как масштабируются затраты на загрузку и хранение по мере роста базы.

Каждый чанк документа даёт один вектор эмбеддинга. Размер вектора = число размерностей × 4 байта (float32) плюс около 60 байт накладных расходов на вектор для внутренних ID и указателей графа. Метаданные рядом с вектором (URL источника, метки времени, название документа) добавляют байты на чанк.

Обычные стартовые значения — 256–512 токенов для плотных фактических документов и 512–1024 токена для длинного повествовательного контента. Меньшие чанки дают больше векторов и выше точность поиска, но увеличивают хранение и затраты на эмбеддинги. Сравните итоговое хранение при разных размерах чанка в этом калькуляторе до запуска конвейера загрузки.

Перекрытие — это число токенов, общих для соседних чанков, чтобы сохранить контекст на границах. Перекрытие 64 токена при чанке 512 означает, что каждый чанк делит 64 токена со следующим. Перекрытие добавляет лишние чанки к общему числу. Калькулятор учитывает его при подсчёте чанков и хранилища.

Калькулятор показывает чистое хранилище векторов + метаданных. Большинство векторных баз добавляют 25–60 % накладных расходов графового индекса HNSW. Планируйте 1,3–1,6× от оценённого чистого хранилища для управляемых векторных баз с индексами HNSW по умолчанию.

Полная переиндексация нужна только при смене модели эмбеддингов, изменении стратегии разбиения или серьёзной реструктуризации документов. Для обновлений и дополнений инкрементальная индексация гораздо экономичнее. Поле стоимости переиндексации оценивает плановые полные циклы повторного расчёта эмбеддингов.

Для большинства англоязычных RAG-приложений Google text-embedding-004 (0,025 $/1M токенов, 768 размерностей) или Voyage voyage-3-lite (0,020 $/1M токенов, 512 размерностей) дают лучшее соотношение цены и качества при больших объёмах. OpenAI text-embedding-3-small тоже выгоден при 0,020 $/1M и 1536 размерностях.

Да. Калькулятор работает полностью в браузере на JavaScript. Число документов, описания корпуса, оценки затрат и прогнозы роста рассчитываются локально на вашем устройстве и никогда не отправляются на сервер. Регистрация не нужна, инструмент полностью бесплатный.