Pular para o conteúdo
Aback Tools Logo

Calculadora de tamanho da base de conhecimento

Estime os requisitos de armazenamento, o tamanho do índice vetorial e os custos de ingestão de embeddings da sua base de conhecimento de IA. Ajuste a contagem de documentos, o comprimento médio, o tamanho do chunk e a sobreposição para ver o total de chunks e o tamanho do índice em GB. Compare 9 modelos de embedding e 7 bancos de dados vetoriais, e projete quanto o armazenamento e os custos crescem de 1 a 60 meses conforme sua base escala.

Knowledge Base Size Calculator

Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.

Dimensions: 1,536Vector size: 6.1 KBEmbed cost: $0.020/1M tokens

Document Corpus

docs
words

Chunking Strategy

tokens
tokens
Tokens per document667
Chunks per document2
Total chunks (initial)20,000

Vector Database Storage

bytes

Growth & Re-indexing

% / mo
months
days

Current Knowledge Base Snapshot

Total Chunks

20,000

2 per doc

Index Storage

0.120 GB

6.3 KB / chunk

Ingestion Cost

$0.2048

one-time embed

Storage / Month

$0.0397

0.12 GB

Storage Breakdown per Chunk

Vector (1,536d × 4 bytes)6.0 KB (95%)
Vector overhead (ID, pointers)60 B (1%)
Metadata (source, title, timestamps)256 B (4%)
Total per chunk6.3 KB

Growth Projection (12 months, 10%/mo)

MonthTotal DocsTotal ChunksIndex SizeStorage/MoNew Embed Cost
Mo 111,00022,0000.132 GB$0.0437$0.0205
Mo 212,10024,2000.146 GB$0.0480$0.0225
Mo 313,31026,6200.160 GB$0.0529$0.0248
Mo 414,64129,2820.176 GB$0.0581$0.0273
Mo 516,10532,2100.194 GB$0.0639$0.0300
Mo 617,71635,4320.213 GB$0.0703$0.0330
Mo 719,48838,9760.234 GB$0.0774$0.0363
Mo 821,43742,8740.258 GB$0.0851$0.0399
Mo 923,58147,1620.284 GB$0.0936$0.0439
Mo 1025,93951,8780.312 GB$0.1030$0.0483
Mo 1128,53357,0660.343 GB$0.1133$0.0531
Mo 12 Final31,38662,7720.378 GB$0.1246$0.0584

12-Month Total Cost Summary

Initial Ingestion

$0.2048

one-time embed cost

Growth Ingestion

$0.4380

new docs over 12 mo

Re-index Cost

$7.82

every 30 days

Storage (period)

$0.9341

12 mo accumulated

Final Index Size

0.378 GB

62,772 total chunks

Total Period Cost

$9.09

all costs combined

Embedding Model Comparison (initial ingestion)

ModelDimsVector SizeIndex SizeIngestion Cost
text-embedding-3-smallOpenAISelected
1,5366.1 KB0.120 GB$0.2048
text-embedding-3-largeOpenAI
3,07212.1 KB0.235 GB$1.33
text-embedding-ada-002OpenAI
1,5366.1 KB0.120 GB$1.02
embed-english-v3Cohere
1,0244.1 KB0.082 GB$1.02
embed-multilingual-v3Cohere
1,0244.1 KB0.082 GB$1.02
text-embedding-004Google
7683.1 KB0.063 GB$0.2560
voyage-3-liteVoyage
5122.1 KB0.044 GB$0.2048
voyage-3Voyage
1,0244.1 KB0.082 GB$0.6144
voyage-3-largeVoyage
2,0488.1 KB0.158 GB$1.84
Estimation Notes: Document token count uses 0.75 words/token ratio (standard English prose). Vector storage uses float32 (4 bytes/dimension) plus 60 bytes overhead per vector for IDs and pointers. Actual storage may vary by vector database compression, HNSW index overhead (typically +25-50%), and payload indexing. Storage rates are indicative list prices - actual billing depends on plan tier, region, and committed capacity. All calculations run locally in your browser.

Como o armazenamento vetorial se acumula

O tamanho do índice depende de quantos chunks seu corpus produz e da dimensão do modelo de embedding escolhido. Cada chunk gera um vetor armazenado no banco vetorial.

A fórmula básica é dimensões × 4 bytes por vetor, mais um overhead fixo e os metadados associados.

  • Chunks = documentos × comprimento médio ÷ tamanho do chunk, ajustado pela sobreposição.
  • Vetores float32: dimensões × 4 bytes cada.
  • Metadados por chunk (URL, datas, título) somam bytes extras.

Escolher chunking e modelo

O tamanho do chunk é um equilíbrio entre precisão de recuperação e custo de armazenamento e ingestão. O modelo define tanto a dimensão quanto o preço por milhão de tokens.

  1. Escolha um tamanho de chunk adequado à densidade dos seus documentos.
  2. Adicione sobreposição para não perder contexto nas fronteiras.
  3. Selecione o modelo de embedding pela relação custo-qualidade.
  4. Aplique o fator de overhead HNSW do seu banco vetorial.

Projetar crescimento e reindexação

Armazenamento e custos crescem a cada documento novo. Projetar de 1 a 60 meses ajuda a dimensionar a infraestrutura antes que vire problema.

  • O crescimento mensal multiplica chunks, vetores e armazenamento.
  • Reindexe apenas ao trocar de modelo ou de estratégia de chunking.
  • Atualizações de documentos são melhor tratadas com indexação incremental.

Perguntas frequentes

Ela estima o armazenamento do índice vetorial, a contagem de chunks, os custos de ingestão de embeddings e as projeções de crescimento mensal para sistemas RAG e de busca semântica. Ela modela quantos chunks seu corpus de documentos produz, quanto armazenamento cada chunk exige em um banco vetorial e como os custos de ingestão e armazenamento escalam conforme a base cresce.

Cada chunk de documento produz um vetor de embedding. Tamanho do vetor = número de dimensões × 4 bytes (codificação float32) mais cerca de 60 bytes de overhead por vetor para IDs internos e ponteiros de grafo. Metadados armazenados junto a cada vetor (URL de origem, carimbos de data/hora, título do documento) adicionam bytes extras por chunk.

Pontos de partida comuns são 256-512 tokens para documentos factuais densos e 512-1024 tokens para conteúdo narrativo mais longo. Chunks menores geram mais vetores e maior precisão de recuperação, mas aumentam o armazenamento e os custos de embedding. Use esta calculadora para comparar o armazenamento total entre diferentes tamanhos de chunk antes de definir um pipeline de ingestão.

A sobreposição é o número de tokens compartilhados entre chunks adjacentes para preservar contexto nas fronteiras. Uma sobreposição de 64 tokens em um chunk de 512 significa que cada chunk compartilha 64 tokens com o seguinte. A sobreposição adiciona chunks extras ao total. A calculadora considera isso ao calcular o total de chunks e o armazenamento.

A calculadora mostra o armazenamento bruto de vetores + metadados. A maioria dos bancos vetoriais adiciona 25-60 % de overhead do índice de grafo HNSW sobre o armazenamento bruto. Planeje de 1,3 a 1,6× o armazenamento bruto estimado para bancos vetoriais gerenciados com índices HNSW padrão.

A reindexação completa só é necessária quando você muda o modelo de embedding, ajusta a estratégia de chunking ou faz uma reestruturação importante de documentos. Para atualizações e adições de documentos, a indexação incremental é bem mais econômica. O campo de custo de reindexação estima ciclos programados de re-embedding completo.

Para a maioria das aplicações RAG em inglês, Google text-embedding-004 (US$ 0,025/1M tokens, 768 dimensões) ou Voyage voyage-3-lite (US$ 0,020/1M tokens, 512 dimensões) oferecem a melhor relação custo-qualidade para ingestão em escala. O OpenAI text-embedding-3-small também é econômico a US$ 0,020/1M com 1536 dimensões.

Sim. A calculadora roda inteiramente no seu navegador em JavaScript. Contagens de documentos, descrições de corpus, estimativas de custo e projeções de crescimento são calculadas localmente no seu dispositivo e nunca transmitidas a servidor algum. Não exige cadastro e a ferramenta é totalmente gratuita.