Перейти к содержимому
Aback Tools Logo

Калькулятор стоимости RAG

Бесплатно оцените онлайн полную стоимость пайплайна генерации с дополненной выборкой. Рассчитайте загрузку эмбеддингов, переиндексацию, выборку по запросу, генерацию LLM, опциональные сборы реранкера и хранение в векторной базе — по OpenAI, Anthropic, Google, Cohere, Voyage и другим. Полностью приватно, работает в браузере.

RAG Cost Calculator

Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.

Knowledge Base (Ingestion)

docs
tokens
days
Rate: $0.02/1M tokensDims: 1536Vector size: 6.0 KB

Query Pipeline (per request)

req/day
chunks
tokens
tokens
tokens
tokens

LLM Context per Request

System: 400Query: 100Chunks: 1,500Total in: 2,000
Input/1M: $0.15Output/1M: $0.60

Total Monthly RAG Pipeline Cost

$18.16for 30,000 queries

Cost / Query

$0.000602

Query LLM Cost

$18.00

Embedding Cost

$0.1600

Storage Cost

$0.00

Monthly Cost Breakdown

1. Knowledge Base Ingestion5,000K tokens × 1.0 re-index cycles
$0.1000

Initial one-time cost: $0.1000

2. Query Embedding100 tokens × 30,000 queries
$0.0600
3. LLM Generation (GPT-4o mini)2,000 in + 500 out tokens × 30,000 queries
$18.00

Initial Ingestion

$0.1000

one-time cost

Cost per Query

$0.000602

all pipeline steps

Knowledge Base Size

59.0 MB

10,000 vectors

LLM Generation Cost Comparison

Same context, all models
ModelCost/QueryMonthly LLM Cost
Mistral Small(Mistral)Budget
$0.000350$10.50
GPT-4o mini(OpenAI)Budget Active
$0.000600$18.00
Command R(Cohere)Budget
$0.000600$18.00
DeepSeek-V3(DeepSeek)Budget
$0.001090$32.70
Gemini 2.5 Flash(Google)Budget
$0.001850$55.50
Claude 3.5 Haiku(Anthropic)Budget
$0.003600$108.00
o4-mini(OpenAI)
$0.004400$132.00
Mistral Large(Mistral)
$0.007000$210.00
Gemini 2.5 Pro(Google)
$0.007500$225.00
GPT-4o(OpenAI)
$0.0100$300.00
Command R+(Cohere)
$0.0100$300.00
Claude 3.7 Sonnet(Anthropic)Capable
$0.0135$405.00

Click any row to select that LLM.

Disclaimer: Estimates use standard Pay-As-You-Go rates from published provider documentation. Embedding costs apply only to tokens processed; re-indexing frequency is linear. Vector DB storage estimates are based on float32 vectors plus 40 bytes metadata overhead per record. Actual costs vary with regional pricing, volume discounts, and specific provider configurations. All calculations run locally in your browser - no data is transmitted.

Четыре уровня затрат пайплайна RAG

Система RAG тарифицируется не как один вызов. Есть загрузка, запрос, генерация и хранение — у каждого уровня своя цена.

Генерация LLM обычно доминирует, так как при каждом ответе отправляет извлечённые фрагменты как контекст.

  • Загрузка: один раз эмбеддить весь корпус и периодически переиндексировать.
  • Запрос: эмбеддить каждый вопрос перед векторным поиском.
  • Генерация: отправить найденный контекст и получить ответ.
  • Хранение: платить за векторный индекс по его размеру.

Чанки, top-k и реранкинг

Размер чанка влияет и на точность, и на счёт. Меньшие чанки дают меньше контекста, но требуют большего числа извлечённых результатов.

  • Меньшие чанки снижают стоимость контекста на запрос.
  • Больший top-k компенсирует потерю контекста, но добавляет токены.
  • Реранкер повышает точность за плату с каждого запроса.

Сравнение провайдеров и планирование расходов

Цены на эмбеддинги сильно различаются между провайдерами при схожем качестве. Сравните цену и качество, прежде чем фиксировать пайплайн.

  1. Оцените корпус, число документов и объём запросов.
  2. Выберите модель эмбеддингов по цене и размерности.
  3. Задайте размер чанка и top-k по результатам тестов качества.
  4. Спрогнозируйте месячные расходы с учётом переиндексации и хранения.

Часто задаваемые вопросы

Он оценивает полную стоимость эксплуатации пайплайна генерации с дополненной выборкой — включая эмбеддинг базы знаний, периодическую переиндексацию, эмбеддинг запросов, реранкинг, генерацию LLM и векторное хранилище. В отличие от простого инструмента стоимости токенов, он охватывает все уровни тарификации продакшн-системы RAG.

У пайплайнов RAG четыре основных уровня затрат: (1) эмбеддинг загрузки — один раз эмбеддить все документы и переэмбеддить по расписанию; (2) эмбеддинг запроса — эмбеддить каждый запрос перед векторным поиском; (3) генерация LLM — доминирующая статья, где извлечённые фрагменты отправляются как контекст; и (4) опциональные сборы за векторное хранилище по размеру индекса.

Меньшие чанки (200–400 токенов) снижают стоимость контекста LLM на запрос, так как каждый извлечённый фрагмент даёт меньше входных токенов. Но они могут требовать большего top-k для достаточного контекста. Используйте калькулятор, чтобы смоделировать разные размеры чанков и значения top-k и найти оптимальную конфигурацию.

Стоимость переиндексации — это расходы на повторный расчёт эмбеддингов всей базы знаний с указанной частотой. Например, при переиндексации каждые 30 дней и общих затратах на загрузку 5,00 $ месячная стоимость переиндексации составит 5,00 $. Калькулятор делит период прогноза на интервал переиндексации, чтобы определить число полных циклов.

Стоимость векторного хранилища рассчитывается как (число документов × байт на вектор) + накладные расходы на метаданные, переводится в ГБ и умножается на месячный тариф за ГБ. Байты на вектор зависят от размерности модели эмбеддингов (например, text-embedding-3-small: 1536 × 4 байта = 6144 байта). Калькулятор учитывает 40 байт метаданных на вектор.

Калькулятор поддерживает OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) и Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Все тарифы соответствуют стандартным ценам «оплата по мере использования».

Да. Все вычисления выполняются полностью в браузере. Число документов, объёмы запросов и оценки затрат рассчитываются локально на вашем устройстве и никогда не передаются на сервер. Данные не покидают браузер, регистрация не требуется.