Калькулятор стоимости RAG
Бесплатно оцените онлайн полную стоимость пайплайна генерации с дополненной выборкой. Рассчитайте загрузку эмбеддингов, переиндексацию, выборку по запросу, генерацию LLM, опциональные сборы реранкера и хранение в векторной базе — по OpenAI, Anthropic, Google, Cohere, Voyage и другим. Полностью приватно, работает в браузере.
Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.
Knowledge Base (Ingestion)
Query Pipeline (per request)
LLM Context per Request
Total Monthly RAG Pipeline Cost
Cost / Query
$0.000602
Query LLM Cost
$18.00
Embedding Cost
$0.1600
Storage Cost
$0.00
Monthly Cost Breakdown
Initial one-time cost: $0.1000
Initial Ingestion
$0.1000
one-time cost
Cost per Query
$0.000602
all pipeline steps
Knowledge Base Size
59.0 MB
10,000 vectors
LLM Generation Cost Comparison
Same context, all models| Model | Cost/Query | Monthly LLM Cost |
|---|---|---|
Mistral Small(Mistral)Budget | $0.000350 | $10.50 |
GPT-4o mini(OpenAI)Budget Active | $0.000600 | $18.00 |
Command R(Cohere)Budget | $0.000600 | $18.00 |
DeepSeek-V3(DeepSeek)Budget | $0.001090 | $32.70 |
Gemini 2.5 Flash(Google)Budget | $0.001850 | $55.50 |
Claude 3.5 Haiku(Anthropic)Budget | $0.003600 | $108.00 |
o4-mini(OpenAI) | $0.004400 | $132.00 |
Mistral Large(Mistral) | $0.007000 | $210.00 |
Gemini 2.5 Pro(Google) | $0.007500 | $225.00 |
GPT-4o(OpenAI) | $0.0100 | $300.00 |
Command R+(Cohere) | $0.0100 | $300.00 |
Claude 3.7 Sonnet(Anthropic)Capable | $0.0135 | $405.00 |
Click any row to select that LLM.
Четыре уровня затрат пайплайна RAG
Система RAG тарифицируется не как один вызов. Есть загрузка, запрос, генерация и хранение — у каждого уровня своя цена.
Генерация LLM обычно доминирует, так как при каждом ответе отправляет извлечённые фрагменты как контекст.
- Загрузка: один раз эмбеддить весь корпус и периодически переиндексировать.
- Запрос: эмбеддить каждый вопрос перед векторным поиском.
- Генерация: отправить найденный контекст и получить ответ.
- Хранение: платить за векторный индекс по его размеру.
Чанки, top-k и реранкинг
Размер чанка влияет и на точность, и на счёт. Меньшие чанки дают меньше контекста, но требуют большего числа извлечённых результатов.
- Меньшие чанки снижают стоимость контекста на запрос.
- Больший top-k компенсирует потерю контекста, но добавляет токены.
- Реранкер повышает точность за плату с каждого запроса.
Сравнение провайдеров и планирование расходов
Цены на эмбеддинги сильно различаются между провайдерами при схожем качестве. Сравните цену и качество, прежде чем фиксировать пайплайн.
- Оцените корпус, число документов и объём запросов.
- Выберите модель эмбеддингов по цене и размерности.
- Задайте размер чанка и top-k по результатам тестов качества.
- Спрогнозируйте месячные расходы с учётом переиндексации и хранения.
Часто задаваемые вопросы
Он оценивает полную стоимость эксплуатации пайплайна генерации с дополненной выборкой — включая эмбеддинг базы знаний, периодическую переиндексацию, эмбеддинг запросов, реранкинг, генерацию LLM и векторное хранилище. В отличие от простого инструмента стоимости токенов, он охватывает все уровни тарификации продакшн-системы RAG.
У пайплайнов RAG четыре основных уровня затрат: (1) эмбеддинг загрузки — один раз эмбеддить все документы и переэмбеддить по расписанию; (2) эмбеддинг запроса — эмбеддить каждый запрос перед векторным поиском; (3) генерация LLM — доминирующая статья, где извлечённые фрагменты отправляются как контекст; и (4) опциональные сборы за векторное хранилище по размеру индекса.
Меньшие чанки (200–400 токенов) снижают стоимость контекста LLM на запрос, так как каждый извлечённый фрагмент даёт меньше входных токенов. Но они могут требовать большего top-k для достаточного контекста. Используйте калькулятор, чтобы смоделировать разные размеры чанков и значения top-k и найти оптимальную конфигурацию.
Стоимость переиндексации — это расходы на повторный расчёт эмбеддингов всей базы знаний с указанной частотой. Например, при переиндексации каждые 30 дней и общих затратах на загрузку 5,00 $ месячная стоимость переиндексации составит 5,00 $. Калькулятор делит период прогноза на интервал переиндексации, чтобы определить число полных циклов.
Стоимость векторного хранилища рассчитывается как (число документов × байт на вектор) + накладные расходы на метаданные, переводится в ГБ и умножается на месячный тариф за ГБ. Байты на вектор зависят от размерности модели эмбеддингов (например, text-embedding-3-small: 1536 × 4 байта = 6144 байта). Калькулятор учитывает 40 байт метаданных на вектор.
Калькулятор поддерживает OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) и Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Все тарифы соответствуют стандартным ценам «оплата по мере использования».
Да. Все вычисления выполняются полностью в браузере. Число документов, объёмы запросов и оценки затрат рассчитываются локально на вашем устройстве и никогда не передаются на сервер. Данные не покидают браузер, регистрация не требуется.