Калькулятор стоимости Vertex AI
Бесплатно рассчитайте онлайн расходы на модели Google Vertex AI. Оцените стоимость токенов по моделям Gemini, Claude, Llama и Mistral со скидками кеша контекста, экономией Batch Prediction, мультимодальными весами токенов и месячными прогнозами. Полностью приватно — в браузере.
Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.
Prompt Tokens
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0163
Input Token Cost
$0.006250
Output Token Cost
$0.0100
Model Pricing Comparison
Sorted by lowest cost| Model | Cost/Call | Monthly Forecast | Features |
|---|---|---|---|
Gemini 1.5 FlashCost-Effective Gemini 1.5 (Vertex) • 1,000K ctx | $0.000675 | $20.25 | Caching |
Mistral NemoCost-Effective Mistral on Vertex • 128K ctx | $0.001800 | $54.00 | No Cache |
Gemini 2.5 FlashCost-Effective Gemini 2.5 (Vertex) • 1,000K ctx | $0.004000 | $120.00 | Caching |
Llama 3.3 70B InstructCost-Effective Llama on Vertex • 128K ctx | $0.004320 | $129.60 | No Cache |
Claude 3.5 HaikuCost-Effective Claude on Vertex • 200K ctx | $0.008000 | $240.00 | No Cache |
Gemini 1.5 Pro Gemini 1.5 (Vertex) • 2,000K ctx | $0.0112 | $337.50 | Caching |
Gemini 2.5 ProCapable Selected Gemini 2.5 (Vertex) • 2,000K ctx | $0.0163 | $487.50 | Caching |
Claude 3.7 SonnetCapable Claude on Vertex • 200K ctx | $0.0300 | $900.00 | No Cache |
Mistral Large Mistral on Vertex • 128K ctx | $0.0320 | $960.00 | No Cache |
Llama 3.1 405B InstructCapable Llama on Vertex • 128K ctx | $0.0410 | $1,230.00 | No Cache |
Claude 3 OpusCapable Claude on Vertex • 200K ctx | $0.1500 | $4,500.00 | No Cache |
Какие модели можно считать на Vertex AI
Vertex AI обслуживает не только модели Google: в Model Garden есть Gemini, Claude, Llama и Mistral, каждая со своими ценами за токены.
Правильно выбрать семейство важнее, чем экономить токены по мелочи.
- Gemini: кеш контекста и собственные цены за токены от Google.
- Claude, Llama и Mistral: сторонние тарифы на платформе.
- Batch Prediction даёт скидку 50 % на поддерживаемые модели.
Кеш контекста и Batch Prediction
Кеш контекста — главный рычаг при переиспользовании большого стабильного контекста. Он доступен только для моделей Gemini.
- Кешированные токены: около 25 % ставки входа.
- Batch Prediction: ~50 % скидки при задержке до 24 ч.
- Комбинируйте оба, если контекст стабилен и задержка не критична.
Мультимодальные входы и планирование
Изображения, аудио и видео переводятся в токены до тарификации: оцените их вклад в общую стоимость.
- Задайте входные и выходные токены на запрос.
- Выберите модель и включите кеш, если применимо.
- Для медиа оцените токены в мультимодальном конвертере.
- Проверьте месячный прогноз до фиксации бюджета.
Часто задаваемые вопросы
Это инструмент, который оценивает расходы на инференс моделей Google Cloud Vertex AI по количеству входных и выходных токенов, объёму запросов и выбранной модели. Он охватывает доступные модели Gemini, Claude, Llama и Mistral. Калькулятор работает полностью в браузере без регистрации.
Google AI Studio ориентирован на отдельных разработчиков с более простой оплатой, а Vertex AI — корпоративная платформа с полной интеграцией Google Cloud, контролем IAM, поддержкой VPC-SC и SLA. Для моделей Gemini цены за токены на обеих платформах одинаковы. Ключевое отличие: Vertex AI также предлагает сторонние модели (Claude, Llama, Mistral) и корпоративные обязательства.
Кеш контекста поддерживается для семейств Gemini 2.5 и Gemini 1.5 на Vertex AI. Кешированные входные токены тарифицируются примерно по 25 % стандартной ставки — экономия около 75 % на кешированных токенах. Модели не Gemini (Claude, Llama, Mistral) не поддерживают кеш контекста на Vertex AI.
Batch Prediction — асинхронный эндпоинт инференса для нагрузок без требований к задержке. Задачи обрабатываются в фоне со SLA 24 часа. Взамен все затраты на входные и выходные токены получают фиксированную скидку 50 % — идеально для массовой обработки документов, разметки датасетов и оценочных пайплайнов.
Model Garden на Vertex AI содержит Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) и Mistral (Large, Nemo) вместе с семейством Gemini. Каждая модель тарифицируется по своим ставкам за токены, включённым в калькулятор как пресеты.
Для моделей Gemini на Vertex AI мультимодальные входы переводятся в количество токенов до тарификации. Стандартные веса: изображения — 258 токенов каждое, аудио — 32 токена в секунду, видео — 258 токенов в секунду. Калькулятор включает мультимодальный оценщик.
Да. Калькулятор выполняет все вычисления полностью на стороне клиента, в браузере. Количество токенов, объёмы запросов и оценки цен не покидают устройство и никогда не передаются на сервер. Данные остаются на 100 % приватными.