Перейти к содержимому
Aback Tools Logo

Калькулятор стоимости Vertex AI

Бесплатно рассчитайте онлайн расходы на модели Google Vertex AI. Оцените стоимость токенов по моделям Gemini, Claude, Llama и Mistral со скидками кеша контекста, экономией Batch Prediction, мультимодальными весами токенов и месячными прогнозами. Полностью приватно — в браузере.

Vertex AI Cost Calculator

Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.

Input/1M: $1.2500Output/1M: $10.0000Cache/1M: $0.3125

Prompt Tokens

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$487.50for 30,000 total requests

Cost per Single Call

$0.0163

Input Token Cost

$0.006250

Output Token Cost

$0.0100

Model Pricing Comparison

Sorted by lowest cost
ModelCost/CallMonthly ForecastFeatures
Gemini 1.5 FlashCost-Effective
Gemini 1.5 (Vertex) • 1,000K ctx
$0.000675$20.25Caching
Mistral NemoCost-Effective
Mistral on Vertex • 128K ctx
$0.001800$54.00No Cache
Gemini 2.5 FlashCost-Effective
Gemini 2.5 (Vertex) • 1,000K ctx
$0.004000$120.00Caching
Llama 3.3 70B InstructCost-Effective
Llama on Vertex • 128K ctx
$0.004320$129.60No Cache
Claude 3.5 HaikuCost-Effective
Claude on Vertex • 200K ctx
$0.008000$240.00No Cache
Gemini 1.5 Pro
Gemini 1.5 (Vertex) • 2,000K ctx
$0.0112$337.50Caching
Gemini 2.5 ProCapable Selected
Gemini 2.5 (Vertex) • 2,000K ctx
$0.0163$487.50Caching
Claude 3.7 SonnetCapable
Claude on Vertex • 200K ctx
$0.0300$900.00No Cache
Mistral Large
Mistral on Vertex • 128K ctx
$0.0320$960.00No Cache
Llama 3.1 405B InstructCapable
Llama on Vertex • 128K ctx
$0.0410$1,230.00No Cache
Claude 3 OpusCapable
Claude on Vertex • 200K ctx
$0.1500$4,500.00No Cache
Calculations Disclaimer: Estimates use standard Vertex AI Pay-As-You-Go rates. Actual billing may vary due to regional pricing, committed use discounts, promotional credits, or Google infrastructure fees. Vertex AI context caching applies a ~75% discount on supported Gemini models for cached tokens. Batch Prediction pricing provides a 50% reduction for asynchronous workloads. Always verify rates on the official Google Cloud Vertex AI pricing page before production deployments.

Какие модели можно считать на Vertex AI

Vertex AI обслуживает не только модели Google: в Model Garden есть Gemini, Claude, Llama и Mistral, каждая со своими ценами за токены.

Правильно выбрать семейство важнее, чем экономить токены по мелочи.

  • Gemini: кеш контекста и собственные цены за токены от Google.
  • Claude, Llama и Mistral: сторонние тарифы на платформе.
  • Batch Prediction даёт скидку 50 % на поддерживаемые модели.

Кеш контекста и Batch Prediction

Кеш контекста — главный рычаг при переиспользовании большого стабильного контекста. Он доступен только для моделей Gemini.

  • Кешированные токены: около 25 % ставки входа.
  • Batch Prediction: ~50 % скидки при задержке до 24 ч.
  • Комбинируйте оба, если контекст стабилен и задержка не критична.

Мультимодальные входы и планирование

Изображения, аудио и видео переводятся в токены до тарификации: оцените их вклад в общую стоимость.

  1. Задайте входные и выходные токены на запрос.
  2. Выберите модель и включите кеш, если применимо.
  3. Для медиа оцените токены в мультимодальном конвертере.
  4. Проверьте месячный прогноз до фиксации бюджета.

Часто задаваемые вопросы

Это инструмент, который оценивает расходы на инференс моделей Google Cloud Vertex AI по количеству входных и выходных токенов, объёму запросов и выбранной модели. Он охватывает доступные модели Gemini, Claude, Llama и Mistral. Калькулятор работает полностью в браузере без регистрации.

Google AI Studio ориентирован на отдельных разработчиков с более простой оплатой, а Vertex AI — корпоративная платформа с полной интеграцией Google Cloud, контролем IAM, поддержкой VPC-SC и SLA. Для моделей Gemini цены за токены на обеих платформах одинаковы. Ключевое отличие: Vertex AI также предлагает сторонние модели (Claude, Llama, Mistral) и корпоративные обязательства.

Кеш контекста поддерживается для семейств Gemini 2.5 и Gemini 1.5 на Vertex AI. Кешированные входные токены тарифицируются примерно по 25 % стандартной ставки — экономия около 75 % на кешированных токенах. Модели не Gemini (Claude, Llama, Mistral) не поддерживают кеш контекста на Vertex AI.

Batch Prediction — асинхронный эндпоинт инференса для нагрузок без требований к задержке. Задачи обрабатываются в фоне со SLA 24 часа. Взамен все затраты на входные и выходные токены получают фиксированную скидку 50 % — идеально для массовой обработки документов, разметки датасетов и оценочных пайплайнов.

Model Garden на Vertex AI содержит Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) и Mistral (Large, Nemo) вместе с семейством Gemini. Каждая модель тарифицируется по своим ставкам за токены, включённым в калькулятор как пресеты.

Для моделей Gemini на Vertex AI мультимодальные входы переводятся в количество токенов до тарификации. Стандартные веса: изображения — 258 токенов каждое, аудио — 32 токена в секунду, видео — 258 токенов в секунду. Калькулятор включает мультимодальный оценщик.

Да. Калькулятор выполняет все вычисления полностью на стороне клиента, в браузере. Количество токенов, объёмы запросов и оценки цен не покидают устройство и никогда не передаются на сервер. Данные остаются на 100 % приватными.