Сравнения

Gemini Pro, Flash и Flash-Lite: как выбрать tier под каждый запрос

Выбор между Gemini Pro, Flash и Flash-Lite — задача маршрутизации, а не вопрос лояльности. Gemini 3.8 Flash — дефолт для кода и агентов, Gemini 3.1 Pro Preview — tier эскалации для трудных рассуждений, а Gemini 3.1 Flash-Lite забирает дешёвые массовые шаги — всё это на одном ключе, одном endpoint и одном предоплаченном балансе.

·

Короткий ответ: Flash по умолчанию, Pro — по факту, Flash-Lite — на объёмах

Держите Gemini 3.8 Flash дефолтным tier, поднимайте запрос до Gemini 3.1 Pro Preview, когда задаче действительно нужны более глубокие рассуждения, а детерминированную массовую работу опускайте в Gemini 3.1 Flash-Lite. У всех трёх текстовых tier одинаковый контекст 1M токенов, тот же потолок output в 64K и та же форма запроса generateContent, поэтому выбор tier стоит одно поле в запросе — и никогда не требует новой интеграции.

Дорогие ошибки сидят на обоих краях. Гонять всё на Pro — значит платить ставки output Pro за работу, которую Flash делает не хуже; никогда не выходить из Flash-Lite — значит получать циклы повторов на задачах, которые он заведомо не решит. Относитесь к трём tier как к одной системе с разными счётчиками: Flash черновит, Pro разбирает исключения, Flash-Lite делает механический pre-processing перед обоими.

Читайте также: Цены Gemini API: Pro, Flash, Flash-Lite и генерация изображений

Тарифная сетка: сколько каждый tier реально стоит за миллион токенов

Цена — главное различие tier. Все цифры ниже — за 1M токенов, в формате input / cached input / output: официальные ставки Google и итоговая цена на apiToken.sale после плоской B2C-скидки 50%, которая одинаково действует на каждый tier.

TierID моделиОфициально: ввод / кеш / выводПосле скидки 50%
Progemini-3.1-pro-preview$2 / $0.20 / $12$1 / $0.10 / $6
Flashgemini-3.8-flash$0.75 / $0.075 / $3.75 промо$0.375 / $0.0375 / $1.875
Flash-Litegemini-3.1-flash-lite$0.25 / $0.025 / $1.50$0.125 / $0.0125 / $0.75
Flash-Lite (2.5)gemini-2.5-flash-lite$0.10 / $0.01 / $0.40$0.05 / $0.005 / $0.20

Бросаются в глаза две вещи. Output — дорогая нога на каждом tier: в четыре–восемь раз дороже input, поэтому модель, которая справляется с первого прохода по более низкой ставке output, обычно обыгрывает более сильную модель с повторами. И разброс огромен: output Flash-Lite тарифицируется как одна восьмая output Pro, поэтому увод классификации и извлечения с верхних tier важнее любой оптимизации промптов.

Gemini 3.8 Flash использует промо Google $0.75/$0.075/$3.75 до 2026-12-31 и возвращается на $1.50/$0.15/$7.50 с 2027-01-01. Cached input — отдельный usage-компонент по 10% от fresh input; он не добавляется к свежему input за те же токены.

Контекстное окно, потолок output и порог 200K

Контекст почти не различает tier: у актуальных текстовых Pro, Flash и Flash-Lite одно окно 1M токенов и output до 64K. Flash-Lite — не tier с маленьким контекстом: его преимущество — цена и задержка на простой работе, а не более короткое окно. Единственное контекстное правило, которое меняет счёт, живёт на Pro.

  • Запросы Gemini 3.1 Pro Preview свыше 200K входных токенов пересчитывают весь запрос по $4 за input и $18 за output на 1M — повышенные ставки действуют на каждый токен, а не только на превышение. После скидки 50% это $2/$9.
  • Flash и Flash-Lite держат плоские ставки во всём окне: вызов Flash со 900K input стоит по той же ставке за токен, что и вызов на 1K.
  • Image-tier устроен иначе: Gemini 3.1 Flash Image даёт контекст 128K и output до 32K, а его cached input тарифицируется по полной ставке input, а не по текстовым 10%.
  • Перед большим вызовом прогоните countTokens по тому же пути модели — это бесплатно и заранее покажет, пересекает ли запрос порог Pro в 200K, ещё до оплаты.

Какой tier под какую нагрузку

Сопоставляйте tier с ценой ошибки, а не с ощущениями. Tier подходит, когда стоимость неверного или поверхностного ответа на этом шаге ниже токен-премии следующего tier.

  • Pro (gemini-3.1-pro-preview): многофайловые рефакторинги, анализ архитектурных компромиссов, глубокий разбор документов и финальный аудит output, сгенерированного Flash, — работа, где пропущенный edge case стоит дороже токенов.
  • Flash (gemini-3.8-flash): повседневный интерактивный код, агентные циклы с множеством tool calls, мультимодальный input и сбалансированный production-трафик. Это правильный дефолт примерно для всего, что вы не измерили иначе.
  • Flash-Lite (gemini-3.1-flash-lite): классификация, извлечение, роутинг, суммаризация и другой детерминированный pre-processing на объёмах — там, где запрос предсказуем, а планка качества проверяется программно.

Более старый Gemini 2.5 Flash-Lite остаётся в каталоге по $0.10/$0.40 официально — самый дешёвый опубликованный текстовый tier — и легитимный выбор для высокообъёмных конвейеров, уже проверенных на нём.

Смена tier — это одно поле на одном ключе

Здесь нет планов, регистраций или endpoint под каждый tier. Один ключ apiToken.sale покрывает все tier Gemini — плюс поддерживаемые модели Claude, GPT и Kimi — на едином предоплаченном балансе. Направьте нативный протокол Gemini на https://router.apitoken.sale, передайте ключ как x-goog-api-key и меняйте только ID модели:

curl https://router.apitoken.sale/v1beta/models/gemini-3.8-flash:generateContent \
  -H "x-goog-api-key: $APITOKEN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize this diff in one sentence."}]}]}'

Замените gemini-3.8-flash на gemini-3.1-pro-preview или gemini-3.1-flash-lite — и тот же запрос выполнится на этом tier. GET /v1beta/models на том же base URL возвращает точные ID, доступные вашему ключу. Стриминг работает по tier через streamGenerateContent?alt=sse, а официальные Google GenAI SDK работают без изменений, кроме base URL.

Подводный камень SDK: передавайте голый хост как base URL. Google SDK сам добавляет /v1beta, поэтому base URL, уже заканчивающийся на /v1beta, даст удвоенный путь и 404.

Политика маршрутизации, которая держит расходы на Gemini ровными

  1. 01Назначьте gemini-3.8-flash дефолтом для каждой нагрузки — интерактивных сессий, CI-агентов и production-трафика.
  2. 02Заранее определите триггеры эскалации: провалившаяся или поверхностная попытка Flash, diff с большим числом файлов, чем вы способны проверить глазами, или необратимое архитектурное решение уходит в gemini-3.1-pro-preview.
  3. 03Перенесите детерминированные подзадачи — классификацию интентов, извлечение полей, реранкинг — в gemini-3.1-flash-lite и проверяйте output программно, чтобы регрессии качества всплывали сразу.
  4. 04Вызывайте countTokens перед любым запросом к Pro, который, по вашим прикидкам, близок к 200K input; если порог пересечён, либо обрежьте контекст, либо осознанно примите ставки длинного контекста $4/$18.
  5. 05Еженедельно смотрите токен-статистику в дашборде и корректируйте распределение: восьмикратный разрыв между output Flash-Lite и Pro означает, что небольшой сдвиг в маршрутизации двигает счёт сильнее любой правки промпта.

Поскольку скидка 50% действует плоско на все tier, относительный порядок никогда не меняется: Flash-Lite — всегда самый дешёвый счётчик, а Pro — всегда премиальный, поэтому политика маршрутизации, настроенная на официальных ценах, остаётся валидной и здесь.

Полная тарифная сетка Gemini, включая image output и ноги длинного контекста

Сравните все поддерживаемые модели и цены

Частые вопросы

Какую модель Gemini выбрать для кода?

Начните с Gemini 3.8 Flash — это текущая GA-модель Flash для интерактивного кода и агентных циклов. Трудную архитектуру и review эскалируйте в Gemini 3.1 Pro Preview, а Flash-Lite используйте для дешёвых детерминированных подзадач.

Ограничен ли Flash-Lite меньшим контекстным окном?

Нет. Опубликованные текстовые Flash-Lite сохраняют тот же контекст 1M токенов и потолок output 64K, что Flash и Pro. Их преимущество — меньшие цена и задержка на простой работе, а не более короткое окно.

Когда применяется long-context тариф Gemini Pro?

Когда запрос Gemini 3.1 Pro Preview превышает 200K входных токенов, весь запрос пересчитывается по $4 за input и $18 за output на 1M официально ($2/$9 после скидки 50%). У Flash и Flash-Lite премии за длинный контекст нет. Если сомневаетесь, сначала вызовите бесплатный countTokens.

Можно ли переключаться между Pro, Flash и Flash-Lite без нового ключа?

Да. Оставьте тот же base URL и заголовок x-goog-api-key и меняйте только ID модели в пути generateContent. Один ключ и один предоплаченный баланс покрывают все tier Gemini плюс поддерживаемые модели Claude, GPT и Kimi.

Действует ли скидка apiToken.sale на все три tier?

Да. Плоская B2C-скидка 50% применяется после точного расчёта официальных usage-компонентов — input, cached input, output и любых ног длинного контекста или изображений — одинаково для Pro, Flash, Flash-Lite и Flash Image.

Какая модель Gemini самая дешёвая для массовой работы?

Gemini 2.5 Flash-Lite — $0.10/$0.40 за 1M токенов официально ($0.05/$0.20 после скидки); Gemini 3.1 Flash-Lite за $0.25/$1.50 официально — бюджетный tier текущего поколения.

Создайте аккаунт через Google или GitHub и протестируйте шлюз с бонусом $5 на балансе платформы.