Gemini Pro, Flash и Flash-Lite: как выбрать tier под каждый запрос
Выбор между Gemini Pro, Flash и Flash-Lite — задача маршрутизации, а не вопрос лояльности. Gemini 3.8 Flash — дефолт для кода и агентов, Gemini 3.1 Pro Preview — tier эскалации для трудных рассуждений, а Gemini 3.1 Flash-Lite забирает дешёвые массовые шаги — всё это на одном ключе, одном endpoint и одном предоплаченном балансе.
·
Короткий ответ: Flash по умолчанию, Pro — по факту, Flash-Lite — на объёмах
Держите Gemini 3.8 Flash дефолтным tier, поднимайте запрос до Gemini 3.1 Pro Preview, когда задаче действительно нужны более глубокие рассуждения, а детерминированную массовую работу опускайте в Gemini 3.1 Flash-Lite. У всех трёх текстовых tier одинаковый контекст 1M токенов, тот же потолок output в 64K и та же форма запроса generateContent, поэтому выбор tier стоит одно поле в запросе — и никогда не требует новой интеграции.
Дорогие ошибки сидят на обоих краях. Гонять всё на Pro — значит платить ставки output Pro за работу, которую Flash делает не хуже; никогда не выходить из Flash-Lite — значит получать циклы повторов на задачах, которые он заведомо не решит. Относитесь к трём tier как к одной системе с разными счётчиками: Flash черновит, Pro разбирает исключения, Flash-Lite делает механический pre-processing перед обоими.
Читайте также: Цены Gemini API: Pro, Flash, Flash-Lite и генерация изображений
Тарифная сетка: сколько каждый tier реально стоит за миллион токенов
Цена — главное различие tier. Все цифры ниже — за 1M токенов, в формате input / cached input / output: официальные ставки Google и итоговая цена на apiToken.sale после плоской B2C-скидки 50%, которая одинаково действует на каждый tier.
| Tier | ID модели | Официально: ввод / кеш / вывод | После скидки 50% |
|---|---|---|---|
| Pro | gemini-3.1-pro-preview | $2 / $0.20 / $12 | $1 / $0.10 / $6 |
| Flash | gemini-3.8-flash | $0.75 / $0.075 / $3.75 промо | $0.375 / $0.0375 / $1.875 |
| Flash-Lite | gemini-3.1-flash-lite | $0.25 / $0.025 / $1.50 | $0.125 / $0.0125 / $0.75 |
| Flash-Lite (2.5) | gemini-2.5-flash-lite | $0.10 / $0.01 / $0.40 | $0.05 / $0.005 / $0.20 |
Бросаются в глаза две вещи. Output — дорогая нога на каждом tier: в четыре–восемь раз дороже input, поэтому модель, которая справляется с первого прохода по более низкой ставке output, обычно обыгрывает более сильную модель с повторами. И разброс огромен: output Flash-Lite тарифицируется как одна восьмая output Pro, поэтому увод классификации и извлечения с верхних tier важнее любой оптимизации промптов.
Gemini 3.8 Flash использует промо Google $0.75/$0.075/$3.75 до 2026-12-31 и возвращается на $1.50/$0.15/$7.50 с 2027-01-01. Cached input — отдельный usage-компонент по 10% от fresh input; он не добавляется к свежему input за те же токены.
Контекстное окно, потолок output и порог 200K
Контекст почти не различает tier: у актуальных текстовых Pro, Flash и Flash-Lite одно окно 1M токенов и output до 64K. Flash-Lite — не tier с маленьким контекстом: его преимущество — цена и задержка на простой работе, а не более короткое окно. Единственное контекстное правило, которое меняет счёт, живёт на Pro.
- Запросы Gemini 3.1 Pro Preview свыше 200K входных токенов пересчитывают весь запрос по $4 за input и $18 за output на 1M — повышенные ставки действуют на каждый токен, а не только на превышение. После скидки 50% это $2/$9.
- Flash и Flash-Lite держат плоские ставки во всём окне: вызов Flash со 900K input стоит по той же ставке за токен, что и вызов на 1K.
- Image-tier устроен иначе: Gemini 3.1 Flash Image даёт контекст 128K и output до 32K, а его cached input тарифицируется по полной ставке input, а не по текстовым 10%.
- Перед большим вызовом прогоните countTokens по тому же пути модели — это бесплатно и заранее покажет, пересекает ли запрос порог Pro в 200K, ещё до оплаты.
Какой tier под какую нагрузку
Сопоставляйте tier с ценой ошибки, а не с ощущениями. Tier подходит, когда стоимость неверного или поверхностного ответа на этом шаге ниже токен-премии следующего tier.
- Pro (gemini-3.1-pro-preview): многофайловые рефакторинги, анализ архитектурных компромиссов, глубокий разбор документов и финальный аудит output, сгенерированного Flash, — работа, где пропущенный edge case стоит дороже токенов.
- Flash (gemini-3.8-flash): повседневный интерактивный код, агентные циклы с множеством tool calls, мультимодальный input и сбалансированный production-трафик. Это правильный дефолт примерно для всего, что вы не измерили иначе.
- Flash-Lite (gemini-3.1-flash-lite): классификация, извлечение, роутинг, суммаризация и другой детерминированный pre-processing на объёмах — там, где запрос предсказуем, а планка качества проверяется программно.
Более старый Gemini 2.5 Flash-Lite остаётся в каталоге по $0.10/$0.40 официально — самый дешёвый опубликованный текстовый tier — и легитимный выбор для высокообъёмных конвейеров, уже проверенных на нём.
Смена tier — это одно поле на одном ключе
Здесь нет планов, регистраций или endpoint под каждый tier. Один ключ apiToken.sale покрывает все tier Gemini — плюс поддерживаемые модели Claude, GPT и Kimi — на едином предоплаченном балансе. Направьте нативный протокол Gemini на https://router.apitoken.sale, передайте ключ как x-goog-api-key и меняйте только ID модели:
curl https://router.apitoken.sale/v1beta/models/gemini-3.8-flash:generateContent \
-H "x-goog-api-key: $APITOKEN_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this diff in one sentence."}]}]}'Замените gemini-3.8-flash на gemini-3.1-pro-preview или gemini-3.1-flash-lite — и тот же запрос выполнится на этом tier. GET /v1beta/models на том же base URL возвращает точные ID, доступные вашему ключу. Стриминг работает по tier через streamGenerateContent?alt=sse, а официальные Google GenAI SDK работают без изменений, кроме base URL.
Подводный камень SDK: передавайте голый хост как base URL. Google SDK сам добавляет /v1beta, поэтому base URL, уже заканчивающийся на /v1beta, даст удвоенный путь и 404.
Политика маршрутизации, которая держит расходы на Gemini ровными
- 01Назначьте gemini-3.8-flash дефолтом для каждой нагрузки — интерактивных сессий, CI-агентов и production-трафика.
- 02Заранее определите триггеры эскалации: провалившаяся или поверхностная попытка Flash, diff с большим числом файлов, чем вы способны проверить глазами, или необратимое архитектурное решение уходит в gemini-3.1-pro-preview.
- 03Перенесите детерминированные подзадачи — классификацию интентов, извлечение полей, реранкинг — в gemini-3.1-flash-lite и проверяйте output программно, чтобы регрессии качества всплывали сразу.
- 04Вызывайте countTokens перед любым запросом к Pro, который, по вашим прикидкам, близок к 200K input; если порог пересечён, либо обрежьте контекст, либо осознанно примите ставки длинного контекста $4/$18.
- 05Еженедельно смотрите токен-статистику в дашборде и корректируйте распределение: восьмикратный разрыв между output Flash-Lite и Pro означает, что небольшой сдвиг в маршрутизации двигает счёт сильнее любой правки промпта.
Поскольку скидка 50% действует плоско на все tier, относительный порядок никогда не меняется: Flash-Lite — всегда самый дешёвый счётчик, а Pro — всегда премиальный, поэтому политика маршрутизации, настроенная на официальных ценах, остаётся валидной и здесь.
Полная тарифная сетка Gemini, включая image output и ноги длинного контекста →
Частые вопросы
Какую модель Gemini выбрать для кода?
Начните с Gemini 3.8 Flash — это текущая GA-модель Flash для интерактивного кода и агентных циклов. Трудную архитектуру и review эскалируйте в Gemini 3.1 Pro Preview, а Flash-Lite используйте для дешёвых детерминированных подзадач.
Ограничен ли Flash-Lite меньшим контекстным окном?
Нет. Опубликованные текстовые Flash-Lite сохраняют тот же контекст 1M токенов и потолок output 64K, что Flash и Pro. Их преимущество — меньшие цена и задержка на простой работе, а не более короткое окно.
Когда применяется long-context тариф Gemini Pro?
Когда запрос Gemini 3.1 Pro Preview превышает 200K входных токенов, весь запрос пересчитывается по $4 за input и $18 за output на 1M официально ($2/$9 после скидки 50%). У Flash и Flash-Lite премии за длинный контекст нет. Если сомневаетесь, сначала вызовите бесплатный countTokens.
Можно ли переключаться между Pro, Flash и Flash-Lite без нового ключа?
Да. Оставьте тот же base URL и заголовок x-goog-api-key и меняйте только ID модели в пути generateContent. Один ключ и один предоплаченный баланс покрывают все tier Gemini плюс поддерживаемые модели Claude, GPT и Kimi.
Действует ли скидка apiToken.sale на все три tier?
Да. Плоская B2C-скидка 50% применяется после точного расчёта официальных usage-компонентов — input, cached input, output и любых ног длинного контекста или изображений — одинаково для Pro, Flash, Flash-Lite и Flash Image.
Какая модель Gemini самая дешёвая для массовой работы?
Gemini 2.5 Flash-Lite — $0.10/$0.40 за 1M токенов официально ($0.05/$0.20 после скидки); Gemini 3.1 Flash-Lite за $0.25/$1.50 официально — бюджетный tier текущего поколения.
Создайте аккаунт через Google или GitHub и протестируйте шлюз с бонусом $5 на балансе платформы.