---
title: Gemini Pro vs Flash vs Flash-Lite: что выбрать
description: "Gemini Pro vs Flash vs Flash-Lite: сравнение ставок за токены, поведения контекста и цен на кеш. Все три tier на одном ключе apiToken.sale со скидкой 50%."
url: https://apitoken.sale/ru/docs/learn/gemini-pro-vs-flash-vs-flash-lite
language: ru
---

# Gemini Pro, Flash и Flash-Lite: как выбрать tier под каждый запрос

Выбор между Gemini Pro, Flash и Flash-Lite — задача маршрутизации, а не вопрос лояльности. Gemini 3.8 Flash — дефолт для кода и агентов, Gemini 3.1 Pro Preview — tier эскалации для трудных рассуждений, а Gemini 3.1 Flash-Lite забирает дешёвые массовые шаги — всё это на одном ключе, одном endpoint и одном предоплаченном балансе.

## Короткий ответ: Flash по умолчанию, Pro — по факту, Flash-Lite — на объёмах

Держите Gemini 3.8 Flash дефолтным tier, поднимайте запрос до Gemini 3.1 Pro Preview, когда задаче действительно нужны более глубокие рассуждения, а детерминированную массовую работу опускайте в Gemini 3.1 Flash-Lite. У всех трёх текстовых tier одинаковый контекст 1M токенов, тот же потолок output в 64K и та же форма запроса generateContent, поэтому выбор tier стоит одно поле в запросе — и никогда не требует новой интеграции.

Дорогие ошибки сидят на обоих краях. Гонять всё на Pro — значит платить ставки output Pro за работу, которую Flash делает не хуже; никогда не выходить из Flash-Lite — значит получать циклы повторов на задачах, которые он заведомо не решит. Относитесь к трём tier как к одной системе с разными счётчиками: Flash черновит, Pro разбирает исключения, Flash-Lite делает механический pre-processing перед обоими.

## Тарифная сетка: сколько каждый tier реально стоит за миллион токенов

Цена — главное различие tier. Все цифры ниже — за 1M токенов, в формате input / cached input / output: официальные ставки Google и итоговая цена на apiToken.sale после плоской B2C-скидки 50%, которая одинаково действует на каждый tier.

| Tier | ID модели | Официально: ввод / кеш / вывод | После скидки 50% |
| --- | --- | --- | --- |
| Pro | gemini-3.1-pro-preview | $2 / $0.20 / $12 | $1 / $0.10 / $6 |
| Flash | gemini-3.8-flash | $0.75 / $0.075 / $3.75 промо | $0.375 / $0.0375 / $1.875 |
| Flash-Lite | gemini-3.1-flash-lite | $0.25 / $0.025 / $1.50 | $0.125 / $0.0125 / $0.75 |
| Flash-Lite (2.5) | gemini-2.5-flash-lite | $0.10 / $0.01 / $0.40 | $0.05 / $0.005 / $0.20 |

Бросаются в глаза две вещи. Output — дорогая нога на каждом tier: в четыре–восемь раз дороже input, поэтому модель, которая справляется с первого прохода по более низкой ставке output, обычно обыгрывает более сильную модель с повторами. И разброс огромен: output Flash-Lite тарифицируется как одна восьмая output Pro, поэтому увод классификации и извлечения с верхних tier важнее любой оптимизации промптов.

> Gemini 3.8 Flash использует промо Google $0.75/$0.075/$3.75 до 2026-12-31 и возвращается на $1.50/$0.15/$7.50 с 2027-01-01. Cached input — отдельный usage-компонент по 10% от fresh input; он не добавляется к свежему input за те же токены.

## Контекстное окно, потолок output и порог 200K

Контекст почти не различает tier: у актуальных текстовых Pro, Flash и Flash-Lite одно окно 1M токенов и output до 64K. Flash-Lite — не tier с маленьким контекстом: его преимущество — цена и задержка на простой работе, а не более короткое окно. Единственное контекстное правило, которое меняет счёт, живёт на Pro.

- Запросы Gemini 3.1 Pro Preview свыше 200K входных токенов пересчитывают весь запрос по $4 за input и $18 за output на 1M — повышенные ставки действуют на каждый токен, а не только на превышение. После скидки 50% это $2/$9.
- Flash и Flash-Lite держат плоские ставки во всём окне: вызов Flash со 900K input стоит по той же ставке за токен, что и вызов на 1K.
- Image-tier устроен иначе: Gemini 3.1 Flash Image даёт контекст 128K и output до 32K, а его cached input тарифицируется по полной ставке input, а не по текстовым 10%.
- Перед большим вызовом прогоните countTokens по тому же пути модели — это бесплатно и заранее покажет, пересекает ли запрос порог Pro в 200K, ещё до оплаты.

## Какой tier под какую нагрузку

Сопоставляйте tier с ценой ошибки, а не с ощущениями. Tier подходит, когда стоимость неверного или поверхностного ответа на этом шаге ниже токен-премии следующего tier.

- Pro (gemini-3.1-pro-preview): многофайловые рефакторинги, анализ архитектурных компромиссов, глубокий разбор документов и финальный аудит output, сгенерированного Flash, — работа, где пропущенный edge case стоит дороже токенов.
- Flash (gemini-3.8-flash): повседневный интерактивный код, агентные циклы с множеством tool calls, мультимодальный input и сбалансированный production-трафик. Это правильный дефолт примерно для всего, что вы не измерили иначе.
- Flash-Lite (gemini-3.1-flash-lite): классификация, извлечение, роутинг, суммаризация и другой детерминированный pre-processing на объёмах — там, где запрос предсказуем, а планка качества проверяется программно.

Более старый Gemini 2.5 Flash-Lite остаётся в каталоге по $0.10/$0.40 официально — самый дешёвый опубликованный текстовый tier — и легитимный выбор для высокообъёмных конвейеров, уже проверенных на нём.

## Смена tier — это одно поле на одном ключе

Здесь нет планов, регистраций или endpoint под каждый tier. Один ключ apiToken.sale покрывает все tier Gemini — плюс поддерживаемые модели Claude, GPT и Kimi — на едином предоплаченном балансе. Направьте нативный протокол Gemini на https://router.apitoken.sale, передайте ключ как x-goog-api-key и меняйте только ID модели:

```
curl https://router.apitoken.sale/v1beta/models/gemini-3.8-flash:generateContent \
  -H "x-goog-api-key: $APITOKEN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize this diff in one sentence."}]}]}'
```

Замените gemini-3.8-flash на gemini-3.1-pro-preview или gemini-3.1-flash-lite — и тот же запрос выполнится на этом tier. GET /v1beta/models на том же base URL возвращает точные ID, доступные вашему ключу. Стриминг работает по tier через streamGenerateContent?alt=sse, а официальные Google GenAI SDK работают без изменений, кроме base URL.

> Подводный камень SDK: передавайте голый хост как base URL. Google SDK сам добавляет /v1beta, поэтому base URL, уже заканчивающийся на /v1beta, даст удвоенный путь и 404.

## Политика маршрутизации, которая держит расходы на Gemini ровными

1. Назначьте gemini-3.8-flash дефолтом для каждой нагрузки — интерактивных сессий, CI-агентов и production-трафика.
2. Заранее определите триггеры эскалации: провалившаяся или поверхностная попытка Flash, diff с большим числом файлов, чем вы способны проверить глазами, или необратимое архитектурное решение уходит в gemini-3.1-pro-preview.
3. Перенесите детерминированные подзадачи — классификацию интентов, извлечение полей, реранкинг — в gemini-3.1-flash-lite и проверяйте output программно, чтобы регрессии качества всплывали сразу.
4. Вызывайте countTokens перед любым запросом к Pro, который, по вашим прикидкам, близок к 200K input; если порог пересечён, либо обрежьте контекст, либо осознанно примите ставки длинного контекста $4/$18.
5. Еженедельно смотрите токен-статистику в дашборде и корректируйте распределение: восьмикратный разрыв между output Flash-Lite и Pro означает, что небольшой сдвиг в маршрутизации двигает счёт сильнее любой правки промпта.

Поскольку скидка 50% действует плоско на все tier, относительный порядок никогда не меняется: Flash-Lite — всегда самый дешёвый счётчик, а Pro — всегда премиальный, поэтому политика маршрутизации, настроенная на официальных ценах, остаётся валидной и здесь.

[Полная тарифная сетка Gemini, включая image output и ноги длинного контекста](/docs/learn/gemini-api-pricing)

[Сравните все поддерживаемые модели и цены](/models)

## Частые вопросы

### Какую модель Gemini выбрать для кода?

Начните с Gemini 3.8 Flash — это текущая GA-модель Flash для интерактивного кода и агентных циклов. Трудную архитектуру и review эскалируйте в Gemini 3.1 Pro Preview, а Flash-Lite используйте для дешёвых детерминированных подзадач.

### Ограничен ли Flash-Lite меньшим контекстным окном?

Нет. Опубликованные текстовые Flash-Lite сохраняют тот же контекст 1M токенов и потолок output 64K, что Flash и Pro. Их преимущество — меньшие цена и задержка на простой работе, а не более короткое окно.

### Когда применяется long-context тариф Gemini Pro?

Когда запрос Gemini 3.1 Pro Preview превышает 200K входных токенов, весь запрос пересчитывается по $4 за input и $18 за output на 1M официально ($2/$9 после скидки 50%). У Flash и Flash-Lite премии за длинный контекст нет. Если сомневаетесь, сначала вызовите бесплатный countTokens.

### Можно ли переключаться между Pro, Flash и Flash-Lite без нового ключа?

Да. Оставьте тот же base URL и заголовок x-goog-api-key и меняйте только ID модели в пути generateContent. Один ключ и один предоплаченный баланс покрывают все tier Gemini плюс поддерживаемые модели Claude, GPT и Kimi.

### Действует ли скидка apiToken.sale на все три tier?

Да. Плоская B2C-скидка 50% применяется после точного расчёта официальных usage-компонентов — input, cached input, output и любых ног длинного контекста или изображений — одинаково для Pro, Flash, Flash-Lite и Flash Image.

### Какая модель Gemini самая дешёвая для массовой работы?

Gemini 2.5 Flash-Lite — $0.10/$0.40 за 1M токенов официально ($0.05/$0.20 после скидки); Gemini 3.1 Flash-Lite за $0.25/$1.50 официально — бюджетный tier текущего поколения.

---
Get a key: https://apitoken.sale/register
More guides: https://apitoken.sale/ru/docs/learn
