---
title: Цены GPT API: как считается стоимость
description: "GPT-6 Astra, Цены GPT API: ставки GPT-5.6 Sol, Terra и Luna за 1 млн токенов, цены на кэш, множитель длинного контекста от 272K и единая скидка 50% на apiToken.sale."
url: https://apitoken.sale/ru/docs/learn/gpt-api-pricing
language: ru
---

# Цены GPT API: input, кэш, output и длинный контекст

Цены GPT API — это сумма точных токенных компонентов: свежий input, cached input, запись кэша и output, каждый по ставке того tier модели, который обслужил запрос. Разбираем прайс GPT-5.6 Sol, Terra и Luna, множители кэша и длинного контекста, которые двигают счёт, и точку, где в расчёт вступает единая скидка 50% apiToken.sale.

## Как на самом деле считается счёт за GPT API

Цены GPT API — это потокенный учёт, а не цена за запрос. Каждый вызов тарифицирует токены, которые вы отправляете, — системный промпт, историю диалога, определения инструментов, найденные документы — по ставке input, а токены, которые модель генерирует в ответ, — по отдельной, более высокой ставке output. Нет ни платы за запрос, ни лицензии на рабочее место, ни минимального расхода: умножьте количество токенов на ставки модели — и получите точную стоимость вызова.

Токен — это примерно четыре символа английского текста, около трёх четвертей слова. Код, JSON и нелатинские алфавиты токенизируются плотнее, поэтому файл с исходником обходится дороже, чем тот же объём слов в прозе. Output стоит дороже по механической причине: input обрабатывается параллельно за один проход, а каждый output-токен требует собственного прямого прохода через модель.

Прикидки по количеству символов не нужны. Объект usage в ответе точно показывает, что израсходовал вызов, с разбивкой по компонентам, которые тарифицирует прайс:

```
"usage": {
  "prompt_tokens": 40210,
  "completion_tokens": 1834,
  "total_tokens": 42044,
  "prompt_tokens_details": { "cached_tokens": 32000 }
}
```

Возьмём gpt-5.6-sol по временным официальным ставкам: $4 за 1 млн input-токенов, $0.40 за 1 млн cached input, $5 за 1 млн токенов записи кэша и $20 за 1 млн output. Вызов выше стоит 8 210 × $4/М свежего input + 32 000 × $0.40/М кэшированного + 1 834 × $20/М output = $0.08232 по официальным ставкам — и $0.04116 после единой скидки 50% здесь. Это арифметика на авторитетных числах usage, поэтому источник истины для бюджета — объект usage, а не длина строки промпта.

## Прайс GPT-5.6: Sol, Terra и Luna

| Модель | Официально: input / cached / запись кэша / output | Цена здесь после −50% |
| --- | --- | --- |
| gpt-5.6-sol | $4 / $0.40 / $5 / $20 | $2 / $0.20 / $2.50 / $10 |
| gpt-5.6-terra | $2 / $0.20 / $2.50 / $12 | $1 / $0.10 / $1.25 / $6 |
| gpt-5.6-luna | $0.20 / $0.02 / $0.25 / $1.20 | $0.10 / $0.01 / $0.125 / $0.60 |

Ставки указаны за 1 млн токенов. Временная официальная акция Sol действует до 2026-11-21 включительно; с 2026-11-22 UTC возвращаются стандартные $5 за input и $30 за output. gpt-5.6 — это alias gpt-5.6-sol, поэтому у него та же цена, а не отдельный тариф: переключение между двумя ID ничего не меняет в счёте.

Разброс между tier — самый мощный рычаг экономии на GPT. По временным ставкам input Terra стоит 50% от Sol, output — 60%; для Luna это 5% и 6% соответственно. Маршрутизация каждой задачи на самый слабый tier, который с ней справляется, — Luna для классификации, извлечения и роутинга, Terra для повседневного кодинга и production-чата, Sol для самого сложного reasoning — экономит больше, чем любая обрезка промптов. А скидка 50% сохраняет этот порядок, потому что применяется ко всем компонентам одинаково.

## Чтение кэша за 10%, запись кэша за 125%

Когда повторяющийся префикс промпта отдаётся из кэша провайдера, эти токены тарифицируются отдельным компонентом cached input — по 10% обычной ставки input: $0.40 вместо $4 за 1 млн на Sol во время акции. Хранение префикса не бесплатное: запись кэша GPT-5.6 тарифицируется по 125% обычного input, то есть по $5 за 1 млн на акционном Sol, так что первый вызов платит небольшую премию, а каждое последующее попадание почти бесплатно. Даже одно повторное чтение уже выгоднее: 1.25× плюс 0.10× меньше, чем дважды полный input.

- Терминальный объект usage решает, какие токены были закэшированы; за один и тот же токен вас никогда не спишут одновременно как cached и как fresh input.
- Держите стабильный контент — системный промпт, определения инструментов, большие справочные файлы — в начале промпта: кэш совпадает по префиксам, а не по фрагментам.
- Правка в середине закэшированного префикса инвалидирует всё от точки правки и дальше, и следующий вызов снова платит полную цену input за этот хвост.
- Многошаговые агенты выигрывают автоматически: каждый ход заново отправляет накопленный диалог как input, и неизменные ранние ходы приходят как cached-токены.

> Классический убийца кэша — изменчивые данные в начале промпта: таймстемпы, ID запросов, случайные сиды. Переносите всё, что меняется от вызова к вызову, в конец списка сообщений — иначе каждый запрос превращается в свежую запись кэша по 125% без дешёвых чтений.

## Обрыв длинного контекста на 272K

Выше 272K входных токенов включается long-context тариф GPT на весь запрос: 2× на input и 1.5× на output — не только на токены за границей. Скачок достаточно резкий, чтобы учитывать его при планировании: запрос чуть ниже порога и чуть выше различаются гораздо сильнее, чем на эти лишние токены.

На Sol по акционному тарифу 270K input-токенов с 2K output стоят 270 000 × $4/М + 2 000 × $20/М = $1.12 по официальному прайсу. Добавьте ещё 3K input-токенов — 273 000 × $8/М + 2 000 × $30/М — и тот же запрос стоит $2.244. Один процент лишнего input примерно удвоил счёт. Подрежьте историю диалога, сузьте retrieval или разбейте задачу до пересечения границы; после скидки 50% обрыв остаётся обрывом, просто вдвое ниже.

## Reasoning-токены тарифицируются как output, один раз

Модели GPT-5.6 предлагают регулируемое reasoning effort, и сгенерированный reasoning тарифицируется внутри output usage по ставке output. Reasoning-токены входят в компонент output и не списываются второй раз как отдельный класс токенов — но это настоящие output-токены по цене output, которая на Sol во время акции составляет $20 за 1 млн по официальному прайсу.

Это делает effort вторым рычагом после tier модели. Сложная архитектурная задача может оправдать max effort на Sol; подзадача роутинга или форматирования — нет. Отправка предсказуемой массовой работы на Luna с низким effort режет и ставку за токен, и количество невидимых токенов, за которые вы платите.

## Где срабатывает единая скидка 50%

apiToken.sale не меняет ничего из описанной выше механики. Ваш запрос уходит на OpenAI-совместимый эндпоинт, на него отвечают те же ID моделей, и объект usage показывает те же токенные компоненты. Меняется расчёт: каждый вызов сначала пересчитывается в точный официальный расход — input, cached input, запись кэша, output и множители длинного контекста там, где они применяются, — затем из него вычитается единая B2C-скидка 50%, и только потом что-то касается вашего предоплаченного баланса. Ни подписки, ни наценки: скидка и есть ценообразование.

Дашборд сохраняет settled usage и точное списание со скидкой по каждому запросу, так что вы можете сверить арифметику этого гайда с реальным трафиком вызов за вызовом, а не доверять счёту в конце месяца. С того же предоплаченного баланса тарифицируются поддерживаемые модели Claude, Gemini и Kimi по их собственным официальным прайсам — с той же скидкой.

[Страницы по моделям с полными прайсами и контекстными окнами](/models)

## GPT-6 Astra: новейшая модель GPT

GPT-6 Astra — новейшая модель GPT в каталоге моделей. Официальные ставки за свежий ввод/кешированный ввод/запись кеша/вывод — $10/$1/$12.50/$50 за 1 млн токенов; после скидки B2C 50% — $5/$0.50/$6.25/$25. Максимальный контекст Codex — 872K, консервативный лимит ввода — 744K, вывод — 128K. Уровни reasoning: low, medium, high, xhigh и max. Свыше 272K ввода ставки ввода и кеша удваиваются, вывода — умножаются на 1,5; Fast удваивает применимые ставки. Примеры GPT-5.6 ниже сохраняют свои ставки.

[GPT-6 Astra](/models/gpt-6-astra)

## Частые вопросы

### Сколько стоит GPT-5.6 за 1 млн токенов?

До 2026-11-21 включительно временные официальные ставки Sol за input/cached/запись кэша/output — $4/$0.40/$5/$20, а здесь после скидки 50% — $2/$0.20/$2.50/$10. С 2026-11-22 UTC возвращаются стандартные $5 за input и $30 за output. Terra остаётся на $2/$12, Luna — на $0.20/$1.20.

### Что считается cached input?

Повторяющиеся префиксы промпта, которые провайдер отдаёт из кэша. Терминальный usage определяет компонент cached; за один и тот же токен не списываются одновременно cached и fresh input.

### Когда включается long-context тариф?

Когда input превышает 272K токенов. Тогда весь запрос тарифицируется по 2× input и 1.5× output до скидки 50%.

### Reasoning-токены тарифицируются отдельно?

Нет. Reasoning-токены входят в output usage и оплачиваются по ставке output модели; это не второй отдельный компонент поверх output.

### Alias gpt-5.6 дешевле gpt-5.6-sol?

Нет. gpt-5.6 — alias gpt-5.6-sol и разделяет его точный прайс, так что оба ID стоят одинаково за токен.

---
Get a key: https://apitoken.sale/register
More guides: https://apitoken.sale/ru/docs/learn
