Цены Kimi API: cache hit, cache miss, output и скорость
В цене Kimi API каждый запрос разбивается на три составляющие — cache-hit input, cache-miss input и output, — и у каждой своя официальная ставка за миллион токенов. Этот гайд разбирает реальную тарифную сетку K3, Kimi for Coding и High Speed, считает типичную coding-сессию по шагам и показывает, где в расчёт входит фиксированная скидка 50% от apiToken.sale.
·
Три составляющие, по которым тарифицируется каждый запрос к Kimi
Kimi не публикует единую цену за input. Каждый запрос учитывается как cache-hit input, cache-miss input и output, и у каждой составляющей своя официальная ставка за миллион токенов: попадания в кэш стоят в разы дешевле промахов, а output — дороже всего. apiToken.sale рассчитывает именно эти составляющие по официальной тарифной сетке, а затем вычитает фиксированную скидку 50% — до того, как сумма коснётся вашего предоплатного баланса.
Само кеширование автоматическое на стороне провайдера: ничего не нужно включать, отмечать точки разрыва кэша или управлять записями. Когда запрос повторяет контекст, который провайдер уже видел, совпавший префикс обслуживается из кэша и учитывается по ставке hit. Всё остальное — miss. Отдельной цены за запись в кэш провайдер не публикует, поэтому скрытой четвёртой составляющей нет: только что закешированный токен просто считается cache miss в запросе, который его внёс, а следующие запросы получают дешёвую ставку hit.
Практическое следствие: два внешне одинаковых вызова могут стоить очень по-разному в зависимости от того, какая часть промпта попала в кэш. Агентные циклы, которые на каждом ходу заново отправляют большой стабильный системный промпт и контекст файлов, — это ровно тот трафик, который собирает ставки hit: первый ход оплачивает miss, остальные едут на кэше.
Reasoning-токены — это подмножество output, а не отдельный класс токенов. Kimi for Coding и High Speed работают с включённым thinking, и всё, что модель «продумывает», тарифицируется по ставке output — поверх output это никогда не добавляется второй раз.
Читайте также: Kimi K3 vs Kimi for Coding: какая модель для какой нагрузки
Официальные ставки за каждым публичным alias
| Публичный alias | Официально hit / miss / output | Цена здесь после скидки 50% |
|---|---|---|
| kimi/k3 · k3-256k · k3[1m] | $0.30 / $3 / $15 | $0.15 / $1.50 / $7.50 |
| kimi/kimi-for-coding | $0.19 / $0.95 / $4 | $0.095 / $0.475 / $2 |
| kimi/kimi-for-coding-highspeed | $0.38 / $1.90 / $8 | $0.19 / $0.95 / $4 |
Все цифры — за 1 млн токенов, слева направо: cache-hit input, cache-miss input, output. Из таблицы следуют два структурных факта. Первый: Kimi for Coding — самая низкая общая coding-ставка в опубликованном наборе Kimi. Второй: High Speed ровно вдвое дороже базового Kimi for Coding по каждой составляющей — вы платите за latency, а не за другую модель.
Строка K3 покрывает три написания одной тарифной сетки. k3-256k выбирает контекстный режим K3 на 256K; k3 и k3[1m] — режим на 1M, а форма со скобками — совместимое написание, которое роутер нормализует в реальную wire-модель K3 провайдера. Цена за токен во всех трёх вариантах одинаковая, поэтому выбор — про поведение контекста, а не про цену. Чего отправлять нельзя, так это внутренний тарифный ID Open Platform вроде kimi-k2.7-code — роутер принимает только публичные subscription-aliases, которые возвращает GET /v1/models.
Пример расчёта: одна coding-сессия по составляющим
Возьмём типичную агентную сессию на kimi/kimi-for-coding: стабильный системный промпт и контекст репозитория, которые кешируются после первого хода, немного свежего input на каждом ходу и компактные ответы. Допустим, сессия закрылась на 400 000 cache-hit токенов, 100 000 cache-miss токенов и 20 000 output токенов:
| Составляющая | Расчёт по официальным ставкам | Сумма |
|---|---|---|
| Cache-hit input | 400,000 × $0.19 / 1M | $0.076 |
| Cache-miss input | 100,000 × $0.95 / 1M | $0.095 |
| Output | 20,000 × $4 / 1M | $0.08 |
| Официальные расходы | $0.076 + $0.095 + $0.08 | $0.251 |
| Фиксированная скидка 50% для B2C | $0.251 × 50% | −$0.1255 |
| Списано с баланса | $0.251 − $0.1255 | $0.1255 |
Из этой арифметики стоит запомнить две вещи. Output доминирует, хотя токенов в нём меньше всего: output-токенов в двадцать раз меньше, чем cache-hit, а стоят они всё равно дороже всей hit-составляющей. И основную работу сделал кэш: те же 500 000 input-токенов, посчитанные целиком как miss, стоили бы официально $0.475 вместо $0.171. Держать дорогой контекст стабильным между ходами — главный рычаг экономии на счёте Kimi.
Выбираем самый дешёвый alias под задачу
- По умолчанию направляйте coding-задачи и агентные циклы на kimi/kimi-for-coding — это самая низкая общая coding-ставка в опубликованном наборе.
- Берите kimi/kimi-for-coding-highspeed только тогда, когда низкая задержка стоит ровно двукратных базовых ставок по каждой составляющей; пакетной задаче, нечувствительной ко времени ожидания, это никогда не нужно.
- Используйте kimi/k3-256k вместо 1M-варианта, если задаче не нужен большой контекстный режим, — цена за токен та же, так что вы выбираете поведение, а не скидку.
- Переходите на K3 ($0.30 / $3 / $15 официально) только для работы, с которой Kimi for Coding реально не справляется: сложные рассуждения, длинные документы и большие кодовые базы.
- Установите lifetime-лимит расходов на ключ и сверяйте списанный usage в дашборде вместо того, чтобы полагаться на оценки «на конец месяца».
Как устроены расчёты, пополнения и баланс
apiToken.sale ничего не меняет в описанном выше учёте. Ваш запрос проходит через собственную систему учёта Kimi, каждая составляющая переводится в официальные расходы провайдера, и только потом вычитается фиксированная скидка 50% для B2C. Итоговая сумма списывается с единого предоплатного баланса, который покрывает и поддерживаемые модели Claude, GPT и Gemini по их собственным официальным тарифным сеткам. Никакой подписки, комиссии за запрос и минимальной суммы расходов.
Пополнять можно на любую сумму в целых долларах банковской картой или криптовалютой, баланс не сгорает. Каждый запрос виден в дашборде с указанием модели и разбивкой по токенам, так что арифметику из этого гайда можно сверить построчно с реальным трафиком. Когда баланс достигает нуля, запросы начинают падать с ошибкой недостатка средств до следующего пополнения — сам ключ остаётся действующим.
Сверяйте составляющие в объекте usage ответа
Ничего из этого не нужно прикидывать по количеству символов. Финальный объект usage показывает, что реально потребил каждый вызов, и Kimi следует форме ответа Anthropic Messages: закешированный input, свежий input и output попадают в непересекающиеся поля, которые можно напрямую умножить на тарифную сетку:
curl https://router.apitoken.sale/v1/messages \
-H "x-api-key: $APITOKEN_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{"model":"kimi/kimi-for-coding","max_tokens":512,"messages":[{"role":"user","content":"Summarize this diff"}]}'
# The response carries terminal usage in the Anthropic shape:
# "usage": {
# "input_tokens": 8420,
# "cache_read_input_tokens": 38400,
# "output_tokens": 512
# }
# cache_read_input_tokens bills at the hit rate ($0.19/1M),
# input_tokens at the miss rate ($0.95/1M),
# output_tokens at the output rate ($4/1M) — then 50% off the total.Поскольку составляющие остаются непересекающимися на всём пути от учёта провайдера до журнала в вашем дашборде, у любой аномалии расходов есть адрес: скачок cache-miss означает, что кто-то отредактировал середину ранее стабильного префикса, а скачок output — что модель стала дольше рассуждать или длиннее отвечать. OpenAI-совместимые клиенты работают с теми же aliases через универсальный лейн /v1 и рассчитываются идентично.
Частые вопросы
Сколько стоит Kimi for Coding?
Официальные ставки: $0.19 за 1 млн cache-hit токенов, $0.95 за 1 млн cache-miss токенов и $4 за 1 млн output токенов; apiToken.sale списывает половину каждой составляющей после расчёта.
Почему у Kimi отдельные цены для cache hit и cache miss?
Kimi автоматически кеширует повторяющийся контекст. Финальный usage показывает, какая часть input обслужена из кэша, и каждая составляющая получает свою официальную ставку — hit заметно дешевле miss.
Есть ли отдельная цена за запись в кэш Kimi?
Нет. Провайдер не публикует составляющую cache-write, поэтому только что закешированный токен считается cache miss в запросе, который его внёс; последующие запросы платят по ставке hit.
Kimi High Speed дороже?
Да. Его ставки cache-hit, cache-miss и output ровно вдвое выше базовых ставок Kimi for Coding — $0.38 / $1.90 / $8 официально за 1 млн токенов.
k3, k3-256k и k3[1m] отличаются по цене?
Нет. Все три написания делят одну тарифную сетку ($0.30 / $3 / $15 официально за 1 млн); они лишь выбирают контекстный режим K3 на 256K или 1M, а k3[1m] — совместимый alias.
Reasoning-токены Kimi стоят дополнительно?
Они тарифицируются по ставке output как подмножество output-токенов. Thinking никогда не считается отдельным классом токенов и не добавляется поверх output.
Войдите через Google или GitHub и получите приветственный бонус $5 на баланс платформы — без карты.