Настройка инструментов

Запуск Kimi K3 и Kimi for Coding в Claude Code

Claude Code говорит по Anthropic Messages с любым эндпоинтом, который вы укажете, поэтому subscription alias Kimi на роутере apiToken.sale работает без плагина и без патча. Надёжная настройка закрепляет каждый внутренний model tier на Kimi — незакреплённый tier унаследует Claude ID и упадёт только тогда, когда запустится фоновый путь. Весь расход ложится на один предоплатный баланс — вдвое ниже официальных токен-расценок Kimi.

·

Claude Code уже говорит на протоколе Kimi

Claude Code отправляет запросы Anthropic Messages туда, куда указывает ANTHROPIC_BASE_URL, а роутер https://router.apitoken.sale отвечает по этому протоколу для subscription alias Kimi. Ни плагина, ни прокси, ни форка не нужно: вы меняете переменные окружения — и каждая сессия, выбор tier и вызов subagent уходят в Kimi вместо Anthropic. Биллинг переезжает на ваш предоплатный баланс apiToken.sale — ровно на 50% ниже официальных токен-расценок Kimi.

Единственное, из-за чего такая настройка ломается молча, — внутренняя карта моделей Claude Code. Она держит отдельные модели для основной сессии, tiers Opus/Sonnet/Haiku и subagents. Если задать только ANTHROPIC_MODEL, видимый диалог перенаправится, а фоновые пути — генерация заголовка, compaction, Task subagents — по-прежнему пойдут с унаследованными Claude ID и сломаются в момент запуска.

Читайте также: Kimi, Claude, GPT и Gemini в Kimi Code

Закрепите эндпоинт и каждый model tier

export ANTHROPIC_BASE_URL=https://router.apitoken.sale
export ANTHROPIC_API_KEY=sk-pool-•••
export ANTHROPIC_MODEL=k3
export ANTHROPIC_DEFAULT_OPUS_MODEL=k3
export ANTHROPIC_DEFAULT_SONNET_MODEL=k3
export ANTHROPIC_DEFAULT_HAIKU_MODEL=k3
export CLAUDE_CODE_SUBAGENT_MODEL=k3
export CLAUDE_CODE_MAX_CONTEXT_TOKENS=1048576
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1048576

claude --model k3

Три переменные ANTHROPIC_DEFAULT_* покрывают tier-маршрутизацию Claude Code, CLAUDE_CODE_SUBAGENT_MODEL — Task subagents, а две переменные контекста поднимают и окно, и потолок auto-compact до 1M токенов K3. На Anthropic lane указывайте subscription alias в чистом виде; scoped-каталог GET /v1/models показывает написания с namespace kimi/*, поэтому сверьтесь с ним, прежде чем закреплять alias в долгоживущем окружении.

Не пропускайте две переменные 1M на alias k3 и не оставляйте их на alias с 256K. Они сообщают Claude Code, сколько контекста можно использовать до compaction, и значение, которое обслуживаемая модель не поддерживает, искажает это решение в обе стороны.

Подберите alias под сессию

AliasКонтекстОфициально hit / miss / outputЗдесь после скидки 50%
kimi-for-coding256K$0.19 / $0.95 / $4$0.095 / $0.475 / $2
kimi-for-coding-highspeed256K$0.38 / $1.90 / $8$0.19 / $0.95 / $4
k3-256k256K$0.30 / $3 / $15$0.15 / $1.50 / $7.50
k3 · k3[1m]1M$0.30 / $3 / $15$0.15 / $1.50 / $7.50

Цифры — за 1M токенов; кеширование Kimi работает автоматически, поэтому cache hit и cache miss тарифицируются как отдельные ноги. Для alias на 256K, таких как k3-256k или kimi-for-coding, оставьте закрепление tiers ровно как выше, но уберите CLAUDE_CODE_MAX_CONTEXT_TOKENS и CLAUDE_CODE_AUTO_COMPACT_WINDOW. k3[1m] — совместимое написание 1M-режима K3: роутер нормализует его в реальную wire-модель провайдера k3, поэтому обе формы стоят одинаково.

Практичное разделение: kimi-for-coding — ежедневный рабочий инструмент для правок и тестовых циклов, k3 — когда сессии нужен длинный контекст по всему репозиторию, а kimi-for-coding-highspeed — только когда латентность оправдывает ровно двукратные базовые расценки.

Полное сравнение K3 и Kimi for Coding

Проверяйте маршрут, а не самопрезентацию модели

  1. 01Запустите сессию и выполните /status. Убедитесь, что Anthropic base URL — это apiToken.sale, прежде чем доверять чему-либо ещё в сессии.
  2. 02Отправьте один тривиальный промпт — «Reply with exactly: connected». Чистый ответ доказывает ключ, base URL и баланс за один round trip.
  3. 03Проверьте scoped-каталог, прежде чем закреплять alias надолго: curl https://router.apitoken.sale/v1/models с вашим ключом покажет, что ключ реально может вызывать.
  4. 04Один раз прогоните Task subagent. Это путь, который чаще всего тащит незакреплённый tier, — и такой отказ лучше поймать в первый день, а не посреди рефакторинга.

Не просите модель назвать себя как способ проверки. System prompt Claude Code может заставить любой backend назваться Claude, поэтому представление ничего не говорит о том, какая модель обслуживает turn, — доказательства это /status и путь запроса.

Переключатели reasoning — не селекторы моделей

Значение none или off в слоте модели отключает reasoning K3; оно не переключает вас на другую или более старую модель Kimi. Такие turns в любом случае остаются на тарифе K3. kimi-k2.6 — не адресуемая публичная модель на роутере, поэтому ввод этого имени не выбирает ничего — используйте alias из scoped-каталога.

K3 поддерживает уровни reasoning effort low, high и max, по умолчанию — high; Kimi for Coding работает с включённым thinking. Reasoning-токены — это подмножество output и тарифицируются по расценке output: они никогда не добавляются повторно как отдельный класс токенов, поэтому сессия с тяжёлым thinking отражается как объём output, а не как надбавка.

Сколько стоит сессия Kimi на предоплатном балансе

Каждый turn тарифицируется за токен по официальным расценкам Kimi выше, а фиксированная скидка 50% вычитается до того, как списание коснётся вашего предоплатного баланса. Ни подписки, ни платы за место: неделя простоя ничего не стоит, а тяжёлый рефакторинг стоит ровно столько токенов, сколько он потребил, — при половине официального расхода. Тот же баланс покрывает поддерживаемые модели Claude, GPT и Gemini, так что сессия Claude Code на Kimi тратит тот же пул, что и всё остальное, что вы запускаете.

  • Задайте общий лимит расходов на ключ и проверяйте settled-расход в дашборде.
  • По умолчанию используйте kimi-for-coding и поднимайте сессии по всему репозиторию до k3 вместо того, чтобы гонять всё по расценкам K3.
  • Приберегите kimi-for-coding-highspeed для циклов, чувствительных к латентности: его расценки ровно вдвое выше базового tier.
  • Воспринимайте ответ об исчерпании баланса как сигнал: пополните баланс — и следующий запрос пройдёт; повторные попытки ничего не меняют.

Расценки Kimi по alias и cache-ногам

Живой каталог всех поддерживаемых моделей и цен

Частые вопросы

Claude Code поддерживает Kimi K3?

Да. Направьте ANTHROPIC_BASE_URL на https://router.apitoken.sale, аутентифицируйтесь ключом apiToken.sale и закрепите каждый model tier на допущенном subscription alias Kimi — плагин не нужен, потому что Claude Code уже говорит по Anthropic Messages.

Почему нужно закрепить все переменные моделей Claude Code?

Claude Code выбирает отдельные модели для основной сессии, своих tiers и subagents. Незакреплённый tier может унаследовать Claude ID и упасть только при запуске фонового пути, поэтому сессия может выглядеть здоровой, пока сломаны compaction или вызов Task.

Как сохранить полный контекст K3 1M в Claude Code?

Используйте k3 или k3[1m] и установите обе переменные CLAUDE_CODE_MAX_CONTEXT_TOKENS и CLAUDE_CODE_AUTO_COMPACT_WINDOW в 1048576. На alias с 256K, таких как k3-256k или kimi-for-coding, обе переменные не задавайте.

kimi-k2.6 — валидный ID модели в Claude Code?

Нет. kimi-k2.6 не является адресуемой публичной моделью на роутере, а none/off в слоте модели отключает reasoning K3, а не выбирает другую модель. Используйте subscription alias, которые возвращает scoped-каталог GET /v1/models.

Сколько стоит сессия Claude Code на Kimi?

Расход тарифицируется за токен по официальным расценкам Kimi с фиксированной скидкой 50% на предоплатном балансе — Kimi for Coding стоит $0.19 / $0.95 / $4 за 1M токенов cache-hit, cache-miss и output до скидки, High Speed — ровно вдвое дороже.

Создайте аккаунт через Google или GitHub и протестируйте шлюз с бонусом $5 на балансе платформы.