Как это работает

Как экономить токены в Claude API

Экономия токенов в Claude API держится на трёх рычагах: отправлять меньше входных токенов, генерировать меньше выходных и платить меньше за токен через выбор модели и промпт-кеширование. Каждый рычаг — конкретное изменение в запросах, которые вы уже отправляете, и все они складываются со скидкой apiToken.sale, которая делит пополам ценовую половину уравнения.

·

Куда на самом деле уходят токены Claude API

Ваш счёт за Claude API — это входные токены плюс выходные, и каждая модель тарифицируется отдельно. Два факта из прайса подсказывают, где оптимизировать: выходные токены стоят в пять раз дороже входных во всех актуальных моделях Claude, а многоходовый диалог при каждом вызове заново отправляет всю историю как свежий вход. Поэтому больше всего экономят три вещи: генерировать меньше вывода, пересылать меньше контекста и перекладывать работу на более дешёвые классы токенов — чтение из кэша и маленькие модели.

МодельОфициально вход / выход ($ за 1M)Здесь (−50%)
Claude Opus 4.8$5 / $25$2.50 / $12.50
Claude Sonnet 5$2 / $10$1 / $5
Claude Haiku 4.5$1 / $5$0.50 / $2.50

Читайте эту таблицу как таблицу маршрутизации, а не просто как прайс. Haiku в пять раз дешевле Opus за токен и на входе, и на выходе, а фиксированная скидка 50% для B2C делит каждую строку пополам, не меняя расклада — выбор модели экономит здесь ту же долю, что и против официальных цен.

Читайте также: Как устроены цены на Claude API

Кэшируйте контекст, который отправляете в каждом запросе

Промпт-кеширование — самый мощный способ сэкономить токены для всего со стабильным повторяющимся префиксом: длинные системные промпты, определения инструментов, большие справочные файлы. Вы помечаете конец стабильного блока точкой останова cache_control; первый вызов записывает кэш (тарифицируется отдельно), а последующие читают его за долю цены свежего входа. Запись в кэше живёт около пяти минут, и каждое чтение продлевает её, поэтому активная сессия держит кэш тёплым сколько угодно долго.

curl https://router.apitoken.sale/v1/messages \
  -H "x-api-key: sk-pool-•••" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5",
    "max_tokens": 1024,
    "system": [
      {
        "type": "text",
        "text": "<your long, stable system prompt>",
        "cache_control": {"type": "ephemeral"}
      }
    ],
    "messages": [{"role":"user","content":"Refactor the parser."}]
  }'

Совпадение кэша — побайтовое по префиксу: измените один байт в начале промпта, и всё после этой точки тарифицируется заново как свежий вход. Изменчивые данные — метки времени, состояние пользователя, текущий вопрос — ставьте после кэшированной точки останова, никогда до неё.

Направляйте каждый запрос в самую дешёвую модель, которая с ним справится

Отправлять каждый запрос в Opus — самая дорогая привычка в работе с Claude API. Большинству продакшен-трафика — классификации, извлечению данных, форматированию, правкам в стиле автодополнения, разбору результатов инструментов — не нужны фронтирные рассуждения, и платить за это по тарифам Opus — чистая трата. Подберите модель под задачу, и разница в цене за токен сэкономит сама.

  1. 01Новые нагрузки по умолчанию запускайте на claude-sonnet-5 — сбалансированный уровень для повседневного кода и текстов.
  2. 02Высокообъёмную или механическую работу опускайте на claude-haiku-4-5: тегирование, суммаризация коротких текстов, конвертация схем, простые вопросы-ответы.
  3. 03Эскалируйте, а не начинайте сверху: сначала дешёвая модель, и только при провале ваших проверок — повтор на claude-opus-4-8.
  4. 04В агентных циклах планирование оставляйте сильной модели, а шаги разбора и форматирования выполняйте на Haiku.

Классическая схема — каскад: Haiku пытается выполнить запрос, дешёвая проверка решает, приемлем ли результат, и только неудачи поднимаются на Sonnet или Opus. По фронтирным ценам вы платите только за ту малую долю трафика, которой это действительно нужно.

Отправляйте меньше контекста, просите меньше вывода

Каждый файл, сообщение и определение инструмента в запросе тарифицируются заново при каждом вызове, а каждый токен ответа — по пятикратной ставке вывода. Подрезать обе стороны — неброско, но срабатывает сразу: не нужны никакие функции платформы, только дисциплина в том, что попадает в запрос.

  • Отправляйте только те файлы и историю, которые реально нужны задаче; точечный фрагмент лучше дампа всего репозитория.
  • Сворачивайте длинные треды в рабочее резюме вместо пересылки полной переписки каждый ход.
  • Убирайте определения инструментов, которые текущий шаг не может вызвать, — они тарифицируются как вход на каждом ходу.
  • Ограничивайте max_tokens тем, что действительно нужно ответу; убежавшее завершение оплачивается до последнего токена.
  • Просите diff или патч вместо полной перезаписи файла, а JSON — если ответ всё равно парсится: словесная обвязка оплачивается по ставке вывода.

Поскольку вывод стоит в пять раз дороже входа, обрезка 1 000 выходных токенов экономит столько же, сколько обрезка 5 000 входных. Если сомневаетесь — сначала сокращайте ответ, который просите, а потом контекст, который отправляете.

Читайте объект usage, прежде чем что-то настраивать

Каждый ответ Messages API заканчивается точным учётом в поле usage. Логируйте эти числа по фиче или эндпоинту до начала оптимизации — догадки о том, куда уходят токены, обычно неверны, а объект usage превращает оптимизацию в арифметику.

"usage": {
  "input_tokens": 1520,
  "output_tokens": 212,
  "cache_creation_input_tokens": 8134,
  "cache_read_input_tokens": 0
}

На тёплом кэше большая часть входа должна переехать в cache_read_input_tokens, а обычные input_tokens — схлопнуться до одного нового вопроса. Панель apiToken.sale показывает ту же разбивку по токенам для каждого запроса, так что вы видите сдвиг после каждого изменения, а не ждёте месячного счёта.

Оцените месячные расходы в бесплатном калькуляторе

Дисциплина токенов и скидка перемножаются

Биллинг на apiToken.sale работает в фиксированном порядке: каждый вызов пересчитывается в официальные расходы Anthropic по точным компонентам usage — вход, вывод, запись в кэш, чтение из кэша, — затем вычитается фиксированная скидка 50% для B2C, и итог списывается с предоплатного баланса. Кэширование и маршрутизация уменьшают официальные расходы; скидка делит остаток пополам. Эффекты перемножаются, поэтому нагрузка, сократившая число токенов вдвое, фактически стоит четверть официальной цены.

Сам баланс не сгорает никогда, а пополнение принимает любую целую сумму в долларах — никаких подписочных часов, которые заставляли бы сжигать токены, которые вы предпочли бы сэкономить. Актуальные тарифы по моделям, включая цены кэширования, — на странице моделей.

Актуальный состав моделей и цены по каждой

Частые вопросы

Какой самый эффективный способ сэкономить токены в Claude API?

Промпт-кеширование большого повторяющегося контекста — системных промптов, файлов, определений инструментов — в сочетании с маршрутизацией каждой задачи в самую дешёвую справляющуюся модель. Чтение из кэша стоит долю свежих входных токенов, а Haiku в пять раз дешевле Opus за токен.

Как узнать, сколько токенов израсходовал запрос к Claude API?

В каждом ответе есть объект usage с полями input_tokens, output_tokens, cache_creation_input_tokens и cache_read_input_tokens. Панель apiToken.sale показывает ту же разбивку по токенам для каждого запроса.

Какую модель Claude выбрать, чтобы сэкономить?

По умолчанию — claude-sonnet-5 для повседневной работы, высокообъёмные механические задачи опускайте на claude-haiku-4-5 (официально $1/$5 за 1M, со скидкой $0.50/$2.50), а claude-opus-4-8 приберегите для по-настоящему сложных рассуждений.

Снижает ли max_tokens счёт за Claude API?

Вы платите за фактически сгенерированные выходные токены, поэтому жёсткий лимит max_tokens не даёт убежавшему завершению выбрать весь лимит. Если ответ заканчивается stop_reason: max_tokens, лимит обрезал ответ — поднимайте его осознанно, а не повторяйте тот же запрос.

Складываются ли эти приёмы экономии со скидкой apiToken.sale?

Да. Кэширование и маршрутизация по моделям уменьшают число токенов, тарифицируемых по официальным ценам, а затем фиксированная скидка 50% для B2C делит остаток пополам — экономия перемножается.

Создайте аккаунт через Google или GitHub и протестируйте шлюз с бонусом $5 на балансе платформы.