---
title: Как экономить токены в Claude API
description: "Экономия токенов в Claude API: промпт-кеширование, выбор модели под задачу и компактный контекст — приёмы, которые складываются со скидкой 50%."
url: https://apitoken.sale/ru/docs/learn/save-tokens-on-claude-api
language: ru
---

# Как экономить токены в Claude API

Экономия токенов в Claude API держится на трёх рычагах: отправлять меньше входных токенов, генерировать меньше выходных и платить меньше за токен через выбор модели и промпт-кеширование. Каждый рычаг — конкретное изменение в запросах, которые вы уже отправляете, и все они складываются со скидкой apiToken.sale, которая делит пополам ценовую половину уравнения.

## Куда на самом деле уходят токены Claude API

Ваш счёт за Claude API — это входные токены плюс выходные, и каждая модель тарифицируется отдельно. Два факта из прайса подсказывают, где оптимизировать: выходные токены стоят в пять раз дороже входных во всех актуальных моделях Claude, а многоходовый диалог при каждом вызове заново отправляет всю историю как свежий вход. Поэтому больше всего экономят три вещи: генерировать меньше вывода, пересылать меньше контекста и перекладывать работу на более дешёвые классы токенов — чтение из кэша и маленькие модели.

| Модель | Официально вход / выход ($ за 1M) | Здесь (−50%) |
| --- | --- | --- |
| Claude Opus 4.8 | $5 / $25 | $2.50 / $12.50 |
| Claude Sonnet 5 | $2 / $10 | $1 / $5 |
| Claude Haiku 4.5 | $1 / $5 | $0.50 / $2.50 |

Читайте эту таблицу как таблицу маршрутизации, а не просто как прайс. Haiku в пять раз дешевле Opus за токен и на входе, и на выходе, а фиксированная скидка 50% для B2C делит каждую строку пополам, не меняя расклада — выбор модели экономит здесь ту же долю, что и против официальных цен.

## Кэшируйте контекст, который отправляете в каждом запросе

Промпт-кеширование — самый мощный способ сэкономить токены для всего со стабильным повторяющимся префиксом: длинные системные промпты, определения инструментов, большие справочные файлы. Вы помечаете конец стабильного блока точкой останова cache_control; первый вызов записывает кэш (тарифицируется отдельно), а последующие читают его за долю цены свежего входа. Запись в кэше живёт около пяти минут, и каждое чтение продлевает её, поэтому активная сессия держит кэш тёплым сколько угодно долго.

```
curl https://router.apitoken.sale/v1/messages \
  -H "x-api-key: sk-pool-•••" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5",
    "max_tokens": 1024,
    "system": [
      {
        "type": "text",
        "text": "<your long, stable system prompt>",
        "cache_control": {"type": "ephemeral"}
      }
    ],
    "messages": [{"role":"user","content":"Refactor the parser."}]
  }'
```

> Совпадение кэша — побайтовое по префиксу: измените один байт в начале промпта, и всё после этой точки тарифицируется заново как свежий вход. Изменчивые данные — метки времени, состояние пользователя, текущий вопрос — ставьте после кэшированной точки останова, никогда до неё.

## Направляйте каждый запрос в самую дешёвую модель, которая с ним справится

Отправлять каждый запрос в Opus — самая дорогая привычка в работе с Claude API. Большинству продакшен-трафика — классификации, извлечению данных, форматированию, правкам в стиле автодополнения, разбору результатов инструментов — не нужны фронтирные рассуждения, и платить за это по тарифам Opus — чистая трата. Подберите модель под задачу, и разница в цене за токен сэкономит сама.

1. Новые нагрузки по умолчанию запускайте на claude-sonnet-5 — сбалансированный уровень для повседневного кода и текстов.
2. Высокообъёмную или механическую работу опускайте на claude-haiku-4-5: тегирование, суммаризация коротких текстов, конвертация схем, простые вопросы-ответы.
3. Эскалируйте, а не начинайте сверху: сначала дешёвая модель, и только при провале ваших проверок — повтор на claude-opus-4-8.
4. В агентных циклах планирование оставляйте сильной модели, а шаги разбора и форматирования выполняйте на Haiku.

Классическая схема — каскад: Haiku пытается выполнить запрос, дешёвая проверка решает, приемлем ли результат, и только неудачи поднимаются на Sonnet или Opus. По фронтирным ценам вы платите только за ту малую долю трафика, которой это действительно нужно.

## Отправляйте меньше контекста, просите меньше вывода

Каждый файл, сообщение и определение инструмента в запросе тарифицируются заново при каждом вызове, а каждый токен ответа — по пятикратной ставке вывода. Подрезать обе стороны — неброско, но срабатывает сразу: не нужны никакие функции платформы, только дисциплина в том, что попадает в запрос.

- Отправляйте только те файлы и историю, которые реально нужны задаче; точечный фрагмент лучше дампа всего репозитория.
- Сворачивайте длинные треды в рабочее резюме вместо пересылки полной переписки каждый ход.
- Убирайте определения инструментов, которые текущий шаг не может вызвать, — они тарифицируются как вход на каждом ходу.
- Ограничивайте max_tokens тем, что действительно нужно ответу; убежавшее завершение оплачивается до последнего токена.
- Просите diff или патч вместо полной перезаписи файла, а JSON — если ответ всё равно парсится: словесная обвязка оплачивается по ставке вывода.

Поскольку вывод стоит в пять раз дороже входа, обрезка 1 000 выходных токенов экономит столько же, сколько обрезка 5 000 входных. Если сомневаетесь — сначала сокращайте ответ, который просите, а потом контекст, который отправляете.

## Читайте объект usage, прежде чем что-то настраивать

Каждый ответ Messages API заканчивается точным учётом в поле usage. Логируйте эти числа по фиче или эндпоинту до начала оптимизации — догадки о том, куда уходят токены, обычно неверны, а объект usage превращает оптимизацию в арифметику.

```
"usage": {
  "input_tokens": 1520,
  "output_tokens": 212,
  "cache_creation_input_tokens": 8134,
  "cache_read_input_tokens": 0
}
```

На тёплом кэше большая часть входа должна переехать в cache_read_input_tokens, а обычные input_tokens — схлопнуться до одного нового вопроса. Панель apiToken.sale показывает ту же разбивку по токенам для каждого запроса, так что вы видите сдвиг после каждого изменения, а не ждёте месячного счёта.

[Оцените месячные расходы в бесплатном калькуляторе](/tools/claude-api-cost-calculator)

## Дисциплина токенов и скидка перемножаются

Биллинг на apiToken.sale работает в фиксированном порядке: каждый вызов пересчитывается в официальные расходы Anthropic по точным компонентам usage — вход, вывод, запись в кэш, чтение из кэша, — затем вычитается фиксированная скидка 50% для B2C, и итог списывается с предоплатного баланса. Кэширование и маршрутизация уменьшают официальные расходы; скидка делит остаток пополам. Эффекты перемножаются, поэтому нагрузка, сократившая число токенов вдвое, фактически стоит четверть официальной цены.

Сам баланс не сгорает никогда, а пополнение принимает любую целую сумму в долларах — никаких подписочных часов, которые заставляли бы сжигать токены, которые вы предпочли бы сэкономить. Актуальные тарифы по моделям, включая цены кэширования, — на странице моделей.

[Актуальный состав моделей и цены по каждой](/models)

## Частые вопросы

### Какой самый эффективный способ сэкономить токены в Claude API?

Промпт-кеширование большого повторяющегося контекста — системных промптов, файлов, определений инструментов — в сочетании с маршрутизацией каждой задачи в самую дешёвую справляющуюся модель. Чтение из кэша стоит долю свежих входных токенов, а Haiku в пять раз дешевле Opus за токен.

### Как узнать, сколько токенов израсходовал запрос к Claude API?

В каждом ответе есть объект usage с полями input_tokens, output_tokens, cache_creation_input_tokens и cache_read_input_tokens. Панель apiToken.sale показывает ту же разбивку по токенам для каждого запроса.

### Какую модель Claude выбрать, чтобы сэкономить?

По умолчанию — claude-sonnet-5 для повседневной работы, высокообъёмные механические задачи опускайте на claude-haiku-4-5 (официально $1/$5 за 1M, со скидкой $0.50/$2.50), а claude-opus-4-8 приберегите для по-настоящему сложных рассуждений.

### Снижает ли max_tokens счёт за Claude API?

Вы платите за фактически сгенерированные выходные токены, поэтому жёсткий лимит max_tokens не даёт убежавшему завершению выбрать весь лимит. Если ответ заканчивается stop_reason: max_tokens, лимит обрезал ответ — поднимайте его осознанно, а не повторяйте тот же запрос.

### Складываются ли эти приёмы экономии со скидкой apiToken.sale?

Да. Кэширование и маршрутизация по моделям уменьшают число токенов, тарифицируемых по официальным ценам, а затем фиксированная скидка 50% для B2C делит остаток пополам — экономия перемножается.

---
Get a key: https://apitoken.sale/register
More guides: https://apitoken.sale/ru/docs/learn
