Claude API для ИИ-агентов: как строить агентов на Claude
Claude API — крепкий фундамент для агентов: tool use и стриминг здесь первоклассные, а линейка моделей чисто ложится на шаги агентного цикла. Подвох — в экономике: цикл делает десятки вызовов на задачу, поэтому маршрутизация по моделям, кеширование и жёсткий лимит трат решают, жизнеспособен ли прогон. Разбираем все три вещи на Claude API для агентов через apiToken.sale.
·
Почему агентные циклы сжигают токены быстрее чата
Да, Claude API хорошо подходит для ИИ-агентов: tool use, стриминг и промпт-кеширование — стандартные части Anthropic Messages API, и всё это доступно через один ключ apiToken.sale. Отличие от чат-бота — в объёме. Пользователь чата отправляет одно сообщение и читает один ответ. Агент планирует, вызывает инструмент, читает результат, перепланирует и повторяет — легко десятки вызовов модели на одну видимую пользователю задачу, и каждый вызов несёт с собой весь накопленный диалог.
Такой профиль меняет приоритеты. Задержка одного вызова менее важна, чем стоимость завершённой задачи. Повторяющийся контекст — системный промпт, определения инструментов, накапливающиеся результаты инструментов — доминирует в счёте токенов, а не финальный ответ. Сделайте три вещи правильно, и экономика агента сойдётся: направляйте каждый шаг на самую дешёвую модель, которая с ним справится, кешируйте всё повторяющееся и ограничьте сумму, которую может потратить разогнавшийся цикл.
Читайте также: Стриминг Claude API: SSE-ответы токен за токеном
Направляйте каждый шаг цикла на подходящую модель
Самая дорогая ошибка в дизайне агента — гонять весь цикл на одной модели. Шагу планирования нужно сильное рассуждение; шагу, который достаёт URL из результата инструмента, — нет. Линейка Anthropic ложится на это напрямую: Haiku для дешёвых механических шагов, Sonnet для ядра рассуждений, Opus для редких вызовов, где первые две не справились. На apiToken.sale все три сидят на одном ключе и балансе, поэтому смена уровня — это одна строка в запросе: без лишних аккаунтов и отдельных платёжных связок.
| Шаг цикла | Модель | Почему |
|---|---|---|
| Планирование, декомпозиция, самокритика | claude-sonnet-5 | Лучший баланс качества рассуждений и цены; рабочая лошадка по умолчанию |
| Парсинг, классификация, извлечение, маршрутизация | claude-haiku-4-5 | Самый дешёвый уровень; таких шагов много, а сложность низкая |
| Самые тяжёлые вызовы после неудачи Sonnet | claude-opus-4-8 | Только эскалация — держите его для шагов, которым он действительно нужен |
Практичный паттерн эскалации: выполняйте шаг на Sonnet, и только если вывод не проходит валидацию (битый JSON, отклонённый план, упавший тест) — повторяйте этот один шаг на Opus. Большинство циклов никогда не эскалирует, и вы платите по тарифам Opus только там, где это что-то даёт.
Минимальный агентный вызов: tool use по SSE
Шаг агента — это обычный запрос Messages API с двумя добавками: массивом tools, описывающим, что модель может вызывать, и stream: true, чтобы реагировать на частичный вывод. Модель отвечает блоком tool_use со stop_reason "tool_use"; ваш код выполняет инструмент, добавляет сообщение tool_result и снова вызывает API. Этот круговой обход — и есть весь агентный цикл, всё остальное — оркестрация.
curl https://router.apitoken.sale/v1/messages \
-H "x-api-key: sk-pool-•••" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"stream": true,
"system": "You are a research agent. Use tools, then answer.",
"tools": [{
"name": "web_search",
"description": "Search the web",
"input_schema": {"type":"object","properties":{"query":{"type":"string"}},"required":["query"]}
}],
"messages": [{"role":"user","content":"Find the latest Anthropic model"}]
}'Эндпоинт — нативный Anthropic Messages API, поэтому официальные SDK Anthropic и любой агентный фреймворк, говорящий на этом протоколе, работают без изменений — достаточно другого base URL и ключа. Стриминг приходит стандартными server-sent events, а запросы со стримингом тарифицируются ровно как обычные: по входным и выходным токенам.
Кешируйте статичные части каждого запроса
В цикле на двадцать шагов системный промпт и определения инструментов отправляются двадцать раз. Промпт-кеширование превращает этот повторяющийся контекст из постоянной статьи расходов в почти бесплатную: пометьте стабильный префикс брейкпоинтом cache_control, и чтения из кеша на следующих вызовах будут стоить долю от свежих входных токенов. Запись кеша живёт фиксированное короткое окно (пять минут по умолчанию) и продлевается при каждом попадании — ровно паттерн доступа активного агента.
Порядок важен. Самое стабильное — в начало: сначала системный промпт, затем определения инструментов, затем самая старая история диалога. И никогда не вставляйте изменчивые данные (таймстемпы, ID запросов) перед брейкпоинтом, иначе каждый вызов станет записью в кеш вместо чтения из него.
Кеширование складывается с фиксированной скидкой 50%, которую apiToken.sale применяет к официальным ценам за токены: кеширование уменьшает число токенов, скидка — цену за токен.
Оцените реальную стоимость цикла до того, как он уйдёт в автономный прогон →
Ограничьте урон от разогнавшегося цикла
Каждый агент рано или поздно попадает в цикл, который не может сойтись, — инструмент продолжает возвращать ошибки, а модель продолжает повторять попытки. Клиентские ограничители (счётчик итераций, бюджет токенов на задачу, таймаут по времени) — ваша первая линия обороны, но они живут в вашем процессе и умирают вместе с багами в нём. Вторая линия должна быть на самом ключе.
- 01Создайте отдельный именованный ключ на каждого агента в дашборде apiToken.sale — никогда не делите один ключ между агентами или с людьми.
- 02Направьте агента на https://router.apitoken.sale с этим ключом в заголовке x-api-key — в точности как обычный клиент Messages API.
- 03Задайте пожизненный лимит расходов на ключ: как только суммарные траты по ключу достигнут потолка, дальнейшие запросы будут отклоняться, и сломанный цикл не потратит больше лимита.
- 04Поставьте срок действия, если агент временный — демо, CI-джоба, прототип подрядчика, — чтобы доступ закрылся автоматически.
- 05Следите в дашборде за расходом токенов по каждому ключу: шаг, внезапно занявший большую часть счёта, — обычно баг маршрутизации или кеширования, а не проблема цен.
Смешивайте провайдеров внутри одного агента
Не все шаги агента обязаны быть Claude. Тот же ключ apiToken.sale обслуживает и поддерживаемые модели GPT, Gemini и Kimi, так что цикл может черновить на Claude, гонять дешёвый шаг классификации на более лёгкой модели из другого семейства или сравнивать ответы разных провайдеров на шаге верификации. Нативные вызовы Anthropic сохраняют форму Messages, показанную выше; модели GPT идут через OpenAI-совместимую линию с заголовком Authorization: Bearer.
curl https://router.apitoken.sale/v1/chat/completions \
-H "Authorization: Bearer sk-pool-•••" \
-H "content-type: application/json" \
-d '{
"model": "gpt-5.5",
"messages": [{"role":"user","content":"Classify: is this tool result an error?"}]
}'Всё это ложится на один предоплатный баланс с той же скидкой за токены — именно это делает гетерогенные циклы практичными: ни аккаунтов у каждого провайдера, ни отдельных бюджетов, которые нужно сводить.
Как выглядит хорошо настроенный агент в счёте
- Большинство вызовов — Haiku или Sonnet; Opus появляется только при настоящих эскалациях.
- Чтения из кеша доминируют во входных токенах каждого вызова после первого.
- Стриминг включён, поэтому оркестратор может прерваться раньше, если вызов инструмента пришёл битым.
- У каждого ключа есть пожизненный лимит расходов и имя, по которому видно, какой агент им владеет.
- Предоплатный баланс не сгорает, поэтому тихий месяц не стоит ничего.
Механика стриминга в деталях: события SSE, ранние прерывания, паритет тарификации →
Частые вопросы
Подходит ли Claude API для создания ИИ-агентов?
Да. Tool use и стриминг — первоклассные части Anthropic Messages API, а уровни Haiku/Sonnet/Opus чисто ложатся на шаги агентного цикла — и всё это доступно через один ключ apiToken.sale.
Какую модель Claude агенту использовать по умолчанию?
claude-sonnet-5 — для планирования и рассуждений, claude-haiku-4-5 — для массовых механических шагов вроде парсинга и классификации, а claude-opus-4-8 — только как эскалацию для вызовов, где Sonnet не прошёл валидацию.
Как не дать агентному циклу перерасходовать бюджет?
Совместите клиентские ограничители (капы итераций и токенов) с пожизненным лимитом расходов на ключе агента в apiToken.sale — он жёстко остановит траты на потолке; для временных агентов добавьте срок действия.
Работает ли tool use через apiToken.sale?
Да — это нативный Anthropic Messages API на router.apitoken.sale, поэтому стандартный обход tool_use/tool_result и официальные SDK работают с другим base URL и ключом без каких-либо изменений.
Стоит ли агентам стримить ответы?
Обычно да: стриминг позволяет оркестратору реагировать на частичный вывод и прерываться раньше, а запросы со стримингом тарифицируются так же, как без него, — по входным и выходным токенам.
Может ли один агент смешивать Claude с моделями GPT, Gemini или Kimi?
Да — один ключ и один предоплатный баланс покрывают все четыре семейства. Claude использует эндпоинт Anthropic Messages; GPT идёт через OpenAI-совместимую линию с заголовком Authorization: Bearer.
Проверьте до оплаты: новые аккаунты через Google/GitHub получают бонус $5 на баланс платформы.