Claude Haiku 4.5 через API
Claude Haiku API — то место, где должна жить высокообъёмная работа: классификация, извлечение данных, маршрутизация и любые запросы, где латентность и цена за токен важнее глубоких рассуждений. Официально Haiku 4.5 тарифицируется по $1/$5 за миллион токенов — здесь $0.50/$2.50 с единой скидкой 50% — и использует один ключ и один предоплаченный баланс вместе с Sonnet, Opus, GPT, Gemini и Kimi. В этом гайде — задачи, для которых она подходит, рабочий запрос и способ эскалировать сложную часть трафика наверх.
·
Работа, которую Haiku 4.5 создана поглощать
Claude Haiku 4.5 — самая быстрая и самая дешёвая модель семейства Claude, и обращаетесь вы к ней через стандартный Anthropic Messages API с идентификатором claude-haiku-4-5 — та же форма запроса, те же заголовки, тот же стриминг, что у Sonnet или Opus. Это правильный выбор по умолчанию для любой нагрузки, где латентность и цена за токен важнее глубоких рассуждений. Через apiToken.sale она работает на предоплаченном балансе по единой ставке на 50% ниже официальных тарифов — без подписки и без вейтлиста.
Haiku окупается на краях пайплайна, где запросы короткие, частые и взаимозаменяемые:
- Классификация и тегирование: тикеты поддержки, модерация контента, определение интента — короткие входы, короткие выходы, тысячи вызовов в день.
- Извлечение и парсинг: вытащить структурированные поля из счетов, писем, логов или HTML до того, как данные увидит более крупная модель.
- Маршрутизация и триаж: решить, какая модель или инструмент должны обработать запрос, и эскалировать только сложные.
- Чат, чувствительный к латентности: внутренние циклы агентов, связка вызовов инструментов и UX в стиле автодополнения, где пользователь смотрит на спиннер.
- Дешёвая предобработка: суммаризация, очистка и чанкование длинного контекста перед вызовом Opus или Sonnet.
Haiku — неподходящий инструмент для глубоких многошаговых рассуждений, ответственного анализа и очень длинной генерации. Если задача стабильно не проходит вашу планку качества, это решение о маршрутизации, а не проблема промпта — отправьте её на Sonnet или Opus.
Читайте также: Доступ к Claude Sonnet API: Sonnet 5 и Sonnet 4.6
Идентификатор модели, окно контекста и потолок вывода
Актуальный идентификатор Haiku, который стоит запомнить, один: claude-haiku-4-5. Она принимает полный набор возможностей Messages API — системные промпты, многоходовые диалоги, tool use, стриминг и промпт-кеширование — в окне контекста 200K токенов с максимальным выводом 64K токенов. Оба потолка ниже, чем у линейки Opus и Sonnet, что важно, если вы пакетируете большие документы в одиночные вызовы.
| Параметр | Значение |
|---|---|
| Идентификатор модели | claude-haiku-4-5 |
| Окно контекста | 200K токенов |
| Максимальный вывод | 64K токенов |
| Эндпоинт | POST /v1/messages (форма Anthropic Messages) |
| Заголовок авторизации | x-api-key |
Messages API требует max_tokens в каждом запросе, со стримингом или без. Ставьте его равным самому длинному ответу, который вы реально ожидаете, а не потолку модели — неограниченный лимит плюс привычка к многословности — это то, как дешёвая нагрузка незаметно становится дорогой.
Ваш первый запрос к Haiku
- 01Создайте аккаунт и сгенерируйте ключ в панели — он выглядит как sk-pool-… и работает со всеми поддерживаемыми моделями Claude, GPT, Gemini и Kimi.
- 02Направьте любой Anthropic-совместимый клиент на роутер: задайте ANTHROPIC_BASE_URL в https://router.apitoken.sale и ANTHROPIC_API_KEY в ваш ключ. Официальным SDK больше ничего менять не нужно.
- 03Отправьте POST /v1/messages с заголовками x-api-key и anthropic-version, полем model равным claude-haiku-4-5 и явным max_tokens.
curl https://router.apitoken.sale/v1/messages \
-H "x-api-key: sk-pool-•••" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-4-5",
"max_tokens": 256,
"messages": [
{"role": "user", "content": "Classify this ticket as billing, bug or feature: \"My invoice shows the wrong total.\""}
]
}'Ответ — стандартная форма Messages: массив блоков контента плюс объект usage со счётчиками входных и выходных токенов. Именно с этого объекта usage списывается ваш баланс — тарификация по официальным ставкам Anthropic, а единая скидка 50% вычитается перед списанием.
Сколько стоит Haiku за вызов, за миллион токенов, за месяц
Официальные цены — $1 за миллион входных токенов и $5 за миллион выходных; здесь это $0.50/$2.50 после скидки. Выходные токены стоят в пять раз дороже входных, поэтому дисциплина длины ответа экономит больше, чем обрезка промпта, на разговорчивых нагрузках.
| Тарифицируемое использование | Официально ($ за 1 млн токенов) | Здесь (−50%) |
|---|---|---|
| Вход | $1.00 | $0.50 |
| Выход | $5.00 | $2.50 |
| Запись в кеш (5 минут) | $1.25 | $0.625 |
| Чтение из кеша | $0.10 | $0.05 |
Посчитаем конкретно: классификационный вызов с промптом на 600 токенов и ответом на 80 токенов тарифицируется как 680 токенов и стоит около $0.0005 по ценам со скидкой. Сто тысяч таких вызовов в месяц — это порядка $50: тот объём, где цена за токен перестаёт быть абстракцией и становится строкой в бюджете.
Держите латентность первого токена низкой со стримингом
Установите "stream": true, и эндпоинт вернёт server-sent events вместо одного блокирующего ответа: message_start, последовательность событий content_block_delta с текстом по мере генерации, затем финальный message_delta с итоговым usage и message_stop. Отрисовывайте дельты по мере поступления — и воспринимаемая латентность чат-интерфейса падает до первого токена, где скорость Haiku и раскрывается. Стриминг меняет восприятие латентности, а не цену: тарифицируются те же токены в любом режиме.
Авторитетные счётчики токенов берите из финального события message_delta, а не из самостоятельного подсчёта дельт. Если стрим оборвался посреди генерации, не повторяйте запрос в плотном цикле: отправьте один свежий запрос и сведите расход по тому usage, который вы успели получить.
Кешируйте префикс, который пересылаете в каждом вызове
Высокообъёмные циклы каждый раз пересылают один и тот же префикс: системный промпт, определения меток, few-shot примеры. Пометьте конец этого стабильного префикса точкой останова cache_control — и Anthropic держит его в короткоживущем кеше с TTL пять минут, обновляемым при каждом попадании. Запись стоит 1.25× от входной ставки; каждое последующее чтение тарифицируется по 0.1×, а скидка 50% применяется поверх.
Ставьте точку останова после последнего блока, который никогда не меняется, а изменчивый контент держите после неё. Точка останова на тексте, который меняется в каждом вызове, никогда не попадёт в кеш и лишь обойдётся вам в надбавку за запись — на ставках Haiku надбавка невелика, но на объёме это всё равно выброшенные деньги.
Цены Claude Haiku 4.5 в деталях (ставки кеша, контекст, FAQ) →
Эскалируйте сложную часть на Sonnet или Opus тем же ключом
Один ключ и один баланс покрывают все поддерживаемые модели, поэтому маршрутизация — это if на стороне клиента, а не инфраструктурный проект. Отправляйте основную массу трафика на Haiku; когда вход длинный, уверенность низкая или задаче действительно нужны многошаговые рассуждения, переотправьте тот же массив messages с другим полем model — claude-sonnet-5 или идентификатором Opus. Большая часть продакшн-трафика — простой трафик, поэтому основные расходы остаются на ставках Haiku, а сложные запросы всё равно получают более сильную модель.
import anthropic
client = anthropic.Anthropic(
base_url="https://router.apitoken.sale",
api_key="sk-pool-•••",
)
def answer(question: str) -> str:
triage = client.messages.create(
model="claude-haiku-4-5",
max_tokens=8,
system="Reply with one word: EASY for a simple lookup or short task, HARD if it needs multi-step reasoning.",
messages=[{"role": "user", "content": question}],
)
verdict = triage.content[0].text.strip().upper()
model = "claude-sonnet-5" if verdict.startswith("HARD") else "claude-haiku-4-5"
reply = client.messages.create(
model=model,
max_tokens=1024,
messages=[{"role": "user", "content": question}],
)
return reply.content[0].textСам триаж стоит один вызов Haiku, поэтому маршрутизируйте, только когда смесь запросов действительно неравномерна. Если 95% запросов тривиальны, прямой вызов Haiku вообще без триажа дешевле, чем лишний круговой запрос на каждый запрос.
Частые вопросы
Какой идентификатор модели у Claude Haiku 4.5 в API?
claude-haiku-4-5. Передавайте его в поле model стандартного запроса Messages API с заголовками x-api-key и anthropic-version — та же форма запроса, что у Sonnet или Opus.
Сколько стоит Claude Haiku API за миллион токенов?
Официально $1 за 1 млн входных и $5 за 1 млн выходных токенов. На apiToken.sale каждый запрос тарифицируется по официальным ставкам минус единая скидка 50%, поэтому вы платите $0.50/$2.50, а чтение из кеша тарифицируется по одной десятой входной ставки.
Достаточно ли Haiku 4.5 для кодинга, или нужен Sonnet?
Haiku подходит для высокообъёмной работы низкой сложности — классификации, извлечения, маршрутизации, связки агентов. Для повседневного кодинга и агентных сценариев рекомендуемый выбор по умолчанию — Sonnet; на одном общем ключе вы можете направлять каждый запрос на самый дешёвый уровень, который с ним справляется.
Какие лимиты контекста и вывода у Haiku 4.5?
Окно контекста 200K токенов и максимальный вывод 64K токенов — потолки ниже, чем у линейки Opus и Sonnet. Каждый запрос также обязан задавать явное значение max_tokens.
Можно ли вызывать Haiku API из Cursor, Claude Code или Anthropic SDK?
Да. Подойдёт любой Anthropic-совместимый клиент: задайте base URL на роутер apiToken.sale, авторизуйтесь заголовком x-api-key и оставьте остальную конфигурацию без изменений.
Как попробовать Claude Haiku API бесплатно?
Зарегистрируйтесь через Google или GitHub — аккаунт стартует с $5 бонусного кредита платформы, который действует на Haiku и все остальные поддерживаемые модели Claude, GPT, Gemini и Kimi. Аккаунты по email и паролю бонус не получают.
Войдите через Google или GitHub и получите приветственный бонус $5 на баланс платформы — без карты.