Бесплатно и дёшево

Claude Haiku 4.5 через API

Claude Haiku API — то место, где должна жить высокообъёмная работа: классификация, извлечение данных, маршрутизация и любые запросы, где латентность и цена за токен важнее глубоких рассуждений. Официально Haiku 4.5 тарифицируется по $1/$5 за миллион токенов — здесь $0.50/$2.50 с единой скидкой 50% — и использует один ключ и один предоплаченный баланс вместе с Sonnet, Opus, GPT, Gemini и Kimi. В этом гайде — задачи, для которых она подходит, рабочий запрос и способ эскалировать сложную часть трафика наверх.

·

Работа, которую Haiku 4.5 создана поглощать

Claude Haiku 4.5 — самая быстрая и самая дешёвая модель семейства Claude, и обращаетесь вы к ней через стандартный Anthropic Messages API с идентификатором claude-haiku-4-5 — та же форма запроса, те же заголовки, тот же стриминг, что у Sonnet или Opus. Это правильный выбор по умолчанию для любой нагрузки, где латентность и цена за токен важнее глубоких рассуждений. Через apiToken.sale она работает на предоплаченном балансе по единой ставке на 50% ниже официальных тарифов — без подписки и без вейтлиста.

Haiku окупается на краях пайплайна, где запросы короткие, частые и взаимозаменяемые:

  • Классификация и тегирование: тикеты поддержки, модерация контента, определение интента — короткие входы, короткие выходы, тысячи вызовов в день.
  • Извлечение и парсинг: вытащить структурированные поля из счетов, писем, логов или HTML до того, как данные увидит более крупная модель.
  • Маршрутизация и триаж: решить, какая модель или инструмент должны обработать запрос, и эскалировать только сложные.
  • Чат, чувствительный к латентности: внутренние циклы агентов, связка вызовов инструментов и UX в стиле автодополнения, где пользователь смотрит на спиннер.
  • Дешёвая предобработка: суммаризация, очистка и чанкование длинного контекста перед вызовом Opus или Sonnet.

Haiku — неподходящий инструмент для глубоких многошаговых рассуждений, ответственного анализа и очень длинной генерации. Если задача стабильно не проходит вашу планку качества, это решение о маршрутизации, а не проблема промпта — отправьте её на Sonnet или Opus.

Читайте также: Доступ к Claude Sonnet API: Sonnet 5 и Sonnet 4.6

Идентификатор модели, окно контекста и потолок вывода

Актуальный идентификатор Haiku, который стоит запомнить, один: claude-haiku-4-5. Она принимает полный набор возможностей Messages API — системные промпты, многоходовые диалоги, tool use, стриминг и промпт-кеширование — в окне контекста 200K токенов с максимальным выводом 64K токенов. Оба потолка ниже, чем у линейки Opus и Sonnet, что важно, если вы пакетируете большие документы в одиночные вызовы.

ПараметрЗначение
Идентификатор моделиclaude-haiku-4-5
Окно контекста200K токенов
Максимальный вывод64K токенов
ЭндпоинтPOST /v1/messages (форма Anthropic Messages)
Заголовок авторизацииx-api-key

Messages API требует max_tokens в каждом запросе, со стримингом или без. Ставьте его равным самому длинному ответу, который вы реально ожидаете, а не потолку модели — неограниченный лимит плюс привычка к многословности — это то, как дешёвая нагрузка незаметно становится дорогой.

Ваш первый запрос к Haiku

  1. 01Создайте аккаунт и сгенерируйте ключ в панели — он выглядит как sk-pool-… и работает со всеми поддерживаемыми моделями Claude, GPT, Gemini и Kimi.
  2. 02Направьте любой Anthropic-совместимый клиент на роутер: задайте ANTHROPIC_BASE_URL в https://router.apitoken.sale и ANTHROPIC_API_KEY в ваш ключ. Официальным SDK больше ничего менять не нужно.
  3. 03Отправьте POST /v1/messages с заголовками x-api-key и anthropic-version, полем model равным claude-haiku-4-5 и явным max_tokens.
curl https://router.apitoken.sale/v1/messages \
  -H "x-api-key: sk-pool-•••" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-4-5",
    "max_tokens": 256,
    "messages": [
      {"role": "user", "content": "Classify this ticket as billing, bug or feature: \"My invoice shows the wrong total.\""}
    ]
  }'

Ответ — стандартная форма Messages: массив блоков контента плюс объект usage со счётчиками входных и выходных токенов. Именно с этого объекта usage списывается ваш баланс — тарификация по официальным ставкам Anthropic, а единая скидка 50% вычитается перед списанием.

Сколько стоит Haiku за вызов, за миллион токенов, за месяц

Официальные цены — $1 за миллион входных токенов и $5 за миллион выходных; здесь это $0.50/$2.50 после скидки. Выходные токены стоят в пять раз дороже входных, поэтому дисциплина длины ответа экономит больше, чем обрезка промпта, на разговорчивых нагрузках.

Тарифицируемое использованиеОфициально ($ за 1 млн токенов)Здесь (−50%)
Вход$1.00$0.50
Выход$5.00$2.50
Запись в кеш (5 минут)$1.25$0.625
Чтение из кеша$0.10$0.05

Посчитаем конкретно: классификационный вызов с промптом на 600 токенов и ответом на 80 токенов тарифицируется как 680 токенов и стоит около $0.0005 по ценам со скидкой. Сто тысяч таких вызовов в месяц — это порядка $50: тот объём, где цена за токен перестаёт быть абстракцией и становится строкой в бюджете.

Оцените свой объём в бесплатном калькуляторе стоимости

Держите латентность первого токена низкой со стримингом

Установите "stream": true, и эндпоинт вернёт server-sent events вместо одного блокирующего ответа: message_start, последовательность событий content_block_delta с текстом по мере генерации, затем финальный message_delta с итоговым usage и message_stop. Отрисовывайте дельты по мере поступления — и воспринимаемая латентность чат-интерфейса падает до первого токена, где скорость Haiku и раскрывается. Стриминг меняет восприятие латентности, а не цену: тарифицируются те же токены в любом режиме.

Авторитетные счётчики токенов берите из финального события message_delta, а не из самостоятельного подсчёта дельт. Если стрим оборвался посреди генерации, не повторяйте запрос в плотном цикле: отправьте один свежий запрос и сведите расход по тому usage, который вы успели получить.

Кешируйте префикс, который пересылаете в каждом вызове

Высокообъёмные циклы каждый раз пересылают один и тот же префикс: системный промпт, определения меток, few-shot примеры. Пометьте конец этого стабильного префикса точкой останова cache_control — и Anthropic держит его в короткоживущем кеше с TTL пять минут, обновляемым при каждом попадании. Запись стоит 1.25× от входной ставки; каждое последующее чтение тарифицируется по 0.1×, а скидка 50% применяется поверх.

Ставьте точку останова после последнего блока, который никогда не меняется, а изменчивый контент держите после неё. Точка останова на тексте, который меняется в каждом вызове, никогда не попадёт в кеш и лишь обойдётся вам в надбавку за запись — на ставках Haiku надбавка невелика, но на объёме это всё равно выброшенные деньги.

Цены Claude Haiku 4.5 в деталях (ставки кеша, контекст, FAQ)

Эскалируйте сложную часть на Sonnet или Opus тем же ключом

Один ключ и один баланс покрывают все поддерживаемые модели, поэтому маршрутизация — это if на стороне клиента, а не инфраструктурный проект. Отправляйте основную массу трафика на Haiku; когда вход длинный, уверенность низкая или задаче действительно нужны многошаговые рассуждения, переотправьте тот же массив messages с другим полем model — claude-sonnet-5 или идентификатором Opus. Большая часть продакшн-трафика — простой трафик, поэтому основные расходы остаются на ставках Haiku, а сложные запросы всё равно получают более сильную модель.

import anthropic

client = anthropic.Anthropic(
    base_url="https://router.apitoken.sale",
    api_key="sk-pool-•••",
)

def answer(question: str) -> str:
    triage = client.messages.create(
        model="claude-haiku-4-5",
        max_tokens=8,
        system="Reply with one word: EASY for a simple lookup or short task, HARD if it needs multi-step reasoning.",
        messages=[{"role": "user", "content": question}],
    )
    verdict = triage.content[0].text.strip().upper()
    model = "claude-sonnet-5" if verdict.startswith("HARD") else "claude-haiku-4-5"
    reply = client.messages.create(
        model=model,
        max_tokens=1024,
        messages=[{"role": "user", "content": question}],
    )
    return reply.content[0].text

Сам триаж стоит один вызов Haiku, поэтому маршрутизируйте, только когда смесь запросов действительно неравномерна. Если 95% запросов тривиальны, прямой вызов Haiku вообще без триажа дешевле, чем лишний круговой запрос на каждый запрос.

Частые вопросы

Какой идентификатор модели у Claude Haiku 4.5 в API?

claude-haiku-4-5. Передавайте его в поле model стандартного запроса Messages API с заголовками x-api-key и anthropic-version — та же форма запроса, что у Sonnet или Opus.

Сколько стоит Claude Haiku API за миллион токенов?

Официально $1 за 1 млн входных и $5 за 1 млн выходных токенов. На apiToken.sale каждый запрос тарифицируется по официальным ставкам минус единая скидка 50%, поэтому вы платите $0.50/$2.50, а чтение из кеша тарифицируется по одной десятой входной ставки.

Достаточно ли Haiku 4.5 для кодинга, или нужен Sonnet?

Haiku подходит для высокообъёмной работы низкой сложности — классификации, извлечения, маршрутизации, связки агентов. Для повседневного кодинга и агентных сценариев рекомендуемый выбор по умолчанию — Sonnet; на одном общем ключе вы можете направлять каждый запрос на самый дешёвый уровень, который с ним справляется.

Какие лимиты контекста и вывода у Haiku 4.5?

Окно контекста 200K токенов и максимальный вывод 64K токенов — потолки ниже, чем у линейки Opus и Sonnet. Каждый запрос также обязан задавать явное значение max_tokens.

Можно ли вызывать Haiku API из Cursor, Claude Code или Anthropic SDK?

Да. Подойдёт любой Anthropic-совместимый клиент: задайте base URL на роутер apiToken.sale, авторизуйтесь заголовком x-api-key и оставьте остальную конфигурацию без изменений.

Как попробовать Claude Haiku API бесплатно?

Зарегистрируйтесь через Google или GitHub — аккаунт стартует с $5 бонусного кредита платформы, который действует на Haiku и все остальные поддерживаемые модели Claude, GPT, Gemini и Kimi. Аккаунты по email и паролю бонус не получают.

Войдите через Google или GitHub и получите приветственный бонус $5 на баланс платформы — без карты.