Услуги Портфолио Контакты БлогНовости +7 (800) 511‑32‑27 Обсудить проект
ИИ / LLM

Anthropic выпустила Claude Haiku 5.5: малая модель подешевела до $0,10 за миллион токенов

9 октября 2026·4 мин чтения
Claude Haiku 5.5Стоимость LLM
Светящийся процессор на плате с потоками данных и снижающимися столбцами графика — удешевление малой модели Claude Haiku 5.5

7 октября 2026 года Anthropic выпустила Claude Haiku 5.5, младшую модель семейства 5.5. Для запросов короче 100 тысяч токенов она стоит $0,10 за миллион входных и $0,50 за миллион выходных токенов: прайс-лист на 90% ниже, чем у Haiku 4.5, а реальные нагрузки, по оценке вендора, обходятся примерно на 75% дешевле. Командам с крупными LLM-пайплайнами есть смысл пересчитать бюджет и маршрутизацию моделей.

Модель доступна под идентификатором claude-haiku-5-5 на Claude Platform, в AWS, Google Cloud и Microsoft Azure. Haiku 5.5 закрывает обновление линейки: Opus 5.5 вышла 22 сентября, Sonnet 5.5 — 28 сентября (о ней мы писали в новости про ускорение и удешевление агентов на Sonnet 5.5). Тем, кто строит ИИ-функции в продуктах, теперь доступны три уровня одного поколения с разной ценой.

Ниже разбираем новую цену, порог 100 тысяч токенов, приросты на бенчмарках и то, как спокойно перевести часть трафика на малую модель. Прикинуть экономию на своих объёмах поможет калькулятор стоимости LLM и ROI внедрения ИИ.

Сколько стоит Claude Haiku 5.5

Впервые для малой модели Anthropic цена зависит от длины промпта:

  • промпт до 100 тысяч токенов: $0,10 за миллион входных и $0,50 за миллион выходных токенов (у Haiku 4.5 было $1 и $5);
  • промпт длиннее 100 тысяч токенов: $0,50 и $2,50 — это всё равно вдвое ниже прежней цены;
  • кэш промптов в нижнем тарифе: чтение $0,01, запись $0,125 за миллион токенов; в верхнем — $0,05 и $0,625;
  • вместе с релизом Anthropic вдвое снизила стоимость чтения кэша у Sonnet 5.5 — с $0,20 до $0,10 за миллион токенов.

Базовая ставка совпала с тарифом самой дешёвой модели OpenAI, GPT-6 Luna. Различаются пороги: у Luna повышенная цена за длинный контекст начинается с 272 тысяч токенов. По данным VentureBeat, в нижний тариф попадает около 90% запросов к модели.

Насколько Haiku 5.5 сильнее предыдущей версии

По опубликованным Anthropic результатам главный прирост пришёлся на агентные сценарии. В OSWorld 2.1 (работа с компьютером) у Haiku 5.5 72,4% при высоком уровне effort против 15,7% у Haiku 4.5. В Terminal-Bench 4.0 модель решает 39,2% задач, а предшественница не решила ни одной. Кроме того, у младшей модели впервые появилась настройка effort с уровнями от Low до Max: глубину рассуждений можно задавать для каждого запроса и выбирать между скоростью и точностью.

Помните, что это цифры вендора и часть из них снята на максимальных уровнях effort. Пропускную способность в токенах в секунду Anthropic не раскрыла. Перед переключением прогоните модель на собственном наборе эталонных ответов.

Почему малые модели дешевеют именно сейчас

Цена малых моделей стала отдельным фронтом конкуренции. Корпоративные заказчики хотят снизить счета за инференс и всё чаще пробуют открытые модели американских и китайских лабораторий. Сравнявшись по цене с GPT-6 Luna, Anthropic лишает клиентов самого простого повода уйти к другому вендору из-за стоимости. Три релиза за 15 дней, каждый дешевле предыдущего, показывают, что компания борется за массовые нагрузки, а не только за премиальные сложные задачи.

Что меняется для команд разработки

Маршрутизацию моделей стоит пересмотреть. Многие системы отправляют весь трафик в среднюю модель, потому что малая ошибалась на пограничных случаях. Схема «простое — в Haiku, сложное — в Sonnet или Opus» с явной эскалацией может заметно снизить расходы без видимой потери качества. Но экономия будет реальной только при подсчёте доли эскалаций и ошибок по каждому типу задач.

Окупаются новые сценарии. При $0,10 за миллион входных токенов разметку каждого тикета поддержки, резюме каждого звонка или проверку каждого загруженного документа можно включать по умолчанию. Заметно дешевеют и мультиагентные схемы, где оркестратор рассылает десятки мелких вызовов. Именно на этом строится внедрение ИИ-агентов в бизнесе.

Порог 100 тысяч токенов теперь стоит учитывать в архитектуре. Токен в длинном промпте стоит впятеро дороже. Чтобы большинство вызовов оставалось в дешёвом тарифе, передавайте в RAG только релевантные фрагменты и кэшируйте стабильный контекст: системный промпт и описания инструментов. Загружать в контекст репозиторий или пакет договоров целиком теперь ощутимо дороже.

Как перевести нагрузку на Haiku 5.5 без риска

1. Соберите неделю реальных запросов по каждому типу задач и прогоните их через Haiku 5.5 на двух уровнях effort, сравнивая результат с эталонными ответами.

2. Посчитайте долю вызовов длиннее 100 тысяч токенов: начните оптимизацию с них, через ретривер или кэширование.

3. Не переключайтесь жёстко: добавьте эскалацию в Sonnet или Opus по уровню уверенности и логируйте каждый такой случай.

4. Проверьте вызов инструментов и структурированный вывод на своих JSON-схемах: прирост на бенчмарках не гарантирует, что поведение будет прежним.

5. Зафиксируйте версию модели в конфигурации и выкатывайте её за фичефлагом, отслеживая стоимость и качество на дашборде.

Часто задаваемые вопросы

Сколько стоит Claude Haiku 5.5? При промптах до 100 тысяч токенов — $0,10 за миллион входных и $0,50 за миллион выходных токенов, при более длинных — $0,50 и $2,50. Чтение кэша в нижнем тарифе — $0,01 за миллион токенов.

Где доступна модель? С 7 октября 2026 года на Claude Platform под идентификатором claude-haiku-5-5, а также в AWS, Google Cloud и Microsoft Azure. Наличие модели в нужном регионе облака стоит проверить отдельно.

Можно ли полностью заменить Sonnet на Haiku 5.5? Не стоит. Надёжнее маршрутизатор, который отправляет в Haiku простые массовые вызовы (классификацию, извлечение данных, резюме), а сложные запросы передаёт в Sonnet или Opus. Качество и стоимость при этом отслеживаются по каждому типу задач.

Чем Haiku 5.5 отличается от Haiku 4.5, кроме цены? У модели есть настройка effort и гораздо более высокие результаты в агентных бенчмарках: 72,4% против 15,7% в OSWorld 2.1 и 39,2% против нуля в Terminal-Bench 4.0, по данным Anthropic.

Источники

Anthropic — Claude Haiku 5.5, 7 октября 2026 года (первоисточник).

VentureBeat — Anthropic launches Claude Haiku 5.5 with 90% API price reduction, matching GPT-6 Luna, 7 октября 2026 года.

SiliconANGLE — Anthropic releases Claude Haiku 5.5 small model and halves Sonnet 5.5 cache read prices, 7 октября 2026 года.

CNBC — Anthropic unveils a new, cheaper Haiku model, 7 октября 2026 года.

Материал подготовлен редакцией YuSMP Group по открытым источникам. Нужна экспертиза по теме или разработка под задачу — обсудим проект.

Снизим счёт за LLM без потери качества

Спроектируем маршрутизацию между малыми и старшими моделями, наборы эталонных проверок и кэширование промптов. Массовые вызовы переедут на дешёвые модели вроде Haiku 5.5 с измеримым и обратимым результатом.

Обсудить внедрение ИИ