Anthropic выпустила Claude Sonnet 5.5 28 сентября по тем же ценам за токены API, что и Sonnet 5. Компания заявляет, что модель генерирует ответы более чем на 30% быстрее и может снизить стоимость задачи до 30% за счет меньшего расхода токенов. Это разные утверждения: опубликованная цена не снизилась, а стоимость задачи по-прежнему зависит от запроса, ответа, инструментов и настройки усилий.

Для разработчиков новый выпуск сочетает потенциально полезный рост эффективности с изменениями, которые могут нарушить работу интеграций Sonnet 5. В документации Anthropic модель доступна claude-sonnet-5-5 в Claude API, Google Cloud, Microsoft Foundry и anthropic.claude-sonnet-5-5 в Amazon Bedrock. На странице модели указаны контекстное окно в один миллион токенов и максимальный ответ в 128 000 токенов. Доступ также указан через Claude Platform на AWS. Расценки облачных поставщиков и региональные настройки могут отличаться от опубликованных ставок Claude API.

Что показывают оценки

В запуске Anthropic Terminal-Bench 4.0 модель Sonnet 5.5 выполнила 70,6% из 66 задач в командной строке против 10,3% у Sonnet 5 в таблице результатов выпуска. Системная карточка описывает сложный набор научных и инженерных задач в контейнеризированных средах командной строки. Anthropic запускала Claude Code в базовом режиме с максимальным уровнем усилий при рассуждении, заблокировала доступ к интернету и кэшировала ресурсы, необходимые для задач. Механизмы защиты перенаправили 1,2% запросов Sonnet 5.5 резервной модели; это затронуло 1,5% испытаний. По данным Anthropic, стандартная ошибка результата Sonnet 5.5 составляет 2,5 процентного пункта. Эта оценка относится к данным условиям и не подтверждает такой же прирост на собственных репозиториях разработчиков.

Согласно системной карточке Anthropic, Cognition запускала FrontierCode в Claude Code на 150 задачах из репозиториев и сообщила результат Sonnet 5.5 в 52,1% на основном наборе при уровне усилий xhigh. При максимальном уровне результат снизился до 46,2%, отчасти потому, что дополнительная проверка и правки агента в рассмотренных Cognition случаях выходили за рамки или временной лимит бенчмарка. Cursor запускала CursorBench 4.0 в своем производственном агентном окружении на задачах из сеансов Cursor. В таблице результатов, переданной Anthropic, результат Sonnet 5.5 составляет 55,5% при максимальном уровне усилий; стоимость задачи для этой модели Anthropic оценила по количеству токенов, предоставленному Cursor. Эти внешние оценки использовали разные задачи и среды запуска, а приведенные здесь результаты Sonnet 5.5 взяты из системной карточки Anthropic.

Artificial Analysis также тестировала предрелизную модель на GDPval-AA, где оцениваются результаты работы в 220 задачах из 44 профессий, и AA-Briefcase — наборе связанных проектов интеллектуального труда. В системной карточке указаны оценки Elo 1844 и 1811 при максимальном уровне усилий соответственно; в этих тестах результаты близки к Opus 5.5. Anthropic сообщает, что в предрелизной версии была ошибка структурированного вывода, которая могла повлиять на результаты; с тех пор ее исправили. Сравнение оценивает выходные данные бенчмарков в этих условиях, но не показывает, что Sonnet 5.5 будет не хуже Opus в открытых задачах читателя. Сама Anthropic говорит, что Opus по-прежнему сильнее в сложной работе, требующей длительного обдумывания.

В рекламных материалах Anthropic ранние клиенты описывают более быстрые рабочие процессы и меньший расход токенов в собственных тестах. Эти клиенты использовали свои задачи и методы, поэтому их рассказы не устанавливают единую меру производительности. BIG CHANGE не запускала Sonnet 5.5 и не проверяла заявления поставщика о скорости и стоимости задач в рабочем процессе.

Стоимость и переход на новую модель

Опубликованные ставки Claude API составляют 2 доллара за миллион входных токенов и 10 долларов за миллион выходных — без изменений относительно Sonnet 5. Запись в кэш на пять минут стоит 2,50 доллара за миллион токенов, чтение из кэша — 0,20 доллара. На графиках стоимости задачи Anthropic сопоставляет опубликованные ставки с расходом токенов при заданных уровнях усилий. По этим графикам нельзя установить универсальную экономию в 30%. Команде, сравнивающей модели, следует запускать собственные репрезентативные задачи при требуемом пороге качества, записывая расход токенов и затраченное время наряду с успешностью.

Простая замена идентификатора модели может нарушить существующий код Messages API. У Sonnet 5 вызов thinking: {"type": "disabled"} приводит к ошибке в версии 5.5; чтобы не задавать рассуждение заранее, документация предлагает заменить его на thinking: {"type": "between_tools"}, который принимается при низком, среднем и высоком уровне усилий. Адаптивное рассуждение включается, если поле не задано; Claude API по умолчанию использует высокий уровень усилий. Принудительные tool_choice значения any и tool также приводят к ошибкам; Anthropic рекомендует использовать auto и, если поддерживается, строгие схемы инструментов. Для Sonnet 5.5 на Amazon Bedrock строгий режим инструментов недоступен: используйте auto без strict и проверяйте входные данные инструментов в коде приложения. Коду, который выводит текст между вызовами инструментов, может потребоваться обрабатывать сообщения о ходе работы, возвращаемые в блоках рассуждений. Интеграциям компьютерного управления в Claude API и Google Cloud требуется новый computer_toolset_20260801 инструментарий, тогда как в Bedrock остается предыдущая computer_20251124 версия. В руководстве по миграции перечислены и другие изменения совместимости.

Главное изменение

Sonnet 5.5 предлагает ориентированным на стоимость командам новую модель по прежним ценам Sonnet 5 за токены, с более высокими результатами в нескольких оговоренных оценках и заявлением Anthropic о росте скорости генерации. Практическая ценность зависит от набора задач и настройки усилий. Существующие интеграции также нужно проверить. Самое наглядное следующее сравнение — измерить правильность результатов, расход токенов и затраченное время на собственной нагрузке организации.

Источники и дополнительная литература

  • Анонс Anthropic о Sonnet 5.5 содержит дату выпуска, заявления компании о скорости и стоимости задач, краткие результаты бенчмарков и отзывы ранних клиентов. Заявленные преимущества требуют проверки на конкретных рабочих нагрузках.
  • Системная карточка Anthropic Sonnet 5.5 описывает задачи и окружения бенчмарков, настройки усилий, работу резервной модели и происхождение результатов внешних оценок. Это первичное раскрытие модели ее поставщиком, в том числе внешние результаты, переданные компании.
  • Страница модели Claude Platform содержит идентификаторы API, доступность, лимиты и цены за токены. Полная страница цен подтверждает одинаковые базовые ставки Sonnet 5 и 5.5 и объясняет различия цен у облачных поставщиков.
  • Руководство по переходу на Claude Sonnet 5.5 перечисляет параметры запросов, которые изменились или приводят к ошибкам. Полный контрольный список для действующей интеграции приведен там.