Anthropic је 28. септембра објавио Claude Sonnet 5.5 по истим ценама API токена као Sonnet 5. Компанија наводи да модел генерише излаз више од 30% брже и да по задатку може да кошта до 30% мање зато што користи мање токена. То су одвојене тврдње: објављена цена није снижена, а рачун за задатак и даље зависи од упита, излаза, алата и подешавања напора.

За програмере, издање доноси потенцијално корисно повећање ефикасности, али и измене које могу да покваре интеграције са Sonnet-ом 5. Anthropic-ова документација наводи модел под ознаком claude-sonnet-5-5 на Claude API-ју, Google Cloud-у и Microsoft Foundry-ју, а anthropic.claude-sonnet-5-5 на Amazon Bedrock-у. На страници модела наводе се контекст од милион токена и максимални излаз од 128.000 токена. Приступ је доступан и преко Claude Platform-а на AWS-у. Наплата и регионална подешавања цлоуд провајдера могу да се разликују од објављених цена Claude API-ја.

Шта показују евалуације

У Anthropic-овом тесту Terminal-Bench 4.0, Sonnet 5.5 је решио 70,6% од 66 терминалских задатака, у поређењу са 10,3% за Sonnet 5 према табели уз објаву. У картици система скуп је описан као захтевни научни и инжењерски задаци у командним окружењима покренутим у контејнерима. Anthropic је покренуо Claude Code у основном режиму уз највећи напор резоновања, блокирао приступ интернету и кеширао ресурсе потребне за задатке. Заштитне мере преусмериле су 1,2% захтева за Sonnet 5.5 на резервни модел, што је утицало на 1,5% покушаја. Anthropic наводи стандардну грешку од 2,5 процентних поена за резултат Sonnet-а 5.5. Резултат мери те услове; не потврђује исто побољшање у репозиторијумима програмера.

Према картици система Anthropic-а, Cognition је у Claude Code-у покренуо FrontierCode на 150 задатака из репозиторијума и пријавио 52,1% за Sonnet 5.5 на главном скупу при веома високом нивоу напора (xhigh). Резултат је пао на 46,2% при максималном напору, делом зато што су додатни преглед и измене агента у случајевима које је Cognition испитао прекорачили обим или временско ограничење бенцхмарка. Cursor је покренуо CursorBench 4.0 у свом продукционом агентском окружењу на задацима заснованим на Cursor сесијама. Резултат Sonnet-а 5.5 од 55,5% при максималном напору налази се у табели резултата послатој Anthropic-у; компанија је проценила цену по задатку на основу броја токена који је доставио Cursor. Ове спољне евалуације користиле су различите задатке и окружења, а овде приказане бројке за Sonnet 5.5 пренете су кроз картицу система Anthropic-а.

Artificial Analysis је такође тестирао верзију пре издања на GDPval-AA, који пореди резултате рада у 220 задатака из 44 занимања, и на AA-Briefcase-у, скупу повезаних пројеката канцеларијског рада. Картица наводи Elo резултате од 1844 и 1811 при максималном напору, редом, блиске моделу Opus 5.5 у тим тестовима. Anthropic наводи да је верзија пре издања имала грешку у структурисаном излазу која је можда утицала на резултате и која је у међувремену исправљена. Поређење процењује резултате бенцхмарка у тим условима; не показује да ће се Sonnet 5.5 изједначити са Opus-ом у отвореном задатку читаоца. Сам Anthropic наводи да је Opus и даље снажнији у сложеном раду који захтева дуготрајно просуђивање.

Цитати раних корисника у објави Anthropic-а описују брже токове рада и мању потрошњу токена у њиховим тестовима. Корисници су користили сопствене задатке и методе, па њихови искази не утврђују јединствену меру продуктивности. BIG CHANGE није покренуо Sonnet 5.5 нити проверио добављачеве тврдње о брзини и цени задатка у радном току уживо.

Цена и миграција

Цена Claude API-ја износи 2 долара за милион улазних токена и 10 долара за милион излазних токена, непромењено у односу на Sonnet 5. Упис у петоминутну кеш меморију кошта 2,50 долара за милион токена, а читање из кеша 0,20 долара. Графикони Anthropic-а о трошку по задатку комбинују објављене цене са бројем токена потрошених при одређеном нивоу напора. Њима се не може потврдити универзална уштеда од 30%. Тим који пореди моделе треба да покрене репрезентативне задатке и забележи потрошњу токена и протекло време, као и успешност при потребном нивоу квалитета.

Сама промена ИД-ја модела можда неће бити довољна за постојећи код који користи Messages API. Sonnet 5 thinking: {"type": "disabled"} изазива грешку у верзији 5.5; документована замена за избегавање резоновања на почетку је thinking: {"type": "between_tools"}, која прихвата низак, средњи и висок ниво напора. Адаптивно резоновање је укључено када се поље изостави, а Claude API подразумевано бира висок ниво напора. Принудне вредности tool_choice имају вредности any и tool такође враћају грешке; Anthropic упућује програмере на auto и строге шеме алата тамо где су подржане. На Sonnet-у 5.5 у Amazon Bedrock-у строга употреба алата није доступна: користите auto без strict и проверавајте улазне податке алата у коду апликације. Код који приказује текст између позива алата можда мора да обради ажурирања о напретку враћена у блоковима резоновања. Интеграције за управљање рачунаром на Claude API-ју и Google Cloud-у захтевају новији скуп алата computer_toolset_20260801, док Bedrock задржава ранију верзију computer_20251124. У водичу за миграцију описане су и друге измене компатибилности.

Суштинска промена

Sonnet 5.5 тимовима осетљивим на трошкове пружа нови модел по цени токена Sonnet-а 5, уз боље резултате у неколико прецизно наведених евалуација и Anthropic-ову тврдњу о бржем излазу. Практична вредност зависи од врсте задатака и подешавања напора. Потребно је проверити и поставке постојећих интеграција. Најјасније поређење које следи јесте мерење сопственог радног оптерећења организације према тачности резултата, потрошњи токена и протеклом времену.

Извори и додатна литература

  • Anthropic-ова објава о Sonnet-у 5.5 наводи датум издања, тврдње компаније о брзини и цени задатка, сажетак бенцхмарк резултата и искуства раних корисника. Тврдње о резултатима треба проверити за конкретно радно оптерећење.
  • Картица система Anthropic-а за Sonnet 5.5 документује задатке на бенцхмарку, окружења, подешавања напора, понашање резервног модела и порекло спољних евалуација. То је примарна објава добављача модела која обухвата и резултате спољашњих тестова достављене компанији.
  • Страница модела Claude Platform-а наводи ИД-јеве API-ја, доступност, ограничења и цене токена. Комплетна страница са ценама потврђује да су основне цене Sonnet-а 5 и 5.5 једнаке и објашњава разлике у ценама цлоуд провајдера.
  • Водич за миграцију на Sonnet 5.5 бележи подешавања захтева која су промењена или враћају грешке. Користите га за потпуну контролну листу постојеће интеграције.