Anthropic సెప్టెంబర్ 28న Claude Sonnet 5.5ను విడుదల చేసింది. API టోకెన్ ధరలు Sonnet 5 ధరలతో సమానంగా ఉన్నాయి. ఈ మోడల్ 30%కుపైగా వేగంగా ఫలితాలను రూపొందిస్తుందని, తక్కువ టోకెన్లు వాడటంతో ఒక్కో పనికి ఖర్చు 30% వరకు తగ్గవచ్చని కంపెనీ చెబుతోంది. ఇవి వేర్వేరు వాదనలు: ప్రకటించిన ధర తగ్గలేదు; ఒక్కో పనికి బిల్లు ప్రాంప్ట్, అవుట్పుట్, సాధనాలు, effort సెట్టింగ్పై ఆధారపడి ఉంటుంది.
డెవలపర్లకు, ఉపయోగకరమైన సామర్థ్య పెరుగుదలతో పాటు Sonnet 5 ఇంటిగ్రేషన్లను దెబ్బతీయగల మార్పులూ ఈ విడుదలలో ఉన్నాయి. Anthropic డాక్యుమెంటేషన్లో ఈ మోడల్ claude-sonnet-5-5 Claude API, Google Cloud, Microsoft Foundryలలోనూ, anthropic.claude-sonnet-5-5 Amazon Bedrockలోనూ అందుబాటులో ఉన్నట్లు పేర్కొంది. మోడల్ పేజీ ఒక మిలియన్ టోకెన్ల context window, గరిష్ఠంగా 128,000 టోకెన్ల outputను జాబితా చేస్తుంది. AWSలోని Claude Platform ద్వారానూ యాక్సెస్ ఉంది. క్లౌడ్ ప్రొవైడర్ల బిల్లింగ్, ప్రాంతీయ సెట్టింగులు Claude API ప్రకటించిన ధరలకంటే భిన్నంగా ఉండవచ్చు.
మూల్యాంకనాలు ఏం చూపుతున్నాయి
Anthropic నిర్వహించిన Terminal-Bench 4.0 పరీక్షలో, విడుదల పట్టిక ప్రకారం Sonnet 5.5 మొత్తం 66 టెర్మినల్ పనుల్లో 70.6% పూర్తి చేసింది; Sonnet 5 ఫలితం 10.3%. కంటైనర్లలో నడిచే కమాండ్-లైన్ వాతావరణాల్లో కఠినమైన విజ్ఞాన, ఇంజినీరింగ్ పనుల సమాహారంగా ఈ పరీక్షను సిస్టమ్ కార్డు వివరిస్తుంది. Anthropic Claude Codeను bare modeలో, అత్యధిక thinking effortతో నడిపి, ఇంటర్నెట్ యాక్సెస్ను నిరోధించి, పనులకు అవసరమైన వనరులను కాష్ చేసింది. భద్రతా చర్యల కారణంగా Sonnet 5.5 అభ్యర్థనల్లో 1.2% fallback మోడల్కు వెళ్లాయి; మొత్తం ట్రయల్స్లో ప్రభావితమైనవి 1.5%. Sonnet 5.5 ఫలితానికి ప్రామాణిక దోషం 2.5 శాతం పాయింట్లని Anthropic తెలిపింది. ఈ స్కోరు ఆ పరీక్షా అమరికను కొలుస్తుంది; డెవలపర్ల సొంత రిపాజిటరీల్లోనూ ఇదే మెరుగుదల ఉంటుందని నిర్ధారించదు.
Anthropic సిస్టమ్ కార్డు ప్రకారం, Cognition Claude Codeలో 150 రిపాజిటరీ పనులపై FrontierCodeను నడిపి, xhigh effortలో తన Main సమాహారంపై Sonnet 5.5కు 52.1% స్కోరు నివేదించింది. గరిష్ఠ effortలో స్కోరు 46.2%కు పడిపోయింది. Cognition పరిశీలించిన కొన్ని సందర్భాల్లో ఏజెంట్ అదనపు సమీక్ష, సవరణలు బెంచ్మార్క్ పరిధి లేదా సమయ పరిమితిని మించడమే ఒక కారణం. Cursor సెషన్ల నుంచి తీసుకున్న పనులపై తన production agent harnessలో CursorBench 4.0ను నడిపింది. Anthropicకు పంపిన ఫలితాల పట్టికలో గరిష్ఠ effort వద్ద Sonnet 5.5కు 55.5% వచ్చింది; Cursor తెలిపిన టోకెన్ లెక్కలతో Anthropic ఒక్కో పనికి ఖర్చును అంచనా వేసింది. ఈ బాహ్య మూల్యాంకనాల్లో వేర్వేరు పనులు, harnessలు వాడారు; ఇక్కడి Sonnet 5.5 గణాంకాలు Anthropic సిస్టమ్ కార్డు ద్వారా అందినవి.
Artificial Analysis విడుదలకు ముందు మోడల్ను GDPval-AAపై కూడా పరీక్షించింది. ఇది 44 వృత్తులకు చెందిన 220 పనుల్లో చేసిన పని ఫలితాలను పోలుస్తుంది. అనుసంధానిత జ్ఞానపర పనుల ప్రాజెక్టుల సమాహారమైన AA-Briefcaseనూ పరీక్షించింది. గరిష్ఠ effort వద్ద వాటి Elo స్కోర్లు వరుసగా 1844, 1811గా నమోదయ్యాయని, ఈ పరీక్షల్లో Opus 5.5కు దగ్గరగా ఉన్నాయని సిస్టమ్ కార్డు తెలిపింది. విడుదలకు ముందరి deploymentలో structured-output లోపం ఫలితాలను ప్రభావితం చేసి ఉండవచ్చని, దాన్ని తర్వాత సరిచేశామని Anthropic చెబుతోంది. ఆ షరతుల్లో benchmark అవుట్పుట్లను పోల్చిన ఫలితమిది; పాఠకుడి ఓపెన్-ఎండెడ్ పనుల్లో Sonnet 5.5, Opusతో సమానంగా పనిచేస్తుందని ఇది చూపదు. నిరంతర నిర్ణయ సామర్థ్యం అవసరమైన సంక్లిష్ట పనుల్లో Opus ఇంకా బలంగా ఉందని Anthropic చెబుతోంది.
తొలి వినియోగదారులపై చేసిన ప్రకటనలో Anthropic ఉటంకించిన కస్టమర్లు, తమ పరీక్షల్లో వేగవంతమైన వర్క్ఫ్లోలు, తక్కువ టోకెన్ల వినియోగం గురించి చెప్పారు. వారు తమ పనులు, పద్ధతులనే వాడారు; అందువల్ల వారి వివరాలు అందరికీ వర్తించే ఉత్పాదకత కొలమానాన్ని నిర్ధారించవు. BIG CHANGE Sonnet 5.5ను నడిపి చూడలేదు; ప్రత్యక్ష వర్క్ఫ్లోలో విక్రేత తెలిపిన వేగం, ఒక్కో పనికి అయ్యే ఖర్చునూ తనిఖీ చేయలేదు.
ధర, మైగ్రేషన్
Claude APIలో జాబితా ధరలు, ఇన్పుట్ టోకెన్లకు ప్రతి మిలియన్కు $2, అవుట్పుట్ టోకెన్లకు $10. Sonnet 5 నుంచి మారలేదు. ఐదు నిమిషాల కాష్ రైటింగ్కు ప్రతి మిలియన్ టోకెన్లకు $2.50, కాష్ నుంచి చదవడానికి $0.20 ఖర్చవుతుంది. Anthropic ఒక్కో పనిపై చూపే ఖర్చు చార్టులు, జాబితా ధరలతో పాటు నిర్దిష్ట effort స్థాయిల్లో వినియోగించిన టోకెన్లను కలుపుతాయి. అందరికీ 30% ఆదా అవుతుందని అవి నిర్ధారించలేవు. మోడళ్లను పోల్చే బృందం, అవసరమైన నాణ్యత స్థాయిలో తనకు ప్రాతినిధ్యం వహించే పనులను నడిపి, విజయంతో పాటు టోకెన్ల వినియోగం, పట్టిన సమయాన్ని నమోదు చేయాలి.
ఇప్పటికే ఉన్న Messages API కోడ్లో మోడల్ ID ఒక్కటే మార్చితే సరిపోకపోవచ్చు. Sonnet 5లోని thinking: {"type": "disabled"} 5.5లో లోపం ఇస్తుంది; ముందుగానే thinking ప్రారంభించకుండా ఉండేందుకు డాక్యుమెంట్ చేసిన ప్రత్యామ్నాయం thinking: {"type": "between_tools"}, దీన్ని low, medium, high effort స్థాయిల్లో అంగీకరిస్తారు. ఈ ఫీల్డ్ ఇవ్వకపోతే adaptive thinking ఆన్లో ఉంటుంది; Claude API డిఫాల్ట్ effort high. బలవంతంగా అమర్చిన tool_choice విలువలు any మరియు tool కూడా లోపాలు ఇస్తాయి. Anthropic డెవలపర్లను auto వాడాలని, మద్దతు ఉన్న చోట strict tool schemas ఉపయోగించాలని సూచిస్తోంది. Amazon Bedrockలో Sonnet 5.5కు strict tool use అందుబాటులో లేదు: auto ను strict లేకుండా వాడి, అప్లికేషన్ కోడ్లో tool ఇన్పుట్లను ధృవీకరించాలి. Tool కాల్స్ మధ్యలోని వచనాన్ని చూపించే కోడ్, thinking బ్లాక్లలో వచ్చే ప్రగతి అప్డేట్లను నిర్వహించాల్సి రావచ్చు. Claude API, Google Cloudలో computer-use ఇంటిగ్రేషన్లకు కొత్త strict toolset అవసరం; Bedrockలో మాత్రం పాత computer_toolset_20260801 సంస్కరణ కొనసాగుతుంది. computer_20251124 మైగ్రేషన్ మార్గదర్శకంలో ఇతర అనుకూలత మార్పుల వివరాలున్నాయి.
ముఖ్యమైన మార్పు
Sonnet 5.5, Sonnet 5 టోకెన్ ధరలకే కొత్త మోడల్ను అందిస్తుంది. నిర్దిష్టంగా వివరించిన పలు మూల్యాంకనాల్లో ఫలితాలు మెరుగయ్యాయి; వేగవంతమైన అవుట్పుట్ వస్తుందని Anthropic చెబుతోంది. ఆచరణలో విలువ, పనుల మిశ్రమం, effort సెట్టింగ్పై ఆధారపడి ఉంటుంది. ఇప్పటికే ఉన్న ఇంటిగ్రేషన్ల సెట్టింగులనూ సమీక్షించాలి. సంస్థ స్వంత పనిభారంలో సరైన ఫలితాలు, టోకెన్ వినియోగం, పట్టిన సమయాన్ని కొలవడమే స్పష్టమైన తదుపరి పోలిక.
మూలాలు, మరింత సమాచారం
- Anthropic Sonnet 5.5 ప్రకటన విడుదల తేదీ, వేగం, ఒక్కో పనికి అయ్యే ఖర్చుపై కంపెనీ వాదనలు, బెంచ్మార్క్ సారాంశం, తొలి కస్టమర్ల వివరాలను అందిస్తుంది. తెలిపిన పనితీరును నిర్దిష్ట పనిభారంలో తనిఖీ చేయాలి.
- Anthropic Sonnet 5.5 సిస్టమ్ కార్డు బెంచ్మార్క్ పనులు, harnessలు, effort సెట్టింగులు, fallback ప్రవర్తన, బాహ్య మూల్యాంకనాల మూలాలను నమోదు చేస్తుంది. మోడల్ విక్రేత చేసిన ప్రాథమిక వెల్లడిలో, బయటి సంస్థలు నిర్వహించి దానికి అందించిన ఫలితాలూ ఉన్నాయి.
- Claude Platform మోడల్ పేజీ API IDలు, యాక్సెస్, పరిమితులు, టోకెన్ ధరలను జాబితా చేస్తుంది. పూర్తి ధరల పేజీ Sonnet 5, 5.5లకు ఒకే ప్రాథమిక ధరలని నిర్ధారించి, క్లౌడ్ ధరల తేడాలను వివరిస్తుంది.
- Sonnet 5.5కు మైగ్రేషన్ మార్గదర్శి మారే లేదా లోపాలు ఇచ్చే అభ్యర్థన సెట్టింగులను నమోదు చేస్తుంది. ఇప్పటికే ఉన్న ఇంటిగ్రేషన్కు సంబంధించిన పూర్తి తనిఖీ జాబితా కోసం దీన్ని ఉపయోగించండి.



