Anthropic ने 28 सितंबर को Claude Sonnet 5.5 जारी किया। इसकी API टोकन कीमतें Sonnet 5 जैसी ही हैं। कंपनी का कहना है कि मॉडल 30% से अधिक तेज़ आउटपुट देता है और कम टोकन इस्तेमाल करने के कारण प्रति काम लागत 30% तक घट सकती है। ये अलग-अलग दावे हैं: घोषित कीमत कम नहीं हुई है, और किसी काम का बिल अब भी प्रॉम्प्ट, आउटपुट, टूल और प्रयास-सेटिंग पर निर्भर करता है।
डेवलपरों के लिए यह रिलीज़ संभावित दक्षता लाभ के साथ ऐसे बदलाव लाती है जो Sonnet 5 इंटीग्रेशन तोड़ सकते हैं। Anthropic के दस्तावेज़ में मॉडल को उपलब्ध बताया गया है claude-sonnet-5-5 Claude API, Google Cloud और Microsoft Foundry पर, और anthropic.claude-sonnet-5-5 Amazon Bedrock पर। मॉडल पृष्ठ में दस लाख टोकन की संदर्भ-विंडो और अधिकतम 128,000 टोकन आउटपुट दर्ज है। AWS पर Claude Platform के ज़रिए भी पहुँच उपलब्ध है। क्लाउड प्रदाता की बिलिंग और क्षेत्रीय सेटिंग Claude API की घोषित दरों से अलग हो सकती हैं।
मूल्यांकनों से क्या पता चलता है
Anthropic के Terminal-Bench 4.0 रन में Sonnet 5.5 ने 66 टर्मिनल कार्यों में से 70.6% पूरे किए, जबकि रिलीज़ तालिका में Sonnet 5 का परिणाम 10.3% था। सिस्टम कार्ड इस बेंचमार्क को कंटेनरयुक्त कमांड-लाइन वातावरण में विज्ञान और इंजीनियरिंग के कठिन कार्यों का समूह बताता है। Anthropic ने Claude Code को bare mode में, अधिकतम सोच-प्रयास पर चलाया; इंटरनेट पहुँच रोकी और कार्यों के लिए ज़रूरी संसाधन कैश किए। सुरक्षा उपायों के तहत Sonnet 5.5 के 1.2% अनुरोध फ़ॉलबैक मॉडल को भेजे गए, जिससे 1.5% परीक्षण प्रभावित हुए। Anthropic ने Sonnet 5.5 नतीजे के लिए 2.5 प्रतिशत-अंक की मानक त्रुटि बताई। यह अंक इसी सेटअप को मापता है; इससे डेवलपरों के अपने रिपॉज़िटरी में वैसा सुधार साबित नहीं होता।
Anthropic के सिस्टम कार्ड के अनुसार, Cognition ने Claude Code में 150 रिपॉज़िटरी कार्यों पर FrontierCode चलाया और xhigh प्रयास पर अपने Main सेट में Sonnet 5.5 का परिणाम 52.1% बताया। max प्रयास पर अंक 46.2% रह गया; Cognition ने जाँचे कुछ मामलों में इसकी एक वजह यह बताई कि एजेंट की अतिरिक्त समीक्षा और संपादन बेंचमार्क के दायरे या समय-सीमा से आगे निकल गए। Cursor ने अपने प्रोडक्शन एजेंट हार्नेस में Cursor सत्रों से लिए गए कार्यों पर CursorBench 4.0 चलाया। Anthropic को भेजी गई परिणाम तालिका में max प्रयास पर Sonnet 5.5 का अंक 55.5% है; Anthropic ने Cursor के टोकन आँकड़ों से प्रति काम लागत का अनुमान लगाया। इन बाहरी मूल्यांकनों में अलग-अलग कार्य और हार्नेस इस्तेमाल हुए, और यहाँ Sonnet 5.5 के आँकड़े Anthropic के सिस्टम कार्ड के ज़रिए दिए गए हैं।
Artificial Analysis ने भी रिलीज़ से पहले के मॉडल को GDPval-AA पर परखा, जो 44 व्यवसायों के 220 कार्यों के तैयार काम की तुलना करता है, और AA-Briefcase पर, जो परस्पर जुड़े ज्ञान-कार्य प्रोजेक्टों का समूह है। कार्ड में max प्रयास पर क्रमशः 1844 और 1811 Elo अंक दर्ज हैं, जो इन परीक्षणों में Opus 5.5 के करीब हैं। Anthropic का कहना है कि रिलीज़ से पहले की तैनाती में संरचित आउटपुट का एक बग था, जिसने नतीजों को प्रभावित किया हो सकता है; अब उसे ठीक कर दिया गया है। यह तुलना उन शर्तों में बेंचमार्क आउटपुट का मूल्यांकन करती है; इससे साबित नहीं होता कि Sonnet 5.5 पाठक के खुले स्वरूप वाले काम में Opus के बराबर होगा। Anthropic स्वयं कहता है कि लगातार विवेकपूर्ण निर्णय माँगने वाले जटिल काम में Opus अब भी बेहतर है।
Anthropic की लॉन्च घोषणा में शुरुआती ग्राहकों के उद्धरण उनके अपने परीक्षणों में तेज़ वर्कफ़्लो और कम टोकन इस्तेमाल का वर्णन करते हैं। इन ग्राहकों ने अपने काम और तरीके इस्तेमाल किए, इसलिए उनके बयान साझा उत्पादकता माप स्थापित नहीं करते। BIG CHANGE ने Sonnet 5.5 नहीं चलाया है और न ही किसी वास्तविक वर्कफ़्लो में विक्रेता के गति और प्रति काम लागत संबंधी आँकड़े जाँचे हैं।
कीमत और माइग्रेशन
Claude API की सूची-दरें प्रति दस लाख इनपुट टोकन 2 डॉलर और प्रति दस लाख आउटपुट टोकन 10 डॉलर हैं—Sonnet 5 से अपरिवर्तित। पाँच मिनट के कैश लेखन की कीमत प्रति दस लाख टोकन 2.50 डॉलर और कैश पढ़ने की 0.20 डॉलर है। Anthropic के प्रति काम लागत वाले चार्ट सूची-दरों को तय प्रयास स्तरों पर इस्तेमाल हुए टोकन से जोड़ते हैं। वे सार्वभौमिक रूप से 30% बचत साबित नहीं करते। मॉडल की तुलना करने वाली टीम को अपनी ज़रूरत की गुणवत्ता-सीमा पर प्रतिनिधि कार्य चलाने चाहिए और सफलता के साथ टोकन इस्तेमाल तथा लगा समय भी दर्ज करना चाहिए।
मौजूदा Messages API कोड में केवल मॉडल ID बदलना विफल हो सकता है। Sonnet 5 का thinking: {"type": "disabled"} में त्रुटि देता है; पहले से सोच-विचार शुरू किए बिना काम करने का दस्तावेज़ित विकल्प है thinking: {"type": "between_tools"}, जिसे low, medium और high प्रयास पर स्वीकार किया जाता है। Adaptive thinking फ़ील्ड छोड़ने पर चालू रहता है और Claude API का डिफ़ॉल्ट प्रयास high है। ज़बरन tool_choice वैल्यू any और tool भी त्रुटि देते हैं; Anthropic डेवलपरों को निर्देश देता है कि auto और, जहाँ समर्थित हो, सख़्त टूल स्कीमा इस्तेमाल करें। Amazon Bedrock पर Sonnet 5.5 में सख़्त टूल उपयोग उपलब्ध नहीं है: इस्तेमाल करें auto बिना strict और एप्लिकेशन कोड में टूल इनपुट की पुष्टि करें। टूल कॉल के बीच पाठ दिखाने वाले कोड को सोच-विचार ब्लॉकों में लौटने वाले प्रगति अपडेट संभालने पड़ सकते हैं। Claude API और Google Cloud के computer-use इंटीग्रेशन को नया computer_toolset_20260801 टूलसेट चाहिए, जबकि Bedrock में पुराना computer_20251124 संस्करण रहता है। माइग्रेशन गाइड में अनुकूलता के और बदलाव दिए गए हैं।
बड़ा बदलाव
Sonnet 5.5 लागत के प्रति संवेदनशील टीमों को Sonnet 5 की ही टोकन दरों पर एक नया मॉडल देता है; कुछ निर्दिष्ट मूल्यांकनों में इसके नतीजे बेहतर हैं और Anthropic तेज़ आउटपुट का दावा करता है। इसका व्यावहारिक लाभ काम के प्रकारों के मिश्रण और प्रयास सेटिंग पर निर्भर है। मौजूदा इंटीग्रेशन की सेटिंग की समीक्षा भी ज़रूरी है। अगली सबसे स्पष्ट तुलना किसी संगठन के अपने काम पर सही नतीजों, टोकन इस्तेमाल और लगे समय को मापकर होगी।
स्रोत और आगे पढ़ें
- Anthropic की Sonnet 5.5 घोषणा रिलीज़ की तारीख़, कंपनी के गति और प्रति काम लागत के दावे, बेंचमार्क सारांश और शुरुआती ग्राहकों के बयान देती है। बताए गए प्रदर्शन को अपने काम के हिसाब से जाँचना चाहिए।
- Anthropic का Sonnet 5.5 सिस्टम कार्ड बेंचमार्क कार्यों, हार्नेस, प्रयास सेटिंग, फ़ॉलबैक व्यवहार और बाहरी मूल्यांकन के स्रोत का दस्तावेज़ है। यह मॉडल विक्रेता का प्राथमिक खुलासा है और इसमें उसे भेजे गए बाहरी तौर पर किए गए नतीजे भी शामिल हैं।
- Claude Platform का मॉडल पृष्ठ API ID, उपलब्धता, सीमाएँ और टोकन कीमतें दर्ज करता है।पूरी मूल्य सूची पुष्टि करती है कि Sonnet 5 और 5.5 की आधार दरें समान हैं और क्लाउड पर मूल्य में अंतर बताती है।
- Sonnet 5.5 माइग्रेशन गाइड बदलने वाली या त्रुटि देने वाली अनुरोध सेटिंग दर्ज करती है। मौजूदा इंटीग्रेशन की पूरी जाँच सूची के लिए इसका इस्तेमाल करें।



