Anthropic ने 28 सप्टेंबर रोजी Claude Sonnet 5.5 प्रसिद्ध केले; API टोकनच्या किंमती Sonnet 5 प्रमाणेच आहेत. कमी टोकन वापरल्याने मॉडेल 30% पेक्षा अधिक जलद आउटपुट देते आणि प्रत्येक कामामागील खर्च 30% पर्यंत कमी होऊ शकतो, असे कंपनी सांगते. हे दोन वेगळे दावे आहेत: जाहीर दर कमी झालेला नाही आणि प्रत्येक कामाचे बिल प्रॉम्प्ट, आउटपुट, साधने व प्रयत्न-सेटिंगवर अवलंबून असते.
विकासकांसाठी हे प्रकाशन संभाव्य कार्यक्षमता-लाभासोबत Sonnet 5 ची एकत्रीकरणे खंडित करू शकणारे बदलही आणते. Anthropic चे दस्तऐवजीकरण मॉडेलला claude-sonnet-5-5 Claude API, Google Cloud आणि Microsoft Foundry वर उपलब्ध असल्याचे, तसेच anthropic.claude-sonnet-5-5 Amazon Bedrock वर उपलब्ध असल्याचे नमूद करते. मॉडेल-पानावर दहा लाख टोकनची संदर्भ-खिडकी आणि जास्तीत जास्त 128,000 टोकनचे आउटपुट दिले आहे. AWS वरील Claude Platform मधूनही प्रवेश उपलब्ध आहे. क्लाउड पुरवठादारांचे बिलिंग आणि प्रादेशिक सेटिंग्ज Claude API च्या जाहीर दरांपेक्षा वेगळ्या असू शकतात.
मूल्यांकनांतून काय दिसते
Anthropic च्या Terminal-Bench 4.0 चाचणीत, प्रकाशन-तक्त्यानुसार, Sonnet 5.5 ने 66 टर्मिनल कामांपैकी 70.6% पूर्ण केली; Sonnet 5 ने 10.3% केली. कंटेनरबद्ध कमांड-लाइन वातावरणातील कठीण विज्ञान व अभियांत्रिकीची कामे असल्याचे प्रणाली-पत्रक सांगते. Anthropic ने कमाल विचार-प्रयत्नावर Claude Code bare mode वापरले, इंटरनेट प्रवेश रोखला आणि कामांसाठी लागणारी सामग्री कॅश केली. सुरक्षा उपायांमुळे Sonnet 5.5 च्या 1.2% विनंत्या पर्यायी मॉडेलकडे गेल्या; त्याचा 1.5% चाचण्यांवर परिणाम झाला. Sonnet 5.5 च्या निकालासाठी Anthropic ने 2.5 टक्के-बिंदूंची प्रमाणित त्रुटी नोंदवली. हा गुण या सेटअपचे मोजमाप आहे; विकासकांच्या स्वतःच्या रिपॉझिटरींमध्येही तितकीच सुधारणा होईल असे तो सिद्ध करत नाही.
Anthropic च्या प्रणाली-पत्रकानुसार Cognition ने Claude Code मध्ये 150 रिपॉझिटरी कामांवर FrontierCode चालवले आणि xhigh प्रयत्न-स्तराच्या Main संचात Sonnet 5.5 ला 52.1% गुण दिले. कमाल प्रयत्न-स्तरावर गुण 46.2% झाले; Cognition ने तपासलेल्या काही प्रकरणांत एजंटची अतिरिक्त तपासणी व संपादने बेंचमार्कची व्याप्ती किंवा वेळ-मर्यादा ओलांडल्याने असे झाले. Cursor ने Cursor सत्रांतील कामांवर आपल्या उत्पादन एजंट-साधनसंचात CursorBench 4.0 चालवले. Anthropic ला पाठवलेल्या निकाल-तक्त्यात कमाल प्रयत्न-स्तरावरील Sonnet 5.5 चे 55.5% गुण आहेत; Cursor च्या टोकन मोजणीवरून Anthropic ने प्रत्येक कामाचा खर्च अंदाजला. या बाह्य मूल्यांकनांत वेगवेगळी कामे व साधनसंच वापरले; येथे दिलेले Sonnet 5.5 चे निकाल Anthropic च्या प्रणाली-पत्रकातून आले आहेत.
Artificial Analysis ने प्रकाशनापूर्वीच्या मॉडेलची GDPval-AA वरही चाचणी केली. त्यात 44 व्यवसायांतील 220 कामांच्या उत्पादनांची तुलना होते. AA-Briefcase या जोडलेल्या ज्ञान-कामांच्या प्रकल्प-संचाचाही वापर केला. कमाल प्रयत्न-स्तरावर अनुक्रमे 1844 आणि 1811 Elo गुण मिळाल्याचे पत्रक नोंदवते; या चाचण्यांत ते Opus 5.5 च्या जवळ होते. संरचित आउटपुटमधील दोषामुळे निकाल प्रभावित झाले असण्याची शक्यता होती; तो नंतर दुरुस्त केल्याचे Anthropic सांगते. या अटींतील बेंचमार्क आउटपुटचे हे मूल्यांकन आहे; वाचकाच्या खुल्या स्वरूपाच्या कामात Sonnet 5.5 Opus इतकेच काम करेल हे दाखवत नाही. सातत्याने निर्णयक्षमता लागणाऱ्या गुंतागुंतीच्या कामांत Opus अधिक सक्षम असल्याचे Anthropic स्वतः सांगते.
प्रारंभीच्या ग्राहकांनी Anthropic च्या प्रकाशनात उद्धृत केलेल्या त्यांच्या चाचण्यांत जलद कार्यप्रवाह आणि कमी टोकन वापराचे वर्णन केले. त्या ग्राहकांनी स्वतःची कामे व पद्धती वापरल्या; त्यामुळे त्यांच्या अनुभवांतून सर्वांसाठी समान उत्पादकता-मोजमाप ठरत नाही. BIG CHANGE ने Sonnet 5.5 चालवलेले नाही किंवा प्रत्यक्ष कार्यप्रवाहात विक्रेत्याचे वेग व कामामागील खर्चाचे आकडे तपासलेले नाहीत.
किंमत आणि स्थलांतर
Claude API चा जाहीर दर दहा लाख इनपुट टोकनसाठी $2 आणि दहा लाख आउटपुट टोकनसाठी $10 आहे; Sonnet 5 प्रमाणेच. पाच मिनिटांच्या कॅश-लेखनाला दहा लाख टोकनसाठी $2.50 आणि कॅश-वाचनाला $0.20 लागतात. Anthropic चे कामामागील खर्चाचे तक्ते जाहीर दरांची ठरावीक प्रयत्न-स्तरांतील टोकन-वापराशी सांगड घालतात. त्यावरून सार्वत्रिक 30% बचत सिद्ध होत नाही. मॉडेलची तुलना करणाऱ्या पथकाने आवश्यक गुणवत्ता-निकषावर स्वतःची प्रतिनिधिक कामे चालवून यशासोबत टोकन-वापर आणि लागलेला वेळ नोंदवावा.
फक्त मॉडेल ID बदलल्याने विद्यमान Messages API कोडमध्ये त्रुटी येऊ शकते. Sonnet 5 मधील thinking: {"type": "disabled"} 5.5 वर त्रुटी देते; आधी विचार न करता विनंती पाठवण्यासाठी दस्तऐवजीकृत पर्याय thinking: {"type": "between_tools"} असून तो कमी, मध्यम आणि जास्त प्रयत्न-स्तरांवर स्वीकारला जातो. हे क्षेत्र वगळल्यास Adaptive thinking सुरू असते; Claude API चा पूर्वनियोजित प्रयत्न-स्तर जास्त असतो. सक्तीचे tool_choice पर्याय any आणि tool दिल्यासही त्रुटी येतात; Anthropic विकासकांना auto आणि, समर्थन असेल तिथे strict tool schema, वापरण्यास सांगते. Amazon Bedrock वरील Sonnet 5.5 मध्ये strict tool वापर उपलब्ध नाही; वापरा: auto पण strict strict वापरता tool input अनुप्रयोगाच्या कोडमध्ये तपासा. साधन-कॉलमधील मजकूर दाखवणाऱ्या कोडला thinking blocks मधून येणारी प्रगती-अद्यतने हाताळावी लागू शकतात. Claude API आणि Google Cloud मधील computer-use एकत्रीकरणांना नवा computer_toolset_20260801 टूलसंच; Bedrock वर आधीची computer_20251124 आवृत्ती कायम आहे. स्थलांतर मार्गदर्शकात सुसंगततेतील इतर बदल दिले आहेत.
मोठा बदल
Sonnet 5.5 मुळे खर्च-संवेदनशील पथकांना Sonnet 5 च्याच टोकन-दरात नवे मॉडेल मिळते. काही निर्दिष्ट मूल्यांकनांत निकाल जास्त आहेत आणि आउटपुट जलद असल्याचा Anthropic चा दावा आहे. प्रत्यक्ष मूल्य कामांच्या मिश्रणावर आणि प्रयत्न-सेटिंगवर अवलंबून आहे. विद्यमान एकत्रीकरणांच्या सेटिंग्जचेही पुनरावलोकन आवश्यक आहे. संस्थेच्या स्वतःच्या कामांत योग्य निकाल, टोकन-वापर आणि लागलेला वेळ मोजून तुलना करणे हे पुढचे स्पष्ट पाऊल आहे.
स्रोत आणि पुढील वाचन
- Anthropic ची Sonnet 5.5 घोषणा प्रकाशन-तारीख, कंपनीचे वेग व कामामागील खर्चाचे दावे, बेंचमार्क सारांश आणि सुरुवातीच्या ग्राहकांचे अनुभव देते. कामविशिष्ट चाचणीने कामगिरीच्या दाव्यांची पडताळणी करावी.
- Anthropic चे Sonnet 5.5 प्रणाली-पत्रक बेंचमार्क कामे, साधनसंच, प्रयत्न-सेटिंग्ज, पर्यायी मॉडेलकडे पाठवण्याचे वर्तन आणि बाह्य मूल्यांकनांचे मूळ दस्तऐवजीकृत करते. हे मॉडेल-विक्रेत्याचे प्राथमिक खुलासे आहेत; त्याला पुरवलेले बाह्य चाचण्यांचे निकालही आहेत.
- Claude Platform चे मॉडेल-पान API ID, प्रवेश, मर्यादा आणि टोकनच्या किंमती देते. संपूर्ण किंमत-पान Sonnet 5 आणि 5.5 चे मूलभूत दर समान असल्याची पुष्टी करते व क्लाउड-किंमतीतील फरक स्पष्ट करते.
- Sonnet 5.5 स्थलांतर मार्गदर्शक बदलणाऱ्या किंवा त्रुटी देणाऱ्या विनंती-सेटिंग्जची नोंद करते. विद्यमान एकत्रीकरणासाठीची संपूर्ण तपासणीसूची याच्या आधारे पाहा.



