Anthropic نے 28 ستمبر کو Claude Sonnet 5.5 جاری کیا، جس کے API token rates Sonnet 5 کے برابر ہیں۔ کمپنی کا کہنا ہے کہ model 30% سے زیادہ تیز output بناتا ہے اور کم tokens استعمال کرنے کے باعث ہر task پر 30% تک کم لاگت آ سکتی ہے۔ یہ دو الگ دعوے ہیں: درج شدہ قیمت کم نہیں ہوئی، اور task کا bill اب بھی prompt، output، tools اور effort setting پر منحصر ہے۔
ڈویلپرز کے لیے یہ اجرا ممکنہ طور پر مفید efficiency gain کو Sonnet 5 کی integrations توڑ سکنے والی تبدیلیوں کے ساتھ جوڑتا ہے۔ Anthropic کی دستاویزات کے مطابق model کا نام claude-sonnet-5-5 Claude API، Google Cloud اور Microsoft Foundry پر دستیاب ہے، اور anthropic.claude-sonnet-5-5 Amazon Bedrock پر دستیاب ہے۔ اس کا model page ایک ملین token context window اور زیادہ سے زیادہ 128,000 token output درج کرتا ہے۔ Claude Platform کے ذریعے AWS پر بھی رسائی درج ہے۔ Cloud provider کی billing اور علاقائی settings، Claude API کی شائع شدہ قیمتوں سے مختلف ہو سکتی ہیں۔
Evaluations کیا دکھاتے ہیں
Anthropic کے Terminal-Bench 4.0 run میں launch table کے مطابق Sonnet 5.5 نے terminal کے 66 tasks میں سے 70.6% مکمل کیے، جبکہ Sonnet 5 نے 10.3% مکمل کیے۔ system card میں containerized command-line environments کے اندر سائنس اور engineering کے مشکل tasks بیان ہیں۔ Anthropic نے Claude Code کو bare mode اور reasoning کے سب سے زیادہ effort پر چلایا، internet access روکا اور tasks کے لیے درکار resources cache کیے۔ safeguards نے Sonnet 5.5 کی 1.2% requests fallback model کو بھیجیں، جس سے 1.5% trials متاثر ہوئیں۔ Anthropic Sonnet 5.5 کے نتیجے کے لیے 2.5 percentage points کی standard error بتاتا ہے۔ یہ score اسی setup کو ناپتا ہے؛ اس سے developers کے اپنے repositories میں اتنی ہی بہتری ثابت نہیں ہوتی۔
Anthropic کے system card کے مطابق Cognition نے Claude Code میں FrontierCode کو 150 repository tasks پر چلایا اور xhigh effort پر اپنے Main set میں Sonnet 5.5 کے لیے 52.1% رپورٹ کیا۔ max effort پر score 46.2% رہ گیا، جزوی طور پر اس لیے کہ بعض Cognition کے زیرِ جائزہ cases میں agent کی اضافی review اور edits benchmark کے دائرے یا وقت سے آگے نکل گئیں۔ Cursor نے Cursor sessions سے لیے گئے tasks پر اپنے production agent harness میں CursorBench 4.0 چلایا۔ Anthropic کو بھیجی گئی results table میں max effort پر Sonnet 5.5 کا 55.5% نتیجہ ہے؛ Anthropic نے Cursor کے token counts سے model کی فی task لاگت کا تخمینہ لگایا۔ ان بیرونی evaluations کے tasks اور harnesses مختلف تھے، اور یہاں Sonnet 5.5 کے اعداد Anthropic کے system card کے ذریعے آئے ہیں۔
Artificial Analysis نے pre-release model کو GDPval-AA پر بھی چلایا، جو 44 پیشوں کے 220 tasks کے کام کا موازنہ کرتا ہے، اور AA-Briefcase پر بھی، جو باہم مربوط knowledge-work projects کا مجموعہ ہے۔ card کے مطابق max effort پر بالترتیب Elo scores 1844 اور 1811 تھے، جو ان tests میں Opus 5.5 کے قریب ہیں۔ Anthropic کہتا ہے کہ pre-release deployment میں structured-output bug تھا جو نتائج پر اثر ڈال سکتا تھا؛ اسے بعد میں ٹھیک کر دیا گیا۔ یہ موازنہ ان شرائط کے تحت benchmark outputs کو جانچتا ہے؛ یہ نہیں دکھاتا کہ قاری کے کھلے سرے والے کام میں Sonnet 5.5، Opus جیسی کارکردگی دے گا۔ Anthropic خود کہتا ہے کہ مسلسل فیصلہ سازی درکار پیچیدہ کاموں میں Opus اب بھی زیادہ مضبوط ہے۔
اجرا کے وقت Anthropic کے نقل کردہ ابتدائی صارفین کے بیانات ان کے اپنے tests میں تیز workflows اور کم tokens کی بات کرتے ہیں۔ ان صارفین نے اپنے tasks اور طریقے استعمال کیے، اس لیے ان کے بیانات مشترک productivity measure ثابت نہیں کر سکتے۔ BIG CHANGE نے Sonnet 5.5 نہیں چلایا اور نہ vendor کے رفتار اور task cost کے اعداد کو کسی حقیقی workflow میں جانچا۔
قیمت اور migration
Claude API کی list rate فی دس لاکھ input tokens $2 اور فی دس لاکھ output tokens $10 ہے، جو Sonnet 5 سے بدلی نہیں۔ پانچ منٹ کی cache write کی قیمت فی دس لاکھ tokens $2.50 اور cache read کی $0.20 ہے۔ Anthropic کے cost-per-task charts، list rates کو مخصوص effort levels پر استعمال کیے گئے tokens کے ساتھ ملاتے ہیں۔ یہ ہر حال میں 30% بچت ثابت نہیں کر سکتے۔ models کا موازنہ کرنے والی ٹیم کو اپنی نمائندہ tasks اپنے مطلوبہ quality threshold پر چلانی چاہییں، اور کامیابی کے ساتھ token use اور گزرا ہوا وقت بھی درج کرنا چاہیے۔
صرف model ID بدلنے سے موجودہ Messages API code ناکام ہو سکتا ہے۔ Sonnet 5 کا thinking: {"type": "disabled"} Sonnet 5.5 پر error دیتا ہے؛ upfront thinking سے بچنے کا دستاویزی متبادل thinking: {"type": "between_tools"} ہے، جو low، medium اور high effort پر قبول کیا جاتا ہے۔ field حذف کرنے پر adaptive thinking فعال رہتی ہے، اور Claude API کا default effort high ہے۔ جبری tool_choice values any اور tool بھی errors دیتی ہیں؛ Anthropic developers کو auto اور جہاں معاونت ہو، strict tool schemas استعمال کرنے کی ہدایت دیتا ہے۔ Amazon Bedrock پر Sonnet 5.5 میں strict tool use دستیاب نہیں: auto کو strict کے بغیر استعمال کریں اور application code میں tool inputs کی توثیق کریں۔ وہ code جو tool calls کے درمیان متن دکھاتا ہے، اسے thinking blocks میں ملنے والی progress updates بھی سنبھالنی پڑ سکتی ہیں۔ Claude API اور Google Cloud میں computer-use integrations کے لیے tools کا نیا computer_toolset_20260801 درکار ہے، جبکہ Bedrock پرانا computer_20251124 رکھتا ہے۔ migration guide مزید compatibility تبدیلیاں بتاتی ہے۔
بڑی تبدیلی
Sonnet 5.5، لاگت کا خیال رکھنے والی ٹیموں کو Sonnet 5 کے token rates پر نیا model دیتا ہے، جس کے کئی متعین evaluations میں نتائج بہتر ہیں اور output تیز ہونے کا Anthropic دعویٰ بھی ہے۔ عملی قدر task mix اور effort setting پر منحصر ہے۔ موجودہ integrations کی settings بھی دیکھنا ہوں گی۔ اگلا سب سے واضح موازنہ تنظیم کے اپنے workload میں درست نتائج، token use اور لگنے والے وقت کو ناپنا ہے۔
ذرائع اور مزید مطالعہ
- Anthropic کا Sonnet 5.5 اعلان اجرا کی تاریخ، رفتار اور task cost کے کمپنی کے دعوے، benchmark کا خلاصہ اور ابتدائی صارفین کے بیانات دیتا ہے۔ کارکردگی کے دعوؤں کو ہر تنظیم کے اپنے workload پر جانچنا چاہیے۔
- Anthropic کا Sonnet 5.5 system card benchmark tasks، harnesses، effort settings، fallback behavior اور بیرونی evaluations کی provenance دستاویز کرتا ہے۔ یہ model vendor کا بنیادی disclosure ہے، جس میں اسے فراہم کیے گئے بیرونی evaluations کے نتائج بھی شامل ہیں۔
- Claude Platform کا model page API IDs، رسائی، حدود اور token prices درج کرتا ہے۔ مکمل pricing page تصدیق کرتا ہے کہ Sonnet 5 اور 5.5 کی بنیادی قیمتیں برابر ہیں، اور cloud pricing کے فرق سمجھاتا ہے۔
- Sonnet 5.5 migration guide ان request settings کا اندراج کرتا ہے جو بدلتی ہیں یا errors دیتی ہیں۔ موجودہ integration کی مکمل checklist کے لیے یہی guide استعمال کریں۔



