أطلقت Anthropic نموذج Claude Sonnet 5.5 في 28 سبتمبر بالأسعار نفسها لرموز API المطبقة على Sonnet 5. وتقول الشركة إن النموذج ينتج المخرجات بسرعة أكبر بأكثر من 30%، وقد تكون تكلفة المهمة أقل بما يصل إلى 30% لأنه يستخدم رموزاً أقل. وهذان ادعاءان منفصلان: فسعر القائمة لم ينخفض، وتظل فاتورة المهمة معتمدة على المطالبة والمخرجات والأدوات وإعداد مستوى الجهد.

بالنسبة إلى المطورين، يقترن الإصدار بمكسب محتمل في الكفاءة وتغييرات قد تعطل تكاملات Sonnet 5. وتدرج وثائق Anthropic معرّف النموذج claude-sonnet-5-5 في Claude API وGoogle Cloud وMicrosoft Foundry، ومعرّف anthropic.claude-sonnet-5-5 في Amazon Bedrock. وتذكر صفحة النموذج نافذة سياق تبلغ مليون رمز وحداً أقصى للمخرجات قدره 128,000 رمز. كما تسرد الإتاحة عبر Claude Platform على AWS. وقد تختلف الفوترة وإعدادات المناطق لدى مزودي الخدمات السحابية عن الأسعار المنشورة لـClaude API.

ما الذي تظهره التقييمات

في تجربة Anthropic على Terminal-Bench 4.0، أكمل Sonnet 5.5 نسبة 70.6% من 66 مهمة طرفية، مقارنةً بـ10.3% لـSonnet 5 في جدول الإصدار. وتصف بطاقة النظام مجموعة صعبة من مهام العلوم والهندسة في بيئات سطر أوامر ضمن حاويات. وشغّلت Anthropic Claude Code في الوضع الأساسي وبأقصى مستوى للتفكير، ومنعت الوصول إلى الإنترنت وخزّنت الموارد اللازمة للمهام. وأحالت الضمانات 1.2% من طلبات Sonnet 5.5 إلى نموذج احتياطي، ما أثّر في 1.5% من التجارب. وتفيد Anthropic بأن الخطأ المعياري لنتيجة Sonnet 5.5 يبلغ 2.5 نقطة مئوية. وتقيس النتيجة هذا الإعداد؛ ولا تثبت التحسن نفسه في مستودعات المطورين الفعلية.

بحسب بطاقة نظام Anthropic، شغّلت Cognition اختبار FrontierCode في Claude Code على 150 مهمة من المستودعات، وأبلغت عن نتيجة Sonnet 5.5 قدرها 52.1% على مجموعة Main عند مستوى الجهد xhigh. وانخفضت النتيجة إلى 46.2% عند مستوى max، ويرجع ذلك جزئياً إلى أن مراجعة الوكيل وتعديلاته الإضافية تجاوزت في حالات درستها Cognition نطاق المعيار أو المهلة الزمنية. وشغّلت Cursor معيار CursorBench 4.0 ضمن منصة الوكيل الإنتاجية الخاصة بها على مهام مستمدة من جلسات Cursor. وتظهر نتيجة Sonnet 5.5 البالغة 55.5% عند مستوى max في جدول نتائج أُرسل إلى Anthropic؛ وقدّرت Anthropic تكلفة النموذج لكل مهمة من أعداد الرموز التي وفرتها Cursor. واستخدمت هذه التقييمات الخارجية مهام ومنصات تشغيل مختلفة، كما أن أرقام Sonnet 5.5 الواردة هنا منقولة عبر بطاقة نظام Anthropic.

وشغّلت Artificial Analysis أيضاً النموذج قبل إصداره على GDPval-AA، الذي يقارن مخرجات العمل عبر 220 مهمة من 44 مهنة، وعلى AA-Briefcase، وهي مجموعة من مشروعات العمل المعرفي المترابطة. وتورد البطاقة نتيجتي Elo قدرهما 1844 و1811 عند أقصى مستوى للجهد على الترتيب، وهما قريبتان من Opus 5.5 في هذين الاختبارين. وتقول Anthropic إن النسخة السابقة للإصدار احتوت خللاً في المخرجات المنظمة ربما أثّر في النتائج، وقد أصلحته منذ ذلك الحين. وتقارن هذه التقييمات مخرجات المعايير في تلك الظروف؛ ولا تثبت أن Sonnet 5.5 سيضاهي Opus في أعمال القارئ المفتوحة النهاية. وتقول Anthropic نفسها إن Opus ما زال أقوى في الأعمال المعقدة التي تتطلب حكماً متواصلاً.

وتصف اقتباسات Anthropic عن العملاء الأوائل سير عمل أسرع واستخداماً لرموز أقل في اختباراتهم الخاصة. واستخدم العملاء المذكورون مهامهم وأساليبهم، لذلك لا تثبت رواياتهم مقياساً مشتركاً للإنتاجية. ولم تختبر BIG CHANGE Sonnet 5.5 أو تتحقق من أرقام المورد بشأن السرعة وتكلفة المهام ضمن سير عمل حي.

الأسعار والترحيل

سعر القائمة في Claude API هو دولاران لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج، ولم يتغير عن Sonnet 5. وتبلغ كلفة كتابة ذاكرة التخزين المؤقت لمدة خمس دقائق 2.50 دولار لكل مليون رمز، فيما تكلف قراءتها 0.20 دولار. وتجمع الرسوم البيانية لدى Anthropic حول تكلفة المهمة بين أسعار القائمة والرموز المستهلكة عند مستويات جهد محددة. ولا تثبت هذه الرسوم وفراً عاماً بنسبة 30%. وينبغي للفريق الذي يقارن النماذج تشغيل مهامه التمثيلية عند مستوى الجودة الذي يحتاجه، مع تسجيل استهلاك الرموز والوقت المنقضي والنجاح.

قد لا يكفي تغيير معرّف النموذج وحده، وقد يؤدي إلى فشل شيفرة Messages API القائمة. أما إعداد Sonnet 5 thinking: {"type": "disabled"} فيعيد خطأً في الإصدار 5.5؛ والبديل الموثق لتجنب التفكير المسبق هو thinking: {"type": "between_tools"}، ويُقبل عند مستويات الجهد المنخفض والمتوسط والعالي. ويكون التفكير التكيفي مفعّلاً عند حذف الحقل، ويضبط Claude API مستوى الجهد الافتراضي على العالي. أما فرض tool_choice بقيمتي any و tool فيؤدي أيضاً إلى أخطاء؛ وتوجه Anthropic المطورين إلى auto، ومخططات الأدوات الصارمة حيثما كانت مدعومة. أما Sonnet 5.5 على Amazon Bedrock فلا يدعم استخدام الأدوات الصارم؛ لذا استخدم auto من دون strict، وتحقق من مدخلات الأدوات في شيفرة التطبيق. وقد تحتاج الشيفرة التي تعرض نصاً بين استدعاءات الأدوات إلى معالجة تحديثات التقدم المعادة ضمن كتل التفكير. وتحتاج تكاملات استخدام الكمبيوتر عبر Claude API وGoogle Cloud إلى مجموعة الأدوات الأحدث computer_toolset_20260801، بينما يحتفظ Bedrock بإصدار computer_20251124 الأقدم. ويسرد دليل الترحيل مزيداً من تغييرات التوافق.

التغيير الأبرز

يقدم Sonnet 5.5 للفرق التي تراعي الكلفة نموذجاً جديداً بأسعار الرموز نفسها في Sonnet 5، مع نتائج أعلى في عدد من التقييمات المحددة وادعاء Anthropic بأنه أسرع في إنتاج المخرجات. وتعتمد قيمته العملية على مزيج المهام وإعداد مستوى الجهد. وتحتاج التكاملات القائمة أيضاً إلى مراجعة الإعدادات. وأوضح مقارنة تالية هي قياس نتائج المهام الصحيحة واستهلاك الرموز والوقت المنقضي في عبء العمل الخاص بالمؤسسة.

المصادر ومزيد من القراءة

  • إعلان Anthropic عن Sonnet 5.5 يورد تاريخ الإصدار وادعاءات الشركة بشأن السرعة وتكلفة المهام وملخص المعايير وروايات العملاء الأوائل. وتتطلب ادعاءات الأداء تحققاً خاصاً بكل عبء عمل.
  • بطاقة نظام Anthropic لـSonnet 5.5 توثق مهام المعايير ومنصات التشغيل وإعدادات الجهد وسلوك النموذج الاحتياطي ومصادر التقييمات الخارجية. وهي إفصاح أولي من مزود النموذج، يشمل نتائج خارجية أُرسلت إليه.
  • صفحة نموذج Claude Platform تسرد معرّفات API والإتاحة والحدود وأسعار الرموز. صفحة الأسعار الكاملة تؤكد تطابق الأسعار الأساسية لـSonnet 5 و5.5 وتوضح اختلافات أسعار الخدمات السحابية.
  • دليل الترحيل إلى Sonnet 5.5 يوثق إعدادات الطلب التي تغيرت أو أصبحت تسبب أخطاء. راجعه للقائمة الكاملة اللازمة لتكامل قائم.