Anthropic ২৮ সেপ্টেম্বর Claude Sonnet 5.5 প্রকাশ করেছে; Sonnet 5-এর মতোই API token-এর দাম রাখা হয়েছে। কোম্পানির দাবি, মডেলটি 30%-এর বেশি দ্রুত output তৈরি করে এবং কম token ব্যবহারের কারণে প্রতি কাজে খরচ 30% পর্যন্ত কম হতে পারে। এগুলো আলাদা দাবি: তালিকাভুক্ত দাম কমেনি, আর প্রতিটি কাজের বিল নির্ভর করে prompt, output, tool এবং effort setting-এর ওপর।

developer-দের জন্য প্রকাশনাটিতে সম্ভাব্য উপকারী দক্ষতা-বৃদ্ধির পাশাপাশি Sonnet 5-এর integration ভেঙে দিতে পারে এমন পরিবর্তনও আছে। Anthropic-এর documentation-এ Claude API, Google Cloud ও Microsoft Foundry-র জন্য model ID claude-sonnet-5-5 এবং Amazon Bedrock-এর জন্য model ID anthropic.claude-sonnet-5-5 ব্যবহার করা হয়েছে। model page-এ context window এক million token এবং সর্বোচ্চ output 128,000 token বলা হয়েছে। AWS-এ Claude Platform দিয়েও access তালিকাভুক্ত। cloud provider-এর billing ও অঞ্চলভিত্তিক setting Claude API-র প্রকাশিত rate থেকে আলাদা হতে পারে।

মূল্যায়নের ফল কী বলে

Anthropic-এর Terminal-Bench 4.0 পরীক্ষায় Sonnet 5.5 66টি terminal task-এর 70.6% সম্পন্ন করেছে; release table-এ Sonnet 5-এর ফল 10.3%। system card-এ container-এর ভেতর command-line environment-এ কঠিন science ও engineering task-এর কথা বলা হয়েছে। Anthropic সর্বোচ্চ thinking effort-এ Claude Code-এর bare mode চালায়, internet access বন্ধ রাখে এবং task-এর জন্য দরকারি resource cache করে। সুরক্ষাব্যবস্থা Sonnet 5.5-এর 1.2% request fallback model-এ পাঠায়, যা trial-এর 1.5%-কে প্রভাবিত করে। Sonnet 5.5-এর ফলের standard error Anthropic জানিয়েছে 2.5 percentage point। এই score ওই পরীক্ষার setup মাপে; developer-দের নিজস্ব repository-তে একই উন্নতি হবে, তা প্রতিষ্ঠা করে না।

Anthropic-এর system card অনুযায়ী, Cognition Claude Code-এ FrontierCode চালিয়ে 150টি repository task পরীক্ষা করে; xhigh effort-এ Sonnet 5.5 তাদের Main set-এ 52.1% পায়। max effort-এ score কমে 46.2% হয়; Cognition-এর দেখা কয়েকটি ক্ষেত্রে agent-এর অতিরিক্ত review ও edit benchmark-এর পরিধি বা সময়সীমা ছাড়িয়ে যাওয়ায় এর আংশিক ব্যাখ্যা মেলে। Cursor তাদের production agent harness-এ Cursor session থেকে নেওয়া task দিয়ে CursorBench 4.0 চালায়। Anthropic-কে পাঠানো ফলের table-এ max effort-এ Sonnet 5.5-এর score 55.5%; Cursor-এর token count থেকে Anthropic প্রতি কাজের model cost হিসাব করেছে। এসব বাইরের মূল্যায়নে আলাদা task ও harness ছিল, আর এখানে Sonnet 5.5-এর ফল Anthropic-এর system card-এর মাধ্যমে জানা।

Artificial Analysis-ও release-এর আগের model-টি GDPval-AA-তে পরীক্ষা করে। এতে 44টি পেশার 220টি task-এ কাজের ফল তুলনা করা হয়; তারা সংযুক্ত জ্ঞানভিত্তিক কাজের প্রকল্প AA-Briefcase-ও চালায়। system card-এ max effort-এ যথাক্রমে Elo score 1844 ও 1811 জানানো হয়েছে, যা ওই পরীক্ষায় Opus 5.5-এর কাছাকাছি। Anthropic বলেছে, release-পূর্ব deployment-এ structured output-এর একটি bug ফলকে প্রভাবিত করে থাকতে পারে; সেটি পরে ঠিক করা হয়েছে। এই তুলনা নির্দিষ্ট শর্তে benchmark output মাপে; পাঠকের উন্মুক্ত পরিসরের কাজে Sonnet 5.5 Opus-এর সমান হবে, তা দেখায় না। Anthropic নিজেই বলেছে, দীর্ঘ সময় ধরে বিচার-বিবেচনা দরকার এমন জটিল কাজে Opus এখনো শক্তিশালী।

Anthropic-এর launch ঘোষণায় উদ্ধৃত প্রাথমিক গ্রাহকেরা নিজেদের পরীক্ষায় দ্রুত workflow ও কম token ব্যবহারের কথা বলেছেন। তাঁদের task ও পদ্ধতি আলাদা, তাই এ বিবরণ থেকে সবার জন্য প্রযোজ্য productivity মাপ প্রতিষ্ঠা হয় না। BIG CHANGE Sonnet 5.5 চালিয়ে দেখেনি বা বাস্তব workflow-তে vendor-এর গতি ও প্রতি-কাজের খরচের হিসাব যাচাই করেনি।

দাম ও migration

Claude API-তে তালিকাভুক্ত দাম প্রতি million input token-এ $2 এবং প্রতি million output token-এ $10—Sonnet 5-এর মতোই। পাঁচ মিনিটের cache write-এর খরচ প্রতি million token-এ $2.50 এবং cache read $0.20। Anthropic-এর প্রতি-কাজের খরচের chart-এ নির্দিষ্ট effort স্তরে ব্যবহৃত token-এর সঙ্গে তালিকাভুক্ত rate মিলিয়ে হিসাব করা হয়েছে। এতে সবার ক্ষেত্রে 30% সাশ্রয় হবে—এমন প্রমাণ হয় না। কোন model নেবে তা তুলনা করতে দলগুলোর উচিত নিজেদের প্রতিনিধিত্বমূলক task চালানো, দরকারি মানের সীমা ধরে token ব্যবহার ও সময় নথিভুক্ত করা এবং কাজ সফল হয়েছে কি না দেখা।

বিদ্যমান Messages API code-এ শুধু model ID বদলালে কাজ নাও করতে পারে। Sonnet 5-এর thinking: {"type": "disabled"} parameter 5.5-এ error দেয়; শুরুতেই thinking এড়ানোর নথিভুক্ত বিকল্প হলো thinking: {"type": "between_tools"}, যা low, medium ও high effort-এ গ্রহণ করা হয়। field বাদ দিলে adaptive thinking চালু থাকে, আর Claude API-তে default effort high। জোর করে tool_choice-এর any এবং tool ব্যবহার করলেও error আসে; Anthropic developer-দের auto ব্যবহার করতে এবং সমর্থিত ক্ষেত্রে strict tool schema দিতে বলে। Amazon Bedrock-এ Sonnet 5.5-এর strict tool use নেই: auto ছাড়া strict ব্যবহার করুন এবং application code-এ tool input যাচাই করুন। tool call-এর মাঝখানে লেখা দেখায়—এমন code-এ thinking block-এ আসা অগ্রগতির update সামলাতে হতে পারে। Claude API ও Google Cloud-এ computer-use integration-এর জন্য নতুন computer_toolset_20260801 toolset দরকার; Bedrock-এ আগের computer_20251124 version-টিই থাকে। migration guide-এ আরও compatibility পরিবর্তন আছে।

মূল পরিবর্তন

Sonnet 5.5-এ খরচ-সচেতন দলগুলো Sonnet 5-এর token rate-এই নতুন model পাচ্ছে; নির্দিষ্ট কয়েকটি মূল্যায়নে ফল বেশি এবং Anthropic-এর দাবি অনুযায়ী output দ্রুত। বাস্তবে কতটা কাজে দেবে, তা নির্ভর করে task-এর ধরন ও effort setting-এর ওপর। বিদ্যমান integration-এ setting-ও পর্যালোচনা করতে হবে। পরের সবচেয়ে স্পষ্ট তুলনা হবে প্রতিষ্ঠানের নিজস্ব কাজের ধরনে সঠিক ফল, token ব্যবহার ও সময় মেপে দেখা।

সূত্র ও আরও পাঠ

  • Anthropic-এর Sonnet 5.5 ঘোষণায় প্রকাশের তারিখ, গতি ও প্রতি-কাজের খরচ নিয়ে কোম্পানির দাবি, benchmark-এর সারাংশ এবং প্রাথমিক গ্রাহকদের বিবরণ আছে। কর্মদক্ষতার দাবি নির্দিষ্ট workload-এ যাচাই করা দরকার।
  • Anthropic-এর Sonnet 5.5 system card-এ benchmark-এর task ও harness, effort setting, fallback-এর আচরণ এবং বাইরের মূল্যায়নের উৎস নথিভুক্ত। বাইরে চালানো ফলসহ এটি model vendor-এর নিজস্ব প্রাথমিক প্রকাশনা।
  • Claude Platform-এর model page-এ API ID, access, সীমা ও token-এর দাম দেওয়া আছে। সম্পূর্ণ pricing page নিশ্চিত করে যে Sonnet 5 ও 5.5-এর base rate একই; cloud-এ দামের পার্থক্যও ব্যাখ্যা করে।
  • Sonnet 5.5-এ migration guide-এ যেসব request setting বদলায় বা error ফেরত দেয় তা নথিভুক্ত। বিদ্যমান integration-এর পূর্ণ checklist-এর জন্য এটি দেখুন।