Ai2 2 অক্টোবর AstaBrief 8B প্রকাশ করে, যা Asta-র Fast mode ফিচারে Generate a report ব্যবস্থার পেছনের মডেল। ডাউনলোডযোগ্য মডেলটি একটি গবেষণা-প্রশ্ন ও বৈজ্ঞানিক প্রবন্ধ থেকে সংগৃহীত উদ্ধৃতাংশ নেয়, তারপর এক ধাপে সূত্র-উল্লেখসহ প্রতিবেদন লেখে। গবেষকের জন্য জরুরি পার্থক্যটি হলো, প্রবন্ধগুলো কোথা থেকে এসেছে এবং সূত্রগুলো আসলে কোন দাবিকে সমর্থন করে: AstaBrief সরবরাহ করা প্রমাণের ভিত্তিতে লেখে; এটি নিজে সাহিত্য-অনুসন্ধান পরিষেবা নয়। Ai2-এর প্রকাশনা এবং মডেল কার্ড এই সীমারেখাটি ব্যাখ্যা করে।

মূল পরিবর্তন

  • কী বদলেছে: Ai2 AstaBrief-কে Asta-র চালু Fast mode-এ যুক্ত করেছে এবং মডেলের ওজন ও প্রশিক্ষণ-উপকরণ প্রকাশ করেছে।
  • কেন এটি গুরুত্বপূর্ণ: Ai2-এর ভাষ্য অনুযায়ী, গবেষণা দলগুলো প্রতিবেদন-লেখার এই মডেল পরিদর্শন বা নিজেদের প্রয়োজনে মানিয়ে নিতে পারে, এবং উন্মুক্ত-ওজনের মডেলটি নিজেদের অবকাঠামোতে চালাতে পারে।
  • এরপর কী দেখবেন: প্রতিবেদনের মান নির্ভর করে অনুসন্ধানে পাওয়া সাহিত্য এবং প্রতিটি গুরুত্বপূর্ণ দাবিকে তার মূল সূত্রের সঙ্গে মিলিয়ে দেখার ওপর। Asta-র Claude-চালিত Thinking mode আলাদা, বহু-ধাপের বিকল্প হিসেবে রয়েছে।

প্রশ্ন থেকে প্রতিবেদন

হোস্ট করা ব্যবস্থায় কাজ শুরু হয় Asta-র Generate a report ফিচার থেকে, যেখানে Fast mode AstaBrief ব্যবহার করে। Ai2 জানায়, তাদের প্রতিবেদন-ব্যবস্থা প্রশ্ন ও উদ্ধৃতাংশ মডেলকে দেওয়ার আগে প্রাসঙ্গিক সাহিত্য খুঁজে আনে। এরপর মডেল এক ধাপে প্রতিবেদন লেখে; Thinking mode-এ ব্যবহৃত উদ্ধৃতাংশ সংগ্রহ, ক্লাস্টার তৈরি এবং বিভাগ ধরে খসড়া লেখার ধাপগুলো এতে বাদ যায়। প্রকাশ্য ScholarQA repository বলছে, Semantic Scholar-এর passage ও keyword search দিয়ে লেখা খুঁজে নিয়ে সেগুলোকে পুনরায় ক্রমায়ন করা হয়; এর lite implementation পুনরায় ক্রমায়িত সূত্র থেকে প্রম্পট তৈরি করে এবং নির্ধারিত generator-কে ডাকে। এগুলো নথিতে বর্ণিত উপাদান; BIG CHANGE-এর পক্ষ থেকে চালু Asta পরিষেবার পরীক্ষা নয়।

ডাউনলোডযোগ্য ব্যবস্থার জন্য AstaBrief model card তাদের সংযুক্ত প্রম্পট-ফরম্যাট এবং প্রশ্ন ও বিভাগভিত্তিক সূত্রসহ ইনপুট দেওয়ার পরামর্শ দেয়। এতে উদাহরণ হিসেবে transformers/vLLM inference code রয়েছে, যেখানে আউটপুটের সর্বোচ্চ সীমা 4,096 tokens। কার্ডের উদাহরণে model_name কে SFT checkpoint হিসেবে নির্ধারণ করা হয়েছে, অথচ পাতায় পরবর্তী DPO-টিউন করা AstaBrief_8B মডেলের কথা বলা হয়েছে; উদাহরণটি মুদ্রিত অবস্থাতেই চূড়ান্ত মডেল চালায় ধরে না নিয়ে checkpoint বাছাইকারী গবেষকের এই অমিল মেটানো উচিত। Ai2 আরও উদাহরণ ScholarQA lite কোড দিয়েছে, যা গবেষকেরা নিজেদের PDF থেকে প্রতিবেদন তৈরিতে মানিয়ে নিতে পারেন। লিংক করা ডিরেক্টরিটি কোড; এতে ন্যূনতম হার্ডওয়্যার-চাহিদাসহ ব্যবহার-প্রস্তুত PDF ব্যবস্থা নথিভুক্ত নেই।

স্থানীয় পরীক্ষা চালানোর একটি ব্যবহারিক ধারা হলো: ব্যবহারের অনুমতি আছে এমন প্রবন্ধ সংগ্রহ করা; প্রবন্ধের শনাক্তকারীসহ প্রাসঙ্গিক অংশ বের করে বেছে নেওয়া; কার্ডের পরামর্শমতো প্রশ্ন ও সূত্র সাজানো; বেছে নেওয়া checkpoint চালানো; এবং তৈরি প্রতিবেদনটি ওই অংশ ও মূল প্রবন্ধের পাশে রেখে পরীক্ষা করা। সূত্রে নথিভুক্ত উপাদান এগুলো; BIG CHANGE এই ধাপগুলো চালায়নি। পুরো স্থানীয় প্রতিরূপ তৈরিতে অনুসন্ধান, PDF পার্সিং, সূত্র সামলানো এবং পরিবেশনের সিদ্ধান্তও দরকার, যা শুধু মডেলের ওজন সরবরাহ করে না।

গদ্য ব্যবহারের আগে প্রমাণ যাচাই করুন

প্রথমে অনুসন্ধানে পাওয়া উপকরণ দেখুন। generator-কে দেওয়া প্রশ্ন এবং প্রবন্ধ বা PDF-এর তালিকা নথিবদ্ধ রাখুন। কোনো গবেষণা বাদ পড়লে বা অপ্রাসঙ্গিক উদ্ধৃতাংশ ঢুকলে AstaBrief একটি শব্দ লেখার আগেই উত্তর বেঁকে যেতে পারে। এরপর গুরুত্বপূর্ণ প্রতিটি দাবির জন্য উদ্ধৃত প্রবন্ধ খুলুন। উদ্ধৃত অংশটি বাক্যটির নির্দিষ্ট বক্তব্য—এর মধ্যে জনসমষ্টি, পদ্ধতি, তারিখ ও নিশ্চয়তার মাত্রাসহ—সমর্থন করে কি না দেখুন। সূত্রটি সত্যি ও বিষয়-সম্পর্কিত হতে পারে, অথচ প্রতিবেদনে একটি নমুনার ফল পুরো ক্ষেত্রে সাধারণীকরণ করা হতে পারে, কিংবা বর্ণনামূলক ফলকে পরামর্শে বদলে ফেলা হতে পারে। Ai2 তাদের প্রকাশনায় দাবির পরিধি বেড়ে যাওয়ার এই ত্রুটিটি স্পষ্টভাবে চিহ্নিত করেছে।

সবশেষে, সূত্র উল্লেখ করা হয়নি এমন গুরুত্বপূর্ণ দাবি এবং সংগৃহীত প্রবন্ধের সংকীর্ণ একটি অংশের ওপর প্রতিবেদন বারবার নির্ভর করছে কি না দেখুন। Ai2 বলেছে, প্রশিক্ষণ-প্রতিবেদনে উদ্ধৃতির ঘনত্ব যাচাই করায় তাদের উন্নয়নের ফল ভালো হয়েছে। সূত্র-উল্লেখ কেন জরুরি, তা এই পর্যবেক্ষণ ব্যাখ্যা করে; কিন্তু শুধু উদ্ধৃতির ঘনত্ব থেকে উদ্ধৃত দাবিগুলো বিশ্বস্ত কি না প্রতিষ্ঠিত হয় না। তৈরি প্রতিবেদনকে প্রবন্ধের সঙ্গে মিলিয়ে সংশোধন করার জন্য প্রাথমিক সংশ্লেষ হিসেবে ধরুন—বিশেষত গবেষণায় উদ্ধৃত করা বা গুরুত্বপূর্ণ সিদ্ধান্ত নেওয়ার আগে।

প্রকাশিত মূল্যায়ন কী প্রতিষ্ঠা করে

Ai2 জানায়, Asta-র পুরো কর্মধারায় Fast mode-এ গড়ে সময় লেগেছে প্রতি প্রতিবেদনে 51.1 সেকেন্ড, যেখানে Thinking mode-এ লেগেছে 178.5 সেকেন্ড—এই তুলনায় প্রায় 3.5 গুণ দ্রুত। AstaBrief model card-এ কম্পিউটারবিজ্ঞানভিত্তিক ScholarQA-CS2 প্রশ্ন ও DeepScholarBench-এ মডেলের ফল দেওয়া হয়েছে। প্রকাশনায় আরও আছে আলাদা, ছোট পরিসরের মানব-তুলনা: তিনজন গবেষক 14টি প্রশ্ন দিয়েছেন। এগুলো Ai2-এর নিজস্ব ব্যবস্থা ও পরীক্ষাসমষ্টি নিয়ে মূল্যায়ন, কোনো নির্দিষ্ট প্রতিবেদন নির্ভুল হবে—তার স্বাধীন প্রমাণ নয়। প্রকাশনায় বলা হয়েছে, অধিকাংশ প্রশিক্ষণ ও মূল্যায়ন হয়েছে 2025 সালে এবং পূর্ণাঙ্গ মূল্যায়ন বর্তমানে অগ্রণী মডেলগুলোর সঙ্গে আবার চালানো হয়নি।

চূড়ান্ত checkpoint Apache 2.0 লাইসেন্সে উন্মুক্ত, এবং Ai2 প্রশিক্ষণ-ডেটাসেট ও প্রম্পটগুলো একটি AstaBrief collection-এ তালিকাভুক্ত করেছে। মডেল কার্ডে বলা হয়েছে, Ai2-এর দায়িত্বশীল-ব্যবহার নির্দেশনার অধীনে মডেলটি গবেষণা ও শিক্ষার জন্য তৈরি। প্রশিক্ষণ-নোটে DPO প্রশিক্ষণে 8টি H100 GPU ব্যবহারের কথা আছে; এটি ইনফারেন্সের জন্য প্রকাশিত ন্যূনতম চাহিদা নয়। পর্যালোচিত প্রাথমিক উপকরণে হোস্ট করা Asta ব্যবহারে প্রতি প্রতিবেদনের মূল্য, স্থানীয় ব্যবহারের ন্যূনতম GPU বিবরণ বা নির্ভরযোগ্য স্থানীয় খরচের হিসাব নেই। স্থাপনার পরিকল্পনা করলে নিজের ব্যবস্থার খরচ নির্ধারণ করতে হবে।

সূত্র ও আরও পড়ুন

  • Ai2-এর 2 অক্টোবরের প্রকাশনা চালু Fast mode, এক-ধাপের নকশা, সময় এবং মূল্যায়নের সীমা ব্যাখ্যা করে। কার্যকারিতা-সংক্রান্ত দাবিগুলো Ai2-এর নিজস্ব।
  • AstaBrief 8B model card লাইসেন্স, উদ্দেশ্যপ্রণোদিত ব্যবহার, প্রম্পটের সুপারিশ এবং ইনফারেন্সের উদাহরণ—যেখানে SFT checkpoint-এর নামও আছে—দেয়।
  • AstaBrief collection প্রকাশিত final/SFT checkpoint, ডেটাসেট ও প্রম্পটের তালিকা দেয়; এগুলো থাকলেই শুরু থেকে শেষ পর্যন্ত স্থানীয় প্রতিরূপ সম্ভব, তা প্রমাণ হয় না।
  • ScholarQA কোড ও নথি অনুসন্ধান ব্যবস্থা ব্যাখ্যা করে; lite generator দেখায়, পুনরায় ক্রমায়িত সূত্র কীভাবে এক-ধাপের প্রজন্ম-প্রম্পট হয়। আমরা নথি ও কোড পরিদর্শন করেছি; চালাইনি।
  • ScholarQA-CS2 evaluation repository মানদণ্ডের কোড ও ডেটা—যার মধ্যে মূল্যায়ন-রুব্রিক তৈরিও রয়েছে—সরবরাহ করে। এটি পরীক্ষার নকশা বুঝতে সাহায্য করে; AstaBrief-এর প্রকাশিত ফল স্বাধীনভাবে যাচাই করে না।