أطلقت Ai2 في 2 أكتوبر نموذج AstaBrief 8B بوصفه النموذج الذي يشغّل الوضع السريع في ميزة «إنشاء تقرير» في Asta. يتلقى النموذج القابل للتنزيل سؤالًا بحثيًا ومقتطفات مسترجعة من أوراق علمية، ثم يكتب تقريرًا موثقًا بالمراجع في مرور واحد. والتمييز المفيد للباحث هو مصدر الأوراق وما تدعمه المراجع فعليًا: يكتب AstaBrief استنادًا إلى أدلة مقدمة إليه؛ لكنه ليس، بمفرده، خدمة للبحث في الأدبيات العلمية. إعلان Ai2 وبطاقة النموذج من Ai2 يوضحان هذا الحد الفاصل.
التغيير الأبرز
- ما الذي تغيّر: أدرجت Ai2 نموذج AstaBrief في الوضع السريع المتاح الآن ضمن Asta، وأصدرت أوزان النموذج ومواد تدريبه.
- لماذا يهم ذلك: يمكن لمجموعات البحث فحص مولّد التقارير أو تكييفه وتشغيل النموذج ذي الأوزان المفتوحة على بنيتها التحتية الخاصة، وفقًا لـAi2.
- ما الذي ينبغي متابعته: تعتمد جودة التقرير على الأدبيات المسترجعة وعلى التحقق من كل ادعاء مهم بالرجوع إلى مصدره. ويظل وضع التفكير في Asta، المدعوم بـClaude، خيارًا منفصلًا متعدد الخطوات.
من السؤال إلى التقرير
يبدأ المسار المستضاف من ميزة «إنشاء تقرير» في Asta، حيث يستخدم الوضع السريع نموذج AstaBrief. وتقول Ai2 إن نظام التقارير يسترجع الأدبيات ذات الصلة قبل تمرير السؤال والمقتطفات إلى النموذج. ثم يكتب النموذج التقرير في مرور واحد، متجاوزًا مراحل استخراج الاقتباسات وتجميعها وصياغة الأقسام تباعًا التي يستخدمها وضع التفكير. ويصف مستودع ScholarQA العام الاسترجاع من البحث في المقاطع والكلمات المفتاحية لدى Semantic Scholar، ثم إعادة ترتيب النتائج؛ أما التنفيذ المبسّط فيبني مطالبة من المراجع المعاد ترتيبها ويستدعي المولّد المُعدّ. هذه مكوّنات موثقة، وليست اختبارًا لخدمة Asta المباشرة أجراه BIG CHANGE.
أما في المسار القابل للتنزيل، فتوصي بطاقة نموذج AstaBrief باستخدام تنسيق المطالبة المرتبط بها وإدخال يتضمن السؤال ومراجع الأقسام. وتوفر أمثلة على transformers/vLLM الاستدلال بحد أقصى قدره 4,096 رمزًا للإخراج. ويحدد مثال البطاقة model_name إلى نقطة تحقق SFT، بينما تصف الصفحة نفسها نقطة تحقق لاحقة مضبوطة بـDPO وهي AstaBrief_8B؛ لذا ينبغي للباحث الذي يختار نقطة تحقق أن يحل هذا التباين بدل افتراض أن المثال يشغّل النموذج النهائي كما هو معروض. كما تربط Ai2 بشفرة ScholarQA lite النموذجية التي يمكن للباحثين تكييفها لإعداد تقارير من ملفات PDF الخاصة بهم. والدليل المرتبط هو شيفرة، وليس إعدادًا موثقًا جاهزًا للاستخدام مع ملفات PDF بحد أدنى معلن لمتطلبات الأجهزة.
وهذا يتيح تسلسلًا عمليًا لتجربة محلية: الحصول على أوراق يُسمح باستخدامها؛ واستخراج المقاطع ذات الصلة واختيارها مع معرّفات الأوراق؛ وتنسيق السؤال والمراجع كما توصي البطاقة؛ وتشغيل نقطة التحقق المختارة؛ ثم فحص التقرير الناتج إلى جانب تلك المقاطع والأوراق الأصلية. توثق المصادر هذه المكونات، لكن BIG CHANGE لم ينفذ هذه الخطوات. كما يتطلب إنشاء نسخة محلية كاملة اختيار أدوات للاسترجاع وتحليل ملفات PDF ومعالجة المراجع والاستضافة، وهي أمور لا توفرها أوزان النموذج وحدها.
تحقق من الأدلة قبل استخدام النص
ابدأ بعملية الاسترجاع. سجّل الاستعلام ومجموعة الأوراق أو ملفات PDF المقدمة إلى المولّد. فقد تؤدي دراسة محذوفة أو مقتطف غير ذي صلة إلى تحريف الإجابة قبل أن يكتب AstaBrief كلمة واحدة. ثم افتح كل ورقة مستشهد بها للتحقق من الادعاءات المهمة. وتأكد من أن المقطع المستشهد به يدعم الجملة المحددة، بما في ذلك مجتمع الدراسة ومنهجيتها وتاريخها ودرجة اليقين فيها. قد يكون المرجع حقيقيًا وذا صلة، بينما يعمم التقرير نتيجة من عينة واحدة على مجال بأكمله أو يحوّل نتيجة وصفية إلى نصيحة. وقد أشارت Ai2 صراحةً إلى إخفاق توسيع نطاق الادعاء هذا في إعلانها.
وأخيرًا، ابحث عن الادعاءات المهمة غير المسندة بالمراجع، وعن المواضع التي يعتمد فيها التقرير مرارًا على شريحة ضيقة من الأوراق المسترجعة. وتقول Ai2 إن تصفية تقارير التدريب بحسب كثافة الاستشهادات حسّنت نتائج تطويرها. يوضح ذلك أهمية الإسناد، لكن كثافة الاستشهادات وحدها لا تثبت أمانة نقل الادعاءات الواردة في المصادر. تعامل مع التقرير المُنشأ على أنه خلاصة أولية ينبغي مراجعتها بالرجوع إلى الأوراق، ولا سيما قبل الاستشهاد به في بحث أو اتخاذ قرار ذي تبعات.
ما الذي يثبته التقييم المنشور
تفيد Ai2 بأن متوسط الزمن عبر مسار Asta كان في الوضع السريع 51.1 ثانية لكل تقرير مقارنةً بـ 178.5 ثانية في وضع التفكير، أي أسرع بنحو 3.5 مرات في تلك المقارنة. وتعرض بطاقة النموذج نتائج AstaBrief على أسئلة علوم الحاسوب في ScholarQA-CS2 وعلى DeepScholarBench، كما يصف الإعلان مقارنة بشرية منفصلة وصغيرة شارك فيها ثلاثة باحثين و14 سؤالًا. هذه تقييمات Ai2 لأنظمتها ومجموعات اختبارها، وليست إثباتًا مستقلًا على دقة أي تقرير بعينه. ويذكر الإعلان أن معظم التدريب والتقييم أُجريا في 2025، وأن التقييم الكامل لم يُعَد إجراؤه باستخدام أحدث النماذج الرائدة المتاحة حاليًا.
نقطة التحقق النهائية متاحة للعامة بموجب ترخيص Apache 2.0، وتدرج Ai2 مجموعات بيانات التدريب والمطالبات ضمن مجموعة AstaBrief. وتقول بطاقة النموذج إنه مخصص للبحث والتعليم وفق إرشادات Ai2 للاستخدام المسؤول. وتشير ملاحظة التدريب إلى استخدام ثماني وحدات معالجة رسومية H100 لتدريب DPO؛ وهذا ليس حدًا أدنى منشورًا للاستدلال. ولا تحدد المواد الأولية التي راجعناها سعرًا لكل تقرير في خدمة Asta المستضافة، أو حدًا أدنى لمواصفات وحدة معالجة الرسوميات محليًا، أو تكلفة محلية موثوقة لكل تقرير. وعلى من يخطط للنشر تقدير هذه التكاليف وفق إعداداته الخاصة.
المصادر ومواد إضافية
- يشرح إعلان Ai2 الصادر في 2 أكتوبر الوضع السريع والتصميم ذي المرور الواحد والأزمنة وحدود التقييم. ادعاءات الأداء صادرة عن Ai2 نفسها.
- بطاقة نموذج AstaBrief 8B تعرض الترخيص والاستخدام المقصود وتوصية المطالبة ومثال الاستدلال، بما في ذلك اسم نقطة تحقق SFT المستخدمة في المثال.
- مجموعة AstaBrief تسرد نقاط التحقق ومجموعات البيانات والمطالبات المنشورة؛ ولا يثبت وجودها إمكانية إعادة إنتاج المسار الكامل محليًا.
- شفرة ScholarQA ووثائقه تشرح نظام الاسترجاع؛ أما المولّد المبسّط فيوضح كيف تتحول المراجع المعاد ترتيبها إلى مطالبة لتوليد النص في مرور واحد. فحصنا الوثائق والشيفرة؛ ولم نشغّلهما.
- مستودع تقييم ScholarQA-CS2 يضم شيفرة الاختبار وبياناته، بما في ذلك معلومات عن بناء معايير التقييم. وهو يساعد على شرح تصميم الاختبار، لكنه لا يتحقق بصورة مستقلة من الدرجات المعلنة لـAstaBrief.



