Ai2 ने 2 ऑक्टोबर रोजी AstaBrief 8B जारी केले; ते Fast mode मध्ये वापरले जाणारे मॉडेल आहे, जे Asta मधील Generate a report सुविधेत चालते. डाउनलोड करता येणारे हे मॉडेल संशोधन-प्रश्न आणि वैज्ञानिक लेखांतून मिळवलेले उतारे घेते, मग एका टप्प्यात संदर्भयुक्त अहवाल लिहिते. संशोधकासाठी महत्त्वाचा फरक म्हणजे लेख कुठून येतात आणि संदर्भ प्रत्यक्षात कोणत्या दाव्याला आधार देतात: AstaBrief दिलेल्या पुराव्यावरून लिहिते; ती स्वतः साहित्य-शोध सेवा नाही. Ai2 ची घोषणा आणि मॉडेल कार्ड ही मर्यादा स्पष्ट करतात.
मुख्य बदल
- काय बदलले: Ai2 ने AstaBrief ला Asta च्या थेट Fast mode मध्ये आणले आणि मॉडेलचे वेट्स व प्रशिक्षण-साहित्य प्रसिद्ध केले.
- हे महत्त्वाचे का: Ai2 च्या मते, संशोधन-संघ अहवाल-निर्मितीचे मॉडेल तपासू किंवा आपल्या गरजेनुसार बदलू शकतात आणि खुल्या वेट्सचे मॉडेल स्वतःच्या पायाभूत सुविधांवर चालवू शकतात.
- कशाकडे लक्ष द्यावे: अहवालाची गुणवत्ता मिळवलेल्या साहित्यावर आणि प्रत्येक महत्त्वाच्या दाव्याची मूळ स्रोताशी पडताळणी करण्यावर अवलंबून असते. Asta चे Claude-आधारित Thinking mode हा वेगळा, अनेक टप्प्यांचा पर्याय आहे.
प्रश्नापासून अहवालापर्यंत
होस्ट केलेला मार्ग Asta च्या Generate a report सुविधेत सुरू होतो; त्यातील Fast mode AstaBrief वापरते. प्रश्न व उतारे मॉडेलकडे देण्यापूर्वी अहवाल-प्रणाली संबंधित साहित्य शोधते, असे Ai2 सांगते. त्यानंतर मॉडेल एका टप्प्यात अहवाल लिहिते; Thinking mode मधील उद्धरण-उत्खनन, गटबद्धीकरण आणि विभागनिहाय मसुदा-लेखनाचे टप्पे यात नसतात. सार्वजनिक ScholarQA रेपॉझिटरी मध्ये Semantic Scholar च्या परिच्छेद व कीवर्ड शोधातून माहिती मिळवून तिचे पुनर्क्रमांकन केल्याचे वर्णन आहे; त्याची lite अंमलबजावणी पुनर्क्रमित संदर्भांवरून प्रॉम्प्ट तयार करते आणि कॉन्फिगर केलेल्या जनरेटरला कॉल करते. हे दस्तऐवजीकृत घटक आहेत; BIG CHANGE ने चालू Asta सेवेला तपासलेले नाही.
डाउनलोड करता येणाऱ्या पर्यायासाठी AstaBrief मॉडेल कार्ड त्याच्या लिंक केलेल्या प्रॉम्प्ट-स्वरूपाची आणि प्रश्न व विभागीय संदर्भ असलेल्या इनपुटची शिफारस करते. त्यात उदाहरण transformers/vLLM अनुमान-कोड दिला आहे; आउटपुटची कमाल मर्यादा 4,096 टोकन आहे. कार्डमधील उदाहरण model_name ला SFT checkpoint म्हणून ठेवले आहे; पण पानात नंतरचे DPO-tuned AstaBrief_8B मॉडेल दिले आहे. छापल्याप्रमाणे उदाहरण अंतिम मॉडेल चालवते असे न मानता, checkpoint निवडणाऱ्या संशोधकाने हा फरक सोडवावा. स्वतःच्या PDF मधून अहवाल बनवण्यासाठी संशोधक बदलू शकतील असा उदाहरण ScholarQA lite कोड देखील Ai2 ने जोडला आहे. लिंक केलेली निर्देशिका कोड आहे; ठरावीक हार्डवेअर-किमान अटींसह तयार PDF व्यवस्था नाही.
स्थानिक प्रयोगासाठी यावरून व्यावहारिक क्रम ठरतो: वापरण्याची परवानगी असलेले लेख मिळवा; लेखांची ओळख जपत संबंधित उतारे काढून निवडा; कार्डच्या सूचनेनुसार प्रश्न व संदर्भांचा नमुना तयार करा; निवडलेला checkpoint चालवा; आणि तयार अहवालाची त्या उताऱ्यांबरोबर व मूळ लेखांबरोबर तपासणी करा. स्रोतांमध्ये दस्तऐवजीकृत घटक हे आहेत; BIG CHANGE ने हे टप्पे पार पाडलेले नाहीत. संपूर्ण स्थानिक प्रतिकृतीसाठी मॉडेल-वेट्स पुरेसे नाहीत: माहिती-पुनर्प्राप्ती, PDF विश्लेषण, संदर्भ हाताळणी आणि सेवा पुरवण्याची रचना देखील आवश्यक आहे.
गद्य वापरण्यापूर्वी पुरावा तपासा
माहिती-पुनर्प्राप्तीपासून सुरुवात करा. जनरेटरसमोर ठेवलेला शोध-प्रश्न आणि लेख किंवा PDF यांचा संच नोंदवा. एखादा अभ्यास वगळला गेला किंवा असंबंधित उतारा निवडला गेला तर AstaBrief एक शब्द लिहिण्यापूर्वीच उत्तराचा कल बदलू शकतो. त्यानंतर महत्त्वाच्या दाव्यांसाठी प्रत्येक संदर्भित लेख उघडा. संदर्भातील उतारा लोकसमूह, पद्धत, तारीख आणि खात्रीची पातळी यांसह नेमक्या वाक्याला आधार देतो का ते तपासा. संदर्भ खरा व संबंधित असू शकतो, तरी अहवाल एका नमुन्यातील निष्कर्ष संपूर्ण क्षेत्राला लागू करू शकतो किंवा वर्णनात्मक निरीक्षणाला सल्ल्यात बदलू शकतो. Ai2 ने दाव्यांच्या व्याप्तीतील ही चूक स्पष्टपणे घोषणेत ओळखली आहे.
शेवटी, महत्त्वाचे पण संदर्भ नसलेले दावे आणि मिळवलेल्या लेखांतील मर्यादित भागावर अहवाल वारंवार अवलंबून असतो का ते पाहा. प्रशिक्षण-अहवालांमधून संदर्भांची घनता तपासून निवड केल्याने विकासातील निकाल सुधारल्याचे Ai2 सांगते. यावरून संदर्भ देण्याचे महत्त्व समजते; पण संदर्भांची संख्या जास्त असणे एवढ्याने दावे मूळ स्रोताशी प्रामाणिक राहतात हे सिद्ध होत नाही. तयार अहवालाला कामचलाऊ संश्लेषण समजा आणि लेखांशी पडताळून सुधारित करा—विशेषतः संशोधनात उद्धृत करण्यापूर्वी किंवा महत्त्वाचा निर्णय घेण्यापूर्वी.
प्रकाशित मूल्यांकन काय सिद्ध करते
Asta संपूर्ण प्रक्रियेत Fast mode चा सरासरी कालावधी प्रति अहवाल 51.1 सेकंद होता, तर Thinking mode साठी 178.5 सेकंद होता—त्या तुलनेत सुमारे 3.5 पट वेगवान, असे Ai2 सांगते. मॉडेल कार्डमध्ये ScholarQA-CS2 मधील संगणकशास्त्रविषयक प्रश्न आणि DeepScholarBench वरील AstaBrief चे निकाल दिले आहेत. घोषणेत वेगळी, लहान मानवी तुलना देखील आहे: तीन संशोधकांनी 14 प्रश्न दिले. ही Ai2 ने स्वतःच्या प्रणाली व चाचणी-संचांवर केलेली मूल्यांकने आहेत; एखादा विशिष्ट अहवाल अचूक असेल याचे स्वतंत्र प्रात्यक्षिक नाही. बहुतांश प्रशिक्षण व मूल्यांकन 2025 मध्ये झाले आणि संपूर्ण मूल्यांकन सध्याच्या अत्याधुनिक मॉडेल्सशी पुन्हा चालवले नाही असे घोषणेत म्हटले आहे.
अंतिम checkpoint Apache 2.0 परवान्याखाली सार्वजनिक आहे; प्रशिक्षण-संच आणि प्रॉम्प्टची यादी Ai2 ने AstaBrief संग्रहात दिली आहे. मॉडेल कार्डनुसार, Ai2 च्या जबाबदार-वापर मार्गदर्शनाखाली हे मॉडेल संशोधन व शिक्षणासाठी अभिप्रेत आहे. प्रशिक्षणाच्या टिपेत DPO प्रशिक्षणासाठी आठ H100 GPU वापरल्याचे नमूद आहे; मात्र हे अनुमानासाठीचे प्रकाशित किमान हार्डवेअर नाही. तपासलेल्या प्राथमिक स्रोतांमध्ये होस्ट केलेल्या Asta साठी प्रति-अहवाल किंमत, स्थानिक GPU ची किमान क्षमता किंवा स्थानिक अहवालामागील विश्वासार्ह खर्च दिलेला नाही. तैनातीचे नियोजन करणाऱ्यांनी स्वतःच्या व्यवस्थेसाठी हे खर्च ठरवले पाहिजेत.
स्रोत आणि पुढील वाचन
- Ai2 ची 2 ऑक्टोबरची घोषणा थेट Fast mode, एका टप्प्यातील निर्मिती, वेळ आणि मूल्यांकनाच्या मर्यादा स्पष्ट करते. कामगिरीविषयीचे दावे Ai2 चे स्वतःचे आहेत.
- AstaBrief 8B मॉडेल कार्ड परवाना, अपेक्षित वापर, प्रॉम्प्टची शिफारस आणि अनुमानाचे उदाहरण देते; उदाहरणात SFT checkpoint चे नाव आहे.
- AstaBrief संग्रह प्रकाशित checkpoints, डेटासंच आणि प्रॉम्प्टची यादी देतो; त्यांची उपलब्धता म्हणजे स्थानिक पातळीवर संपूर्ण प्रक्रिया पुन्हा तयार होते याचा पुरावा नाही.
- ScholarQA कोड आणि दस्तऐवज माहिती-पुनर्प्राप्ती प्रणालीचे वर्णन करतात; lite जनरेटर पुनर्क्रमित संदर्भांना एका टप्प्यात निर्मितीसाठीच्या प्रॉम्प्टमध्ये कसे रूपांतरित करतो ते दाखवतो. आम्ही कोड व दस्तऐवज पाहिले; ते चालवले नाहीत.
- ScholarQA-CS2 मूल्यांकन रेपॉझिटरी निकषपत्राच्या निर्मितीसह बेंचमार्कचा कोड व डेटा देते. चाचणीची रचना समजून घेण्यास ते मदत करते; AstaBrief चे सांगितलेले गुण स्वतंत्रपणे पडताळत नाही.



