2 अक्टूबर को Ai2 ने Asta के Fast mode को चलाने वाला AstaBrief 8B जारी किया। Asta के Generate a report फ़ीचर में यह डाउनलोड किया जा सकने वाला मॉडल एक शोध प्रश्न और वैज्ञानिक शोध-पत्रों से खोजे गए अंश लेकर एक ही चरण में उद्धरणों वाली रिपोर्ट लिखता है। शोधकर्ता के लिए अहम फ़र्क यह है कि शोध-पत्र कहाँ से आते हैं और उद्धरण वास्तव में किस बात का समर्थन करते हैं: AstaBrief दिए गए साक्ष्य से लिखता है; अपने-आप में यह साहित्य खोज सेवा नहीं है। Ai2 की रिलीज़ और मॉडल कार्ड इस सीमा का वर्णन करते हैं।
बड़ा बदलाव
- क्या बदला: Ai2 ने AstaBrief को Asta के चालू Fast mode में शामिल किया और मॉडल वेट्स तथा प्रशिक्षण सामग्री जारी की।
- यह क्यों मायने रखता है: Ai2 के अनुसार, शोध समूह रिपोर्ट जनरेटर की जाँच या अनुकूलन कर सकते हैं और ओपन-वेट्स मॉडल अपने बुनियादी ढाँचे पर चला सकते हैं।
- किन बातों पर नज़र रखें: रिपोर्ट की गुणवत्ता खोजे गए साहित्य और हर महत्वपूर्ण दावे को उसके स्रोत के सामने जाँचने पर निर्भर करती है। Asta का Claude-संचालित Thinking mode अलग, कई चरणों वाला विकल्प बना हुआ है।
प्रश्न से रिपोर्ट तक
होस्ट किया गया रास्ता Asta का Generate a report फ़ीचर से शुरू होता है, जहाँ Fast mode AstaBrief इस्तेमाल करता है। Ai2 के अनुसार, रिपोर्ट प्रणाली प्रश्न और अंश मॉडल को देने से पहले प्रासंगिक साहित्य खोजती है। फिर मॉडल Thinking mode में इस्तेमाल उद्धरण निकालने, समूह बनाने और हर अनुभाग अलग-अलग लिखने के चरण छोड़कर पूरी रिपोर्ट एक बार में लिखता है। सार्वजनिक ScholarQA रिपॉज़िटरी में Semantic Scholar की अनुच्छेद और कीवर्ड खोज के बाद परिणामों की पुनः-रैंकिंग का वर्णन है; इसका lite कार्यान्वयन पुनः-रैंक किए गए संदर्भों से प्रॉम्प्ट बनाकर कॉन्फ़िगर किए जनरेटर को बुलाता है। ये दस्तावेज़ों में बताए हिस्से हैं, BIG CHANGE द्वारा लाइव Asta सेवा का परीक्षण नहीं।
डाउनलोड किए जा सकने वाले मॉडल के लिए, AstaBrief मॉडल कार्ड अपने लिंक किए गए प्रॉम्प्ट स्वरूप और प्रश्न तथा अनुभाग-संदर्भों वाले इनपुट की सिफ़ारिश करता है। इसमें transformers/vLLM अनुमान-कोड की मिसाल अधिकतम 4,096 आउटपुट टोकन रखती है। कार्ड की मिसाल model_name को SFT चेकपॉइंट पर सेट करती है, जबकि पृष्ठ बाद में DPO से ट्यून किए गए AstaBrief_8B का वर्णन करता है। चेकपॉइंट चुनने वाले शोधकर्ता को यह अंतर स्पष्ट करना चाहिए, न कि मान लेना चाहिए कि छपी मिसाल अंतिम मॉडल चलाती है। Ai2 ScholarQA lite का उदाहरण कोड भी देता है, जिसे शोधकर्ता अपने PDF से रिपोर्ट बनाने के लिए अपना सकते हैं। लिंक की गई डायरेक्टरी कोड है; यह न्यूनतम हार्डवेयर बताने वाला, तैयार PDF सेटअप नहीं है।
स्थानीय प्रयोग के लिए इससे एक व्यावहारिक क्रम निकलता है: उन शोध-पत्रों को लें जिनका उपयोग करने की अनुमति हो; शोध-पत्र पहचानकर्ताओं के साथ प्रासंगिक अंश निकालें और चुनें; कार्ड की सिफ़ारिश के अनुसार प्रश्न और संदर्भों का स्वरूप बनाएँ; चुना हुआ चेकपॉइंट चलाएँ; और बनी रिपोर्ट को उन अंशों तथा मूल शोध-पत्रों के साथ रखकर जाँचें। स्रोत जिन हिस्सों का वर्णन करते हैं, वे यही हैं; BIG CHANGE ने ये कदम नहीं उठाए। पूरी स्थानीय प्रतिकृति के लिए खोज, PDF पार्सिंग, संदर्भ सँभालने और सर्व करने के विकल्प भी चाहिए, जो केवल मॉडल वेट्स से नहीं मिलते।
गद्य इस्तेमाल करने से पहले साक्ष्य जाँचें
खोज से शुरुआत करें। जनरेटर को दी गई खोज क्वेरी और शोध-पत्रों या PDF का समूह दर्ज करें। छूटा हुआ अध्ययन या अप्रासंगिक अंश AstaBrief के लिखने से पहले ही जवाब को बिगाड़ सकता है। फिर महत्वपूर्ण दावों के लिए उद्धृत हर शोध-पत्र खोलें। जाँचें कि उद्धृत अंश आबादी, पद्धति, तारीख और निश्चितता के स्तर सहित सटीक वाक्य का समर्थन करता है या नहीं। उद्धरण असली और विषय से जुड़ा हो सकता है, फिर भी रिपोर्ट एक नमूने के नतीजे को पूरे क्षेत्र पर लागू कर सकती है या वर्णनात्मक निष्कर्ष को सलाह में बदल सकती है। Ai2 ने अपनी रिलीज़ में दायरे से जुड़ी इस चूक को स्पष्ट रूप से पहचाना है।
अंत में, ऐसे महत्वपूर्ण दावे खोजें जिनके साथ उद्धरण नहीं हैं, और देखें कि रिपोर्ट बार-बार खोजे गए शोध-पत्रों के छोटे हिस्से पर तो निर्भर नहीं करती। Ai2 के अनुसार, प्रशिक्षण रिपोर्टों को उद्धरणों की सघनता के आधार पर छाँटने से उसके विकास के नतीजे बेहतर हुए। यह खोज बताती है कि स्रोत का उल्लेख क्यों मायने रखता है, लेकिन केवल उद्धरणों की सघनता यह साबित नहीं करती कि दावे स्रोत के प्रति निष्ठावान हैं। बनी रिपोर्ट को कामकाजी संश्लेषण मानें और शोध में उद्धृत करने या कोई महत्वपूर्ण निर्णय लेने से पहले उसे मूल शोध-पत्रों के सामने रखकर संशोधित करें।
प्रकाशित मूल्यांकन क्या स्थापित करता है
Ai2 बताता है कि पूरे Asta पाइपलाइन में Fast mode ने औसतन प्रति रिपोर्ट 51.1 सेकंड लिए, जबकि Thinking mode ने 178.5 सेकंड लिए; उस तुलना में यह लगभग 3.5 गुना तेज़ था। मॉडल कार्ड ScholarQA-CS2 कंप्यूटर विज्ञान प्रश्नों और DeepScholarBench पर AstaBrief के नतीजे बताता है; रिलीज़ एक अलग, छोटे मानव मूल्यांकन का वर्णन करती है, जिसमें तीन शोधकर्ताओं ने 14 प्रश्न दिए। ये अपने सिस्टम और परीक्षण-समूहों पर Ai2 के मूल्यांकन हैं; ये स्वतंत्र रूप से साबित नहीं करते कि कोई विशेष रिपोर्ट सटीक होगी। रिलीज़ कहती है कि अधिकांश प्रशिक्षण और मूल्यांकन 2025 में हुआ तथा पूरा मूल्यांकन मौजूदा अग्रणी मॉडलों के विरुद्ध दोबारा नहीं चलाया गया।
अंतिम चेकपॉइंट Apache 2.0 के तहत सार्वजनिक है; Ai2 अपने प्रशिक्षण डेटासेट और प्रॉम्प्ट AstaBrief संग्रह में सूचीबद्ध करता है। मॉडल कार्ड के अनुसार, Ai2 के जिम्मेदार-उपयोग मार्गदर्शन के तहत मॉडल शोध और शिक्षा के लिए है। इसके प्रशिक्षण नोट में DPO प्रशिक्षण के लिए आठ H100 GPU का उल्लेख है; यह अनुमान के लिए प्रकाशित न्यूनतम आवश्यकता नहीं है। समीक्षा की गई प्राथमिक सामग्री होस्ट किए गए Asta के लिए प्रति रिपोर्ट कीमत, स्थानीय GPU की न्यूनतम विशिष्टता या स्थानीय रिपोर्ट की भरोसेमंद लागत नहीं बताती। तैनाती की योजना बनाने वालों को अपने सेटअप की ये लागतें तय करनी होंगी।
स्रोत और आगे पढ़ें
- Ai2 की 2 अक्टूबर की रिलीज़ चालू Fast mode, एक-चरणीय डिज़ाइन, समय और मूल्यांकन की सीमाएँ समझाती है। प्रदर्शन संबंधी दावे Ai2 के अपने हैं।
- AstaBrief 8B मॉडल कार्ड लाइसेंस, उपयोग का उद्देश्य, प्रॉम्प्ट की सिफ़ारिश और अनुमान की मिसाल देता है; उस मिसाल में SFT चेकपॉइंट का नाम है।
- AstaBrief संग्रह प्रकाशित चेकपॉइंट, डेटासेट और प्रॉम्प्ट सूचीबद्ध करता है; केवल उनकी उपलब्धता से स्थानीय रूप से शुरू से अंत तक दोहराव साबित नहीं होता।
- ScholarQA कोड और दस्तावेज़ खोज प्रणाली का वर्णन करते हैं; lite जनरेटर दिखाता है कि पुनः-रैंक किए गए संदर्भ एक-चरणीय जनरेशन प्रॉम्प्ट कैसे बनते हैं। हमने दस्तावेज़ और कोड देखे, उन्हें चलाया नहीं।
- ScholarQA-CS2 मूल्यांकन रिपॉज़िटरी बेंचमार्क का कोड और डेटा देता है, जिसमें मूल्यांकन-मानदंड बनाने की प्रक्रिया भी शामिल है। इससे परीक्षण डिज़ाइन समझने में मदद मिलती है; यह Ai2 के बताए AstaBrief स्कोर का स्वतंत्र सत्यापन नहीं करता।



