Atria Dawn Preview विकसित करणाऱ्या टीमने AI वापराविषयी स्पष्ट उत्तर दिलेल्या 739 कामांपैकी 713 कामांत AI वापरल्याचे सांगितले. टीमच्या स्वतःच्या विकासकामाच्या अभ्यासात, पद्धती किंवा मापदंडांबाबत नोंदवलेल्या निर्णयांपैकी 85.5% निर्णयांत अंतिम निवड लोकांनीच केली. लेखाच्या शीर्षकात “एजंटिक सुपरइंटेलिजन्स” असा उल्लेख आहे; पण कामांच्या नोंदी टीमने काम कसे वाटून घेतले याचे अधिक नेमके चित्र देतात.
हा प्रीप्रिंट 14 सप्टेंबरला सादर करण्यात आला आणि 17 सप्टेंबर 2026 रोजी सुधारित करण्यात आला. यात 56 सहभागींच्या 769 कामांच्या नोंदी तसेच एजंट लॉग्सचा आधार आहे. Atria Dawn Preview बनवताना टीमने एजंट्सचा वापर कसा केला, याचा एक प्रकरण-अभ्यास म्हणून लेखक या नोंदींचे वर्णन करतात.
मोठा बदल
- काय बदलले: मॉडेल-विकास प्रकल्पात एजंट्स आणि लोकांनी विशिष्ट संशोधन-निर्णय कसे वाटून घेतले, याची टीमने नोंद ठेवली आणि प्रस्ताव मांडण्याची भूमिका अंतिम निवडीपासून वेगळी दाखवली.
- हे का महत्त्वाचे: एजंट एखादी पद्धत तयार करू शकतो आणि बदल करू शकतो; तरी संशोधक उद्दिष्ट ठरवू शकतो, पद्धतीला मंजुरी देऊ शकतो आणि निकाल कामाच्या निकषांनुसार आहे की नाही हे ठरवू शकतो. केवळ एजंटच्या कृती मोजल्यास या वेगवेगळ्या भूमिका लक्षात येत नाहीत.
- कशाकडे लक्ष द्यावे: ही एका टीमच्या कामातील निरीक्षणे आहेत आणि निर्णयांबद्दलचा बराचसा पुरावा सहभागींच्या म्हणण्यावर आधारित आहे. इतर AI प्रयोगशाळा निर्णय कसे वाटून घेतात किंवा एजंट्स स्वतःचे उत्तराधिकारी स्वायत्तपणे विकसित करू शकतात का, हे निष्कर्ष सिद्ध करत नाहीत.
एजंट्सनी अनेक पद्धती सुचवल्या; लोकांनी बहुतेक निवडल्या
अंमलबजावणीच्या भूमिकेतील सहभागींच्या पद्धती किंवा मापदंडांशी संबंधित 567 नोंदवलेल्या निर्णयांत सर्वांत स्पष्ट फरक दिसतो. त्यांपैकी 64.6% निर्णयांत AI ने पर्याय सुचवला, असे लेख सांगतो. 55.4% हा सर्वांत मोठा एकल प्रकार होता: “AI प्रस्तावित करते, माणूस निवडतो.” अंतिम निवड लोकांनी 85.5% निर्णयांत केली; AI ने 9.2% निर्णयांत केली. उरलेले निर्णय बाह्य मर्यादांमुळे ठरले.
प्रश्नानुसार निर्णयवाटप बदलले. उद्दिष्टे किंवा व्याप्तीबाबतच्या 603 निर्णयांपैकी 93.4% आणि स्वीकार-निकषांबाबतच्या 542 निर्णयांपैकी 81.9% निर्णयांत अंतिम निवड लोकांनी केली. उद्दिष्टांच्या तुलनेत पद्धतींसाठी AI चे प्रस्ताव खूपच अधिक होते. AI शिवाय काम अशक्य ठरले असते असे सहभागींच्या मते असलेल्या 151 कामांपैकी 144 मध्ये अंतिम उद्दिष्ट लोकांनीच निवडले, असे लेखातील आकृतीतही नोंदले आहे.
ही टक्केवारी सहभागींच्या मते नोंदवलेल्या निर्णय-भूमिका दर्शवते. प्रत्येक मानवी निवड पुरेशी माहितीच्या आधारे झाली का, हे ती मोजत नाही. संशोधकांनी दिशा ठरवली आणि त्या दिशेत एजंट्सनी पर्याय तयार केले, असा या नमुन्याचा अर्थ लेखक लावतात. या प्रकरण-अभ्यासात एजंट्सकडे अंमलबजावणी सोपवली गेली, पण या प्रकल्पात अंतिम अधिकार लोकांकडेच राहिल्याचे नोंदले आहे.
मानवी अभिप्रायामुळे एजंट्सना अनेकदा पुन्हा काम करावे लागले
प्रत्येक कामातील सर्वांत महत्त्वाची अडचण आणि त्यावरची प्रतिक्रिया सहभागींच्या स्मरणातून नोंदवली गेली. अडचण आणि प्रतिसाद नोंदवलेल्या 588 कामांपैकी 447, म्हणजे 76.0%, मानवी मदतीने पुढे गेली; 135, म्हणजे 23.0%, कामांत एजंट्सनी स्वतःच अडचण सोडवली. मदतीचे प्रमुख प्रकार म्हणजे अधिक संदर्भ किंवा स्पष्ट केलेल्या अपेक्षा (207 कामे), तसेच समस्येचे निदान किंवा पद्धतीत बदल (204). चार कामांत मुख्य कामाची जबाबदारी माणसाने घेतली.
मुख्य AI निष्पत्तीची स्थिती माहीत असलेल्या 627 कामांपैकी 354 कामांत लक्षणीय सुधारणा आवश्यक होती, असे आउटपुट नोंदी दाखवतात. सुधारणा झालेल्या या गटात 75.4% प्रकरणांत मानवी अभिप्रायानंतर एजंटने बदल केले; तर 19.2% प्रकरणांत व्यक्तीने थेट संपादन केले. संशोधक स्वतः संपादन न करताही बदल करवून घेऊ शकत होते.
विकासादरम्यान लॉगमधील एक मोजमापही वाढले: 22 सहभागींच्या गटात, प्रत्येक मानवी प्रॉम्प्टमागील एजंट कृतींची दैनिक मध्यिका 7 ऑगस्टला 11.0 वरून 4 सप्टेंबरला 28.5 झाली. ही मोजणी आधीच्या सात दिवसांची आहे आणि प्रत्येक दिवसासाठी 21 किंवा 22 लोकांचे वैध गुणोत्तर उपलब्ध होते. यात कृती मोजल्या जातात; त्यामुळे एजंट्सना अधिक अधिकार मिळाले किंवा त्यांचे आउटपुट सुधारले, असे सिद्ध होत नाही.
कामांच्या नोंदी काय सिद्ध करू शकतात
AI च्या मदतीशिवाय, तेवढ्याच व्याप्तीवर, गुणवत्तेने आणि इतर साधनांसह स्वतःचे काम पूर्ण करता आले असते का, याचा सहभागींच्या अंदाजावर आधारित प्रश्न विचारण्यात आला. वापरण्यायोग्य उत्तरे असलेल्या पूर्ण झालेल्या 455 AI-सहाय्यित कामांपैकी 151, म्हणजे 33.2%, कामे AI शिवाय अशक्य ठरली असती, असे सहभागी म्हणाले. हा स्व-अहवालावर आधारित काल्पनिक अंदाज आहे; एजंटशिवाय तीच कामे पुन्हा करून पाहिलेला प्रयोग नाही. वेगळ्या परिस्थितीत यापैकी कोणतेही काम सुरूच झाले नसते, हे तो सिद्ध करू शकत नाही.
56 सहभागी किंवा 769 कामांच्या नोंदी निवडण्याची पद्धत लेखात दिलेली नाही. स्वतंत्र पुनर्विश्लेषणासाठी आवश्यक असलेल्या मूळ काम-संबंधित प्रतिसादांचा किंवा एजंट लॉग्सचा दुव्यांमधून प्रवेश मिळत नाही. बेंचमार्कचे निकाल Atria Dawn Preview या मॉडेलचे मूल्यमापन करतात; AI प्रणालीने स्वतःचा उत्तराधिकारी स्वायत्तपणे सुधारला, असे ते दाखवत नाहीत. काय काम सोपवायचे हे ठरवणाऱ्या टीमसाठी नोंदवलेली सीमा स्पष्ट आहे: या प्रकल्पात एजंट्सनी वारंवार प्रस्ताव मांडले आणि कामात सुधारणा केली, तर सहभागींच्या मते उद्दिष्टे, पद्धती आणि स्वीकार-निकषांवरील बहुतेक निवडी त्यांनी स्वतःकडे ठेवल्या.



