Atria Dawn Previewను అభివృద్ధి చేసే బృందం, AI వినియోగంపై స్పష్టమైన సమాధానం ఇచ్చిన 739 పనుల్లో 713లో AI వాడినట్లు తెలిపింది. ఆ బృందం చేసిన తమ అభివృద్ధి పనిపై అధ్యయనంలో, పద్ధతులు లేదా పరామితులపై నమోదైన నిర్ణయాల్లో 85.5% తుది ఎంపికను మనుషులే చేశారు. వ్యాస శీర్షిక “ఏజెంటిక్ సూపర్ ఇంటెలిజెన్స్”ను ప్రస్తావించినా, బృందం పనిని ఎలా పంచుకుందనే దానిపై పని రికార్డులు మరింత నిర్దిష్ట చిత్రాన్ని అందిస్తాయి.
ఈ ప్రీప్రింట్ సెప్టెంబర్ 14న సమర్పించి, 2026 సెప్టెంబర్ 17న సవరించారు. ఒకే మోడల్ అభివృద్ధి ప్రాజెక్టులో 56 మంది పాల్గొన్నవారి 769 పని రికార్డులతో పాటు ఏజెంట్ లాగ్లను ఇది పరిశీలిస్తుంది. తమ బృందం Atria Dawn Previewను నిర్మించడానికి ఏజెంట్లను ఎలా ఉపయోగించిందనే దానిపై కేస్ స్టడీగా ఈ రికార్డులను రచయితలు వివరిస్తారు.
ముఖ్యమైన మార్పు
- ఏం మారింది: మోడల్ అభివృద్ధి ప్రాజెక్టులో నిర్దిష్ట పరిశోధనా నిర్ణయాలను ఏజెంట్లు, మనుషులు ఎలా పంచుకున్నారో బృందం నమోదు చేసింది; ఒక ప్రతిపాదనను తుది ఎంపిక నుంచి వేరుగా చూపింది.
- ఇది ఎందుకు ముఖ్యం: పరిశోధకుడు లక్ష్యాన్ని ఎంచుకొని, పద్ధతికి ఆమోదమిచ్చి, ఫలితం పనికి నిర్దేశించిన ప్రమాణాలను చేరిందో లేదో నిర్ణయిస్తూనే, ఏజెంట్ ఒక పద్ధతిని రూపొందించి, సవరణను అమలు చేయవచ్చు. ఏజెంట్ చర్యలను మాత్రమే లెక్కిస్తే ఈ విభిన్న పాత్రలు కనిపించవు.
- ఏమి గమనించాలి: ఇవి ఒకే బృందం పని నుంచి వచ్చిన పరిశీలనలు; నిర్ణయాలకు సంబంధించిన ఆధారాల్లో ఎక్కువ భాగం పాల్గొన్నవారే అందించారు. ఇతర AI ప్రయోగశాలలు నిర్ణయాలను ఎలా పంచుకుంటాయో లేదా ఏజెంట్లు తమ తర్వాతి తరాన్ని స్వయంగా అభివృద్ధి చేయగలరో ఈ ఫలితాలు నిర్ధారించవు.
ఏజెంట్లు అనేక పద్ధతులు సూచించారు; ఎక్కువ ఎంపికలు మనుషులవే
అమలు పాత్రల్లో ఉన్నవారి 567 పద్ధతి లేదా పరామితి నిర్ణయాల్లో స్పష్టంగా కనిపించే తేడా ఉంది. వాటిలో 64.6%లో AI ఒక ఎంపికను ప్రతిపాదించిందని వ్యాసం నివేదించింది. 55.4%తో అతిపెద్ద ఏకైక వర్గం “AI ప్రతిపాదిస్తుంది, మనిషి ఎంచుకుంటాడు.” తుది ఎంపికను మనుషులు 85.5% సందర్భాల్లో చేయగా, AI 9.2%లో చేసింది. మిగిలిన నిర్ణయాలకు బాహ్య పరిమితి కారణమని పేర్కొన్నారు.
ప్రశ్నను బట్టి ఈ పంపకం మారింది. లక్ష్యం లేదా పరిధిపై 603 నిర్ణయాల్లో 93.4%ను, ఆమోద ప్రమాణాలపై 542 నిర్ణయాల్లో 81.9%ను మనుషులే తుది నిర్ణయంగా ఎంచుకున్నారు. లక్ష్యాలతో పోలిస్తే పద్ధతుల విషయంలో AI ప్రతిపాదనలు చాలా సాధారణం. AI లేకుండా సాధ్యం కాదని పాల్గొన్నవారు అంచనా వేసిన 151 పనుల్లో 144కు తుది లక్ష్యాన్ని మనుషులే ఎంచుకున్నారని వ్యాసంలోని చిత్రం నమోదు చేసింది.
ఈ శాతాలు నివేదించిన నిర్ణయ పాత్రలను వివరిస్తాయి; ప్రతి మానవ ఎంపికకు తగిన సమాచారం ఉందో లేదో కొలవవు. మనుషులు నిర్దేశించిన మార్గాల్లో ఏజెంట్లు ఎంపికలను రూపొందిస్తుండగా, పరిశోధకులు పనికి దిశ చూపించారని రచయితలు ఈ సరళిని అర్థం చేసుకున్నారు. ఈ ప్రాజెక్టులో తుది అధికారం మనుషుల వద్దే కొనసాగుతూనే, పనుల అమలును అప్పగించిన తీరును కేస్ స్టడీ నమోదు చేస్తుంది.
మానవుల అభిప్రాయం తరచూ ఏజెంట్లను మళ్లీ పని చేయించింది
పాల్గొన్నవారు ప్రతి పనికి అత్యంత ప్రభావం చూపిన సమస్యను గుర్తుచేసుకున్నారు. సమస్య, స్పందన నమోదైన 588 పనుల్లో 447—అంటే 76.0%—మానవ సహాయంతో ముందుకు సాగాయి; 135లో—23.0%—ఏజెంట్లు స్వతంత్రంగా కోలుకున్నారు. అదనపు సందర్భం లేదా స్పష్టమైన అవసరాలు ఇవ్వడం (207 పనులు), సమస్యను గుర్తించి పద్ధతి మార్చడం (204) ప్రధాన సహాయ రకాలు. నాలుగు పనుల్లో ప్రధాన పనిని మనిషి స్వయంగా చేపట్టాడు.
ప్రధాన AI ఫలితం ఎలా ముగిసిందో తెలిసిన 627 పనుల్లో 354కు గణనీయమైన సవరణ అవసరమైందని ఫలితాల రికార్డులు చూపిస్తున్నాయి. సవరించిన పనుల్లో 75.4% సందర్భాల్లో మానవ అభిప్రాయం తర్వాత ఏజెంట్ మార్పులు చేసింది; 19.2%లో మనిషి నేరుగా సవరించాడు. సవరణను స్వయంగా చేయకుండానే పరిశోధకుడు మార్పుకు దిశ చూపగలిగాడు.
అభివృద్ధి సమయంలో లాగ్లలో ఒక కొలత పెరిగింది: 22 మంది పాల్గొన్న ఒక సమూహంలో, ఒక్కో మానవ ప్రాంప్ట్కు నమోదైన ఏజెంట్ చర్యల రోజువారీ మధ్యక విలువ ఆగస్టు 7న 11.0 నుంచి సెప్టెంబర్ 4న 28.5కు చేరింది. ఈ కొలతకు ముందు ఏడు రోజుల వ్యవధిని ఉపయోగించారు; ఒక్కో రోజున 21 లేదా 22 మందికి సరిపడే నిష్పత్తులు లభించాయి. ఇది కార్యకలాపాలను లెక్కిస్తుంది; ఏజెంట్లకు అధికారం పెరిగిందని లేదా ఫలితాలు మెరుగయ్యాయని నిరూపించదు.
పని రికార్డులు ఏం నిరూపించగలవు
AI సహాయం లేకుండా, అదే పరిధి, నాణ్యత, ఇతర వనరులతో తమ పనిభాగాన్ని పూర్తి చేయగలిగేవారా అని పాల్గొన్నవారిని అడిగారు. ఉపయోగించదగిన సమాధానాలున్న, AI సహాయంతో పూర్తిచేసిన 455 పనుల్లో 151—అంటే 33.2%—AI లేకుండా సాధ్యం కాదని వారు అంచనా వేశారు. ఇది పాల్గొన్నవారి స్వీయ నివేదిత ప్రతికల్పన మాత్రమే; ఏజెంట్ లేకుండా అదే పనులు మళ్లీ చేయించిన ప్రయోగం కాదు. వేరే పరిస్థితుల్లో ఆ పనుల్లో ఏదీ మొదలుపెట్టేవారు కాదని ఇది నిరూపించదు.
56 మంది పాల్గొన్నవారిని లేదా 769 పని రికార్డులను ఎలా నమూనాగా ఎంచుకున్నారో వ్యాసం చెప్పదు; స్వతంత్రంగా మళ్లీ విశ్లేషించేందుకు అవసరమైన అసలు పని సమాధానాలు, ఏజెంట్ లాగ్లను బహిరంగ లింకులు అందించవు. దాని బెంచ్మార్క్ ఫలితాలు Atria Dawn Preview మోడల్ను అంచనా వేస్తాయి. ఒక AI వ్యవస్థ తన తర్వాతి తరాన్ని స్వయంగా మెరుగుపరచిందని అవి చూపవు. ఏ పనులు అప్పగించాలనే నిర్ణయం తీసుకునే బృందాలకు, నివేదించిన హద్దు నిర్దిష్టమే: ఈ ప్రాజెక్టులో ఏజెంట్లు తరచూ పని ప్రతిపాదించి సవరించారు; లక్ష్యాలు, పద్ధతులు, ఆమోద ప్రమాణాలపై ఎక్కువ నిర్ణయాలు తామే తీసుకున్నామని పాల్గొన్నవారు తెలిపారు.



