استخدم فريق تطوير Atria Dawn Preview الذكاء الاصطناعي في 713 مهمة من أصل 739 قدّم المشاركون بشأنها إجابة واضحة عن استخدامه. وفي دراسة الفريق لعمله في التطوير، ظل البشر يتخذون القرار النهائي في 85.5% من القرارات المسجلة بشأن الأساليب أو المعلمات. ويشير عنوان الورقة إلى «الذكاء الفائق الوكيلي»، لكن سجلات المهام تقدم صورة أكثر تحديدًا لكيفية توزيع الفريق للعمل.
قُدّمت المسودة البحثية الأولية في 14 سبتمبر ونُقحت في 17 سبتمبر 2026. وهي تستند إلى 769 سجلًا للمهام من 56 مشاركًا، إضافة إلى سجلات الوكلاء، ضمن مشروع واحد لتطوير نموذج. ويصف المؤلفون هذه السجلات بأنها دراسة حالة لكيفية استخدام فريقهم الوكلاء لبناء Atria Dawn Preview.
التغيير الأبرز
- ما الذي تغيّر: سجّل الفريق كيفية تقاسم الوكلاء والبشر قرارات بحثية محددة خلال مشروع لتطوير نموذج، مع الفصل بين اقتراح الخيار واتخاذ القرار النهائي.
- لماذا يهم ذلك: قد يقترح الوكيل أسلوبًا وينفذ تنقيحًا، بينما يظل الباحث هو من يختار الهدف ويوافق على الأسلوب ويقرر ما إذا كانت النتيجة تستوفي معايير المهمة. وعدّ إجراءات الوكيل وحدها يتجاهل اختلاف هذه الأدوار.
- ما الذي ينبغي متابعته: هذه ملاحظات من عمل فريق واحد، ويستند جانب كبير من الأدلة على القرارات إلى إفادات المشاركين. ولا تثبت النتائج كيف توزع مختبرات الذكاء الاصطناعي الأخرى قراراتها أو ما إذا كان بإمكان الوكلاء تطوير الأنظمة التي ستخلفهم باستقلالية.
الوكلاء اقترحوا أساليب كثيرة؛ والبشر اختاروا معظمها
يظهر أوضح تمييز في 567 قرارًا مسجلًا بشأن الأساليب أو المعلمات اتخذها مشاركون في أدوار تنفيذية. وتذكر الورقة أن الذكاء الاصطناعي اقترح خيارًا في 64.6% من هذه القرارات. وكانت الفئة الأكبر منفردة، بنسبة 55.4%، هي «الذكاء الاصطناعي يقترح، والإنسان يختار». واتخذ البشر القرار النهائي في 85.5% من الحالات، مقابل 9.2% للذكاء الاصطناعي. وأُسندت القرارات المتبقية إلى قيود خارجية.
وتفاوت توزيع الأدوار بحسب السؤال. اتخذ البشر القرار النهائي في 93.4% من 603 قرارات بشأن الأهداف أو النطاق، وفي 81.9% من 542 قرارًا بشأن معايير القبول. وكانت مقترحات الذكاء الاصطناعي أكثر شيوعًا بكثير في مسائل الأساليب منها في الأهداف. كما يُظهر شكل في الورقة أن البشر اختاروا الهدف النهائي في 144 من 151 مهمة قيّم المشاركون أنها غير قابلة للإنجاز من دون الذكاء الاصطناعي.
وتصف هذه النسب الأدوار المبلّغ عنها في اتخاذ القرار، ولا تقيس مدى استناد كل اختيار بشري إلى معلومات كافية. ويفسر المؤلفون النمط على أنه يدل على أن الباحثين وجّهوا العمل فيما ولّد الوكلاء خيارات ضمن التوجيهات التي وضعها البشر. وتوثق دراسة الحالة تنفيذًا مفوضًا مع احتفاظ البشر بسلطة القرار النهائي في هذا المشروع.
ملاحظات البشر كثيرًا ما أعادت الوكلاء إلى العمل
تذكر المشاركون أصعب مشكلة ذات أثر في كل مهمة. ومن بين 588 مهمة سُجلت فيها المشكلة والاستجابة، استمر العمل بمساعدة بشرية في 447 مهمة، أي 76.0%، بينما تعافى الوكلاء من المشكلة باستقلالية في 135 مهمة، أي 23.0%. وتمثلت أبرز أشكال المساعدة في تقديم سياق إضافي أو توضيح المتطلبات (207 مهام)، وتشخيص المشكلة أو تغيير الأسلوب (204 مهام). وتولى شخص بنفسه معظم العمل في أربع مهام.
وتُظهر سجلات المخرجات توزيعًا مشابهًا. فمن بين 627 مهمة عُرف فيها مصير المخرج الرئيسي للذكاء الاصطناعي، احتاجت 354 إلى تنقيح جوهري. وفي هذه المجموعة المنقحة، أجرى الوكيل التغييرات بعد تلقي ملاحظات بشرية في 75.4% من الحالات، بينما عدّل شخص المخرج مباشرة في 19.2%. وهكذا استطاع الباحثون توجيه التغيير من دون إجراء التعديل بأنفسهم.
وارتفع أيضًا مقياس واحد مستمد من السجلات خلال التطوير: ففي مجموعة من 22 مشاركًا، زاد الوسيط اليومي لعدد إجراءات الوكلاء المسجلة لكل طلب بشري من 11.0 في 7 أغسطس إلى 28.5 في 4 سبتمبر. ويستخدم المقياس نافذة الأيام السبعة السابقة، وتوافرت نسب صالحة لـ21 أو 22 شخصًا في كل يوم. وهو يحصي النشاط، لذلك لا يثبت أن الوكلاء اكتسبوا سلطة أكبر أو أن مخرجاتهم تحسنت.
ما الذي تثبته سجلات المهام
قدّر المشاركون ما إذا كان بإمكانهم إنجاز الجزء الخاص بهم من المهمة من دون ذكاء اصطناعي، مع الحفاظ على النطاق والجودة نفسيهما والموارد الأخرى. وصنّفوا 151 مهمة من أصل 455 مهمة مكتملة بمساعدة الذكاء الاصطناعي، لها إجابات صالحة، أي 33.2%، على أنها غير قابلة للإنجاز من دونه. وهذا افتراض مضاد للواقع يستند إلى التقييم الذاتي، وليس تجربة أعاد فيها الفريق تنفيذ المهام من دون وكيل. ولا يثبت أن أحدًا لم يكن ليحاول إنجاز أي من هذه الأعمال في ظروف مختلفة.
ولا توضح الورقة طريقة اختيار المشاركين الـ56 أو سجلات المهام الـ769، كما لا تتيح روابطها العامة إجابات المشاركين الأصلية أو سجلات الوكلاء لإعادة تحليلها بصورة مستقلة. وتقيّم نتائج المعايير المرجعية Atria Dawn Preview بوصفه نموذجًا، ولا تُظهر أن نظام ذكاء اصطناعي طوّر خليفته باستقلالية. وبالنسبة إلى الفرق التي تقرر ما تفوضه، فالحد الذي تكشفه النتائج محدد: كثيرًا ما اقترح الوكلاء العمل ونقحوه في هذا المشروع، بينما أفاد المشاركون بأنهم احتفظوا بمعظم القرارات المتعلقة بالأهداف والأساليب ومعايير القبول.



