تضع مراجعة بحثية نُشرت على arXiv في 10 سبتمبر ونُقحت في 22 سبتمبر خمسة مستويات لمشاركة الذكاء الاصطناعي في تحسين أنظمة الذكاء الاصطناعي. أما عنوانها، «آخر ذكاء اصطناعي يبنيه البشر»، فيصف طموحاً لا حدثاً أفاد المؤلفون بوقوعه. وتصل أدلتهم إلى أمثلة محدودة لأنظمة تنقح أجزاءً من عملية تطويرها. لكنها لا تثبت وجود نظام يصنع أجيالاً لاحقة أفضل منه بصورة موثوقة جيلاً بعد جيل.
ويهم هذا الفارق عند تفسير الادعاءات بشأن أتمتة أبحاث الذكاء الاصطناعي. فقد يجري الوكيل تجارب ويحفظ الدروس ويحسن نتيجة معيارية فيما يظل البشر يحددون هدفه ويتحكمون في الاختبارات ويقررون التغييرات التي تستمر. ويتطلب الادعاء الأقوى دليلاً على أن النظام حسّن المنهج الذي ينتج نسخته التالية، وأن المنهج المنقح حقق أداءً أفضل في مقارنة منصفة.
التغيير الأبرز
- ما الذي تغيّر: بات لدى الباحثين الآن وصف أدق لمقدار ما يسيطر عليه النظام من حلقة تحسين الذكاء الاصطناعي، من تنفيذ التحديثات الموكلة إليه إلى تنقيح الإجراء المستخدم في التحديثات اللاحقة. وتنظم المراجعة الجديدة الأعمال القائمة؛ ولا تعلن عن أداة مكتملة لبناء جيل لاحق مستقل.
- لماذا يهم ذلك: تستطيع مختبرات الذكاء الاصطناعي أتمتة مزيد من التجارب من دون إثبات أن كل وكيل جديد أفضل في صنع الوكيل الذي يليه. ويؤثر هذا الفارق في تفسير الباحثين لادعاءات الأداء وفي تحديد المواضع التي يحتاجون فيها إلى مراجعة بشرية واختبارات مستقلة.
- ما الذي ينبغي متابعته: يتمثل الدليل الحاسم في سلسلة أجيال لاحقة تستخدم منهج تحسين موروثاً ومنقحاً، وتُختبر في مهام محمية مقابل المنهج السابق وبموارد متماثلة. ولم تثبت الأعمال التي استعرضتها الدراسة حتى الآن تراكم مكاسب موثوقاً به إحصائياً وفق هذا المعيار.
خمسة مستويات تصف السيطرة على حلقة التحسين
يفصل البحث أولاً بين تنقيح مهمة واحدة، ويسميه B0، والتحسين المستمر. فالنموذج الذي يحرر إجابة إلى أن تجتاز فحصاً قد حسّن تلك الإجابة. لكن النظام نفسه لا يكتسب تحديثاً دائماً ما لم ينتقل التغيير إلى مهام لاحقة مستقلة.
في المستوى 1، يختار البشر الهدف واختبار النجاح، بينما ينفذ الذكاء الاصطناعي تحديثاً، مثل تطبيق قاعدة جودة بيانات حددها الإنسان. وفي المستوى 2، يختار الذكاء الاصطناعي أيضاً استراتيجية للهدف المسند إليه، كأن يشخّص إخفاقات وكيل برمجة ويقترح تعديلات على أدواته. لكن الهدف واختبار القبول يظلان محددين من خارج النظام.
في المستوى 3، يساعد النظام في اختيار الخبرة التي يحتاج إليها تالياً، مثل مهام تدريب تستهدف مواطن الضعف التي اكتشفها. ويضيف المستوى 4 تغذية راجعة من الاستخدام المستمر: يحتفظ النظام بتغييرات معتمدة في الذاكرة أو القواعد أو المكونات بعد مواجهة ظروف جديدة. وترى الورقة أن كلا المستويين يعتمد على جودة التغذية الراجعة والقواعد التي تحدد التغييرات التي تستمر.
المستوى 5 يصل إلى الفكرة المحورية في المراجعة. إذ ينقح الذكاء الاصطناعي إجراءً يوجّه التحسين اللاحق، مثل سياسة البحث أو أداة التقييم أو الوكيل الذي يقترح الأجيال التالية. ويجب الاحتفاظ بالإجراء المنقح واستخدامه في جولة لاحقة. وحتى في هذا المستوى، تقول الورقة إن بإمكان البشر الاحتفاظ بالسيطرة على الهدف العام واختبارات القبول المحمية والموارد. ويصف المستوى المسؤولية المفوضة، لا ضمان التقدم أو الاستقلال المطلق.
الأنظمة القائمة توضح الحد الفاصل
وتذكر دراسة آلة داروين-غودل أن وكيل البرمجة لديها رفع أداءه من 20% إلى 50% على مجموعة فرعية من معيار SWE-bench، إذ عدلت نسخ متعددة شيفرة الوكيل وأُدخلت النسخ الناجحة إلى أرشيف. ويذكر مؤلفوها أيضاً أن صيانة الأرشيف وقاعدة اختيار النسخة التي تصبح أصلاً ثابتتان. وتستخدمها المراجعة لتوضيح أن تحسن الأجيال اللاحقة وحده لا يثبت أن عملية اختيارها حسّنت نفسها.
ويقدم A-Evolve-Training مثالاً أضيق نطاقاً للمستوى 5. فقد أجرى أربع جولات من التدريب اللاحق لنموذج يضم 30 مليار مُعامل. وجمع وكيل فوقي النتائج وغيّر سياسة البحث التي توجه العاملين في الجولات اللاحقة، بعد أن توقفت درجة التطوير الداخلية عن مواكبة لوحة المتصدرين الخارجية. وذكرت الدراسة نتيجة نهائية قدرها 0.86، مقارنةً بـ0.87 لأفضل مشاركة بشرية آنذاك. وقد غيّرت السياسة الموروثة طريقة اختيار التجارب اللاحقة، فيما ظل النظام الأساسي للعاملين وهدف المنافسة ثابتين. وهذا يوضح إجراء بحثياً منقحاً يعمل داخل مشروع محدد، لا سيطرة مستقلة على كل جوانب تطوير النموذج.
وتختبر دراسة HyperAgents ما إذا كان إجراء محسن لبناء الوكلاء ينتقل إلى مجال جديد. فبعد 200 تكرار على تقييمات الرياضيات، سجل تشغيل بدأ بتحسينات منقولة 0.640 على مجموعة الاختبار، مقابل 0.610 لتشغيل بدأ بوكيله الأولي. ويقول المؤلفون إن هذا الفرق لم يكن ذا دلالة إحصائية. وتدعم النتيجة دراسة النقل، لكنها لا تثبت تراكم مكاسب موثوقاً عبر مرات التشغيل.
زيادة النشاط لا تثبت تحسناً في عملية التحسين
تميز المراجعة بين إعادة استخدام إجراء منقح، وتسميه العود البنيوي، وبين العود الفعّال: أي أن الإجراء المنقح ينتج أجيالاً لاحقة أقوى في ظل ميزانيات متقاربة وتقييم مستقل. وهذا الاختبار الثاني هو ما قد يدفع عنوان الورقة المثير القراء إلى افتراض أنه تحقق بالفعل.
وثمة طرق عدة للخلط بين النشاط والتقدم. فقد يخصص النظام وقتاً حاسوبياً أطول للبحث، أو يفرط في مواءمة معيار كرر الاستعلام عنه، أو يحتفظ بتغيير يفيد مهمة واحدة ويضر بأخرى. وإذا غيّر أداة التقييم الخاصة به أيضاً، فقد تعكس الدرجات الأعلى مقياساً جديداً. لذلك تدعو الورقة إلى تسجيل ما جرى تنقيحه، وإظهار أن المكوّن المنقح وجّه الجولة التالية فعلاً، ومقارنته بالمكوّن السابق بموارد متكافئة، واختبار الاحتفاظ بالتغييرات ونقلها إلى مهام مستقلة.
ويقول المؤلفون صراحةً إن النتائج الحالية تدعم تغييرات محدودة النطاق في أنظمة التحسين وأدوات التقييم وسياسات البحث، بينما «ما زال تراكم التحسن الموثوق إحصائياً عبر الأجيال في ظل موارد متقاربة مسألة مفتوحة». وتسمي عبارة «آخر ذكاء اصطناعي يبنيه البشر» الغاية التي تحفز إطارهم. وتقدم المراجعة معايير لتقييم التقدم نحوها.
المصادر ومواد إضافية للقراءة
- Duan وآخرون، «آخر ذكاء اصطناعي يبنيه البشر»، الإصدار الثالث (22 سبتمبر 2026). تعرّف المراجعة البحثية الأساسية B0 والمستويات 1–5، وتميز بين العود البنيوي والفعّال وتوضح حدود الأدلة. وتصنيفها وتفسيرها إطار المؤلفين، لا عرضاً لنظام جديد.
- Zhang وآخرون، آلة داروين-غودل (الإصدار الثالث، 12 مارس 2026). تذكر الدراسة الأصلية مكاسب على معيار البرمجة وتحدد أن صيانة الأرشيف واختيار الأصل يظلان ثابتين.
- Shi وآخرون، A-Evolve-Training (الإصدار الثالث، 8 سبتمبر 2026). تصف المسودة البحثية الأصلية أربع جولات من التدريب اللاحق وتنقيح السياسة ونتيجة لوحة المتصدرين المذكورة. ويظل الهدف والنظام الأساسي للعاملين محددين من الخارج.
- Zhang وآخرون، HyperAgents (2026). تختبر الدراسة الأصلية نقل إجراء لبناء الوكلاء وتذكر أن مقارنة التكرارات الـ200 الواردة هنا لا تتمتع بدلالة إحصائية.
- قراءة متعمقة للمراجعة بقلم Manuel Muñoz Plá (18 سبتمبر 2026) تتناول أمثلة المستويات العليا وحدود الأدلة في المراجعة. وتحلل إصداراً أسبق من الورقة؛ أما المادة أعلاه فتستند إلى الإصدار الثالث والدراسات الأصلية المذكورة في ادعاءاتها الواقعية.
- تقرير South China Morning Post (14 سبتمبر 2026) يتناول خارطة المراحل الخمس وسياق أبحاث الذكاء الاصطناعي. وهو تغطية ثانوية، وليس دليلاً على نتائج الدراسات.
- شرح The Rundown AI (16 سبتمبر 2026) يلخص المستويات ويضع الورقة في سياق الجدل حول أتمتة أبحاث الذكاء الاصطناعي. وهو تغطية ثانوية؛ وتدعم الورقة والدراسات الأصلية الادعاءات الواقعية أعلاه.



