العالم لا ينتظر.RSS
BIG CHANGE.

نسخة Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# مراجعة بحثية عن التحسين الذاتي للذكاء الاصطناعي ترسم الفجوة بين الأتمتة وصنع أجيال أفضل

> ترسم مراجعة بحثية جديدة خمسة مستويات لسيطرة الذكاء الاصطناعي على تحسينه. وتُظهر الأنظمة الحالية مكاسب محدودة النطاق، بينما لم يثبت بعد تحسن موثوق عبر أجيال متعاقبة.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

تضع [مراجعة بحثية نُشرت على arXiv في 10 سبتمبر ونُقحت في 22 سبتمبر](https://arxiv.org/html/2609.11873v3) خمسة مستويات لمشاركة الذكاء الاصطناعي في تحسين أنظمة الذكاء الاصطناعي. أما عنوانها، *«آخر ذكاء اصطناعي يبنيه البشر»*، فيصف طموحاً لا حدثاً أفاد المؤلفون بوقوعه. وتصل أدلتهم إلى أمثلة محدودة لأنظمة تنقح أجزاءً من عملية تطويرها. لكنها لا تثبت وجود نظام يصنع أجيالاً لاحقة أفضل منه بصورة موثوقة جيلاً بعد جيل.

ويهم هذا الفارق عند تفسير الادعاءات بشأن أتمتة أبحاث الذكاء الاصطناعي. فقد يجري الوكيل تجارب ويحفظ الدروس ويحسن نتيجة معيارية فيما يظل البشر يحددون هدفه ويتحكمون في الاختبارات ويقررون التغييرات التي تستمر. ويتطلب الادعاء الأقوى دليلاً على أن النظام حسّن *المنهج* الذي ينتج نسخته التالية، وأن المنهج المنقح حقق أداءً أفضل في مقارنة منصفة.

## التغيير الأبرز

- **ما الذي تغيّر:** بات لدى الباحثين الآن وصف أدق لمقدار ما يسيطر عليه النظام من حلقة تحسين الذكاء الاصطناعي، من تنفيذ التحديثات الموكلة إليه إلى تنقيح الإجراء المستخدم في التحديثات اللاحقة. وتنظم المراجعة الجديدة الأعمال القائمة؛ ولا تعلن عن أداة مكتملة لبناء جيل لاحق مستقل.
- **لماذا يهم ذلك:** تستطيع مختبرات الذكاء الاصطناعي أتمتة مزيد من التجارب من دون إثبات أن كل وكيل جديد أفضل في صنع الوكيل الذي يليه. ويؤثر هذا الفارق في تفسير الباحثين لادعاءات الأداء وفي تحديد المواضع التي يحتاجون فيها إلى مراجعة بشرية واختبارات مستقلة.
- **ما الذي ينبغي متابعته:** يتمثل الدليل الحاسم في سلسلة أجيال لاحقة تستخدم منهج تحسين موروثاً ومنقحاً، وتُختبر في مهام محمية مقابل المنهج السابق وبموارد متماثلة. ولم تثبت الأعمال التي استعرضتها الدراسة حتى الآن تراكم مكاسب موثوقاً به إحصائياً وفق هذا المعيار.

## خمسة مستويات تصف السيطرة على حلقة التحسين

يفصل البحث أولاً بين تنقيح مهمة واحدة، ويسميه B0، والتحسين المستمر. فالنموذج الذي يحرر إجابة إلى أن تجتاز فحصاً قد حسّن تلك الإجابة. لكن النظام نفسه لا يكتسب تحديثاً دائماً ما لم ينتقل التغيير إلى مهام لاحقة مستقلة.

في **المستوى 1**، يختار البشر الهدف واختبار النجاح، بينما ينفذ الذكاء الاصطناعي تحديثاً، مثل تطبيق قاعدة جودة بيانات حددها الإنسان. وفي **المستوى 2**، يختار الذكاء الاصطناعي أيضاً استراتيجية للهدف المسند إليه، كأن يشخّص إخفاقات وكيل برمجة ويقترح تعديلات على أدواته. لكن الهدف واختبار القبول يظلان محددين من خارج النظام.

في **المستوى 3**، يساعد النظام في اختيار الخبرة التي يحتاج إليها تالياً، مثل مهام تدريب تستهدف مواطن الضعف التي اكتشفها. ويضيف **المستوى 4** تغذية راجعة من الاستخدام المستمر: يحتفظ النظام بتغييرات معتمدة في الذاكرة أو القواعد أو المكونات بعد مواجهة ظروف جديدة. وترى الورقة أن كلا المستويين يعتمد على جودة التغذية الراجعة والقواعد التي تحدد التغييرات التي تستمر.

**المستوى 5** يصل إلى الفكرة المحورية في المراجعة. إذ ينقح الذكاء الاصطناعي إجراءً يوجّه التحسين *اللاحق*، مثل سياسة البحث أو أداة التقييم أو الوكيل الذي يقترح الأجيال التالية. ويجب الاحتفاظ بالإجراء المنقح واستخدامه في جولة لاحقة. وحتى في هذا المستوى، تقول الورقة إن بإمكان البشر الاحتفاظ بالسيطرة على الهدف العام واختبارات القبول المحمية والموارد. ويصف المستوى المسؤولية المفوضة، لا ضمان التقدم أو الاستقلال المطلق.

## الأنظمة القائمة توضح الحد الفاصل

وتذكر دراسة [آلة داروين-غودل](https://arxiv.org/html/2505.22954) أن وكيل البرمجة لديها رفع أداءه من 20% إلى 50% على مجموعة فرعية من معيار SWE-bench، إذ عدلت نسخ متعددة شيفرة الوكيل وأُدخلت النسخ الناجحة إلى أرشيف. ويذكر مؤلفوها أيضاً أن صيانة الأرشيف وقاعدة اختيار النسخة التي تصبح أصلاً ثابتتان. وتستخدمها المراجعة لتوضيح أن تحسن الأجيال اللاحقة وحده لا يثبت أن عملية اختيارها حسّنت نفسها.

[ويقدم A-Evolve-Training](https://arxiv.org/html/2606.20657) مثالاً أضيق نطاقاً للمستوى 5. فقد أجرى أربع جولات من التدريب اللاحق لنموذج يضم 30 مليار مُعامل. وجمع وكيل فوقي النتائج وغيّر سياسة البحث التي توجه العاملين في الجولات اللاحقة، بعد أن توقفت درجة التطوير الداخلية عن مواكبة لوحة المتصدرين الخارجية. وذكرت الدراسة نتيجة نهائية قدرها 0.86، مقارنةً بـ0.87 لأفضل مشاركة بشرية آنذاك. وقد غيّرت السياسة الموروثة طريقة اختيار التجارب اللاحقة، فيما ظل النظام الأساسي للعاملين وهدف المنافسة ثابتين. وهذا يوضح إجراء بحثياً منقحاً يعمل داخل مشروع محدد، لا سيطرة مستقلة على كل جوانب تطوير النموذج.

وتختبر [دراسة HyperAgents](https://arxiv.org/html/2603.19461) ما إذا كان إجراء محسن لبناء الوكلاء ينتقل إلى مجال جديد. فبعد 200 تكرار على تقييمات الرياضيات، سجل تشغيل بدأ بتحسينات منقولة 0.640 على مجموعة الاختبار، مقابل 0.610 لتشغيل بدأ بوكيله الأولي. ويقول المؤلفون إن هذا الفرق لم يكن ذا دلالة إحصائية. وتدعم النتيجة دراسة النقل، لكنها لا تثبت تراكم مكاسب موثوقاً عبر مرات التشغيل.

## زيادة النشاط لا تثبت تحسناً في عملية التحسين

تميز المراجعة بين إعادة استخدام إجراء منقح، وتسميه *العود البنيوي*، وبين *العود الفعّال*: أي أن الإجراء المنقح ينتج أجيالاً لاحقة أقوى في ظل ميزانيات متقاربة وتقييم مستقل. وهذا الاختبار الثاني هو ما قد يدفع عنوان الورقة المثير القراء إلى افتراض أنه تحقق بالفعل.

وثمة طرق عدة للخلط بين النشاط والتقدم. فقد يخصص النظام وقتاً حاسوبياً أطول للبحث، أو يفرط في مواءمة معيار كرر الاستعلام عنه، أو يحتفظ بتغيير يفيد مهمة واحدة ويضر بأخرى. وإذا غيّر أداة التقييم الخاصة به أيضاً، فقد تعكس الدرجات الأعلى مقياساً جديداً. لذلك تدعو الورقة إلى تسجيل ما جرى تنقيحه، وإظهار أن المكوّن المنقح وجّه الجولة التالية فعلاً، ومقارنته بالمكوّن السابق بموارد متكافئة، واختبار الاحتفاظ بالتغييرات ونقلها إلى مهام مستقلة.

ويقول المؤلفون صراحةً إن النتائج الحالية تدعم تغييرات محدودة النطاق في أنظمة التحسين وأدوات التقييم وسياسات البحث، بينما «ما زال تراكم التحسن الموثوق إحصائياً عبر الأجيال في ظل موارد متقاربة مسألة مفتوحة». وتسمي عبارة «آخر ذكاء اصطناعي يبنيه البشر» الغاية التي تحفز إطارهم. وتقدم المراجعة معايير لتقييم التقدم نحوها.

## المصادر ومواد إضافية للقراءة

- [Duan وآخرون، *«آخر ذكاء اصطناعي يبنيه البشر»*، الإصدار الثالث](https://arxiv.org/html/2609.11873v3) (22 سبتمبر 2026). تعرّف المراجعة البحثية الأساسية B0 والمستويات 1–5، وتميز بين العود البنيوي والفعّال وتوضح حدود الأدلة. وتصنيفها وتفسيرها إطار المؤلفين، لا عرضاً لنظام جديد.
- [Zhang وآخرون، *آلة داروين-غودل*](https://arxiv.org/html/2505.22954) (الإصدار الثالث، 12 مارس 2026). تذكر الدراسة الأصلية مكاسب على معيار البرمجة وتحدد أن صيانة الأرشيف واختيار الأصل يظلان ثابتين.
- [Shi وآخرون، *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (الإصدار الثالث، 8 سبتمبر 2026). تصف المسودة البحثية الأصلية أربع جولات من التدريب اللاحق وتنقيح السياسة ونتيجة لوحة المتصدرين المذكورة. ويظل الهدف والنظام الأساسي للعاملين محددين من الخارج.
- [Zhang وآخرون، *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). تختبر الدراسة الأصلية نقل إجراء لبناء الوكلاء وتذكر أن مقارنة التكرارات الـ200 الواردة هنا لا تتمتع بدلالة إحصائية.
- [قراءة متعمقة للمراجعة بقلم Manuel Muñoz Plá](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 سبتمبر 2026) تتناول أمثلة المستويات العليا وحدود الأدلة في المراجعة. وتحلل إصداراً أسبق من الورقة؛ أما المادة أعلاه فتستند إلى الإصدار الثالث والدراسات الأصلية المذكورة في ادعاءاتها الواقعية.
- [تقرير South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 سبتمبر 2026) يتناول خارطة المراحل الخمس وسياق أبحاث الذكاء الاصطناعي. وهو تغطية ثانوية، وليس دليلاً على نتائج الدراسات.
- [شرح The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 سبتمبر 2026) يلخص المستويات ويضع الورقة في سياق الجدل حول أتمتة أبحاث الذكاء الاصطناعي. وهو تغطية ثانوية؛ وتدعم الورقة والدراسات الأصلية الادعاءات الواقعية أعلاه.

## Sources

- [Duan وآخرون: «آخر ذكاء اصطناعي يبنيه البشر»، الإصدار الثالث](https://arxiv.org/html/2609.11873v3) — مراجعة بحثية أساسية لمستويات الاستقلالية وأمثلة البحث. تعرّف العود البنيوي والفعّال وتقول إن تراكم التحسن الموثوق إحصائياً عبر الأجيال في ظل موارد متقاربة ما زال مسألة مفتوحة. ولا تعرض بناء ذكاء اصطناعي مستقل جديد.
- [سجل الإصدارات على arXiv للمقالة 2609.11873](https://arxiv.org/abs/2609.11873) — يسجل الإصدار الأول في 10 سبتمبر والثالث في 22 سبتمبر؛ ويحدد Yi Duan و34 مؤلفاً مشاركاً.
- [Zhang وآخرون: آلة داروين-غودل](https://arxiv.org/html/2505.22954) — تذكر الدراسة الأصلية ارتفاع النتيجة من 20% إلى 50% على مجموعتها الفرعية من SWE-bench، وتوضح أن النظام لا يستطيع تعديل صيانة الأرشيف أو اختيار الأصل.
- [Shi وآخرون: A-Evolve-Training](https://arxiv.org/html/2606.20657) — تصف المسودة الأصلية أربع جولات تدريب لاحق مستقلة وسياسة بحث منقحة محفوظة ونتيجة لوحة متصدرين قدرها 0.86 مقابل 0.87 في تاريخ المقارنة المذكور. وظل النظام الأساسي للعاملين والهدف ثابتين.
- [Zhang وآخرون: HyperAgents](https://arxiv.org/html/2603.19461) — تذكر الدراسة الأصلية مقارنة النقل بعد 200 تكرار، بنتيجتي 0.640 مقابل 0.610 في مجموعة اختبار لتقييم الرياضيات؛ والفرق غير ذي دلالة إحصائية.
- [Manuel Muñoz Plá: قراءة متعمقة لورقة «آخر ذكاء اصطناعي يبنيه البشر»](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — قراءة مستقلة متعمقة لإصدار أسبق من المراجعة. أُدرجت للسياق؛ وتدعم الأوراق الأصلية ادعاءات البحث الواردة في هذه المادة.
- [South China Morning Post: باحثون صينيون يرسمون مساراً من خمس مراحل](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — تقرير ثانوي عن هذه المراجعة وسياق أبحاثها. وهو للقراءة الإضافية، لا دليل أساسي على النتائج التجريبية.
- [The Rundown AI: باحثون صينيون يطرحون تصوراً لذكاء اصطناعي يصنع أجياله اللاحقة](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — شرح ثانوي لمستويات الورقة الخمسة والنقاش الأوسع. وتدعم الأوراق الأصلية الادعاءات البحثية الواقعية في هذه المادة.
نشرة BIG CHANGE البريدية

الصورة الأوسع. على وتيرتك.

قصص حديثة عن الذكاء الاصطناعي والروبوتات، وتحولات تستحق المتابعة، وأفكار عملية للتطبيق. اختر موجزًا يوميًا أو خلاصة أسبوعية أو رؤية شهرية.