AI-translated from English; not yet reviewed by a fluent editor.
# AI کی خود بہتری کا سروے خودکاری اور بہتر جانشینوں کے درمیان فرق دکھاتا ہے
> ایک نیا سروے AI کی اپنی بہتری پر کنٹرول کی پانچ سطحیں بیان کرتا ہے۔ موجودہ نظام محدود دائرے میں فائدے دکھاتے ہیں، جبکہ مسلسل نسلوں میں قابلِ اعتماد بہتری ابھی ثابت نہیں ہوئی۔
By BIG CHANGE Editorial
Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

AI-generated conceptual illustration by BIG CHANGE.
ایک [10 ستمبر کو arXiv پر شائع اور 22 ستمبر کو نظرثانی شدہ سروے](https://arxiv.org/html/2609.11873v3) AI نظاموں کو بہتر بنانے میں AI کی شمولیت کی پانچ سطحیں بیان کرتا ہے۔ اس کا عنوان، *The Last AI Built by Humans*، ایک آرزو کو بیان کرتا ہے، مصنفین کا رپورٹ کردہ واقعہ نہیں۔ ان کے شواہد ایسے نظاموں کی محدود مثالوں تک پہنچتے ہیں جو اپنی ترقی کے عمل کے کچھ حصوں پر نظرثانی کرتے ہیں۔ اس سے یہ ثابت نہیں ہوتا کہ کوئی نظام نسل در نسل قابلِ اعتماد طور پر بہتر جانشین بناتا ہے۔
خودکار AI تحقیق کے دعووں کو سمجھتے وقت یہ فرق اہم ہے۔ کوئی ایجنٹ تجربات چلا، اسباق محفوظ اور بینچ مارک اسکور بہتر کرسکتا ہے، جبکہ لوگ اب بھی اس کا مقصد مقرر کریں، آزمائشوں کو قابو میں رکھیں اور فیصلہ کریں کہ کون سی تبدیلی برقرار رہے۔ زیادہ مضبوط دعوے کے لیے ثبوت درکار ہے کہ نظام نے اس *طریقۂ کار* کو بہتر کیا جو اس کا اگلا ورژن بناتا ہے، اور منصفانہ موازنے میں نظرثانی شدہ طریقہ واقعی بہتر کام کرتا ہے۔
## بڑی تبدیلی
- **کیا بدلا:** محققین کے پاس اب یہ بیان کرنے کا زیادہ دقیق طریقہ ہے کہ نظام AI کی بہتری کے سلسلے کے کتنے حصے پر قابو رکھتا ہے: اسے سونپی گئی تبدیلیاں کرنے سے لے کر بعد کی تبدیلیوں میں استعمال ہونے والے طریقۂ کار پر نظرثانی تک۔ یہ نیا سروے موجودہ کام کو منظم کرتا ہے؛ یہ خودمختار طور پر جانشین بنانے والے تیار نظام کا اعلان نہیں۔
- **یہ کیوں اہم ہے:** AI لیبز مزید تجربات خودکار بناسکتی ہیں، مگر اس سے یہ ثابت نہیں ہوتا کہ ہر نیا ایجنٹ اگلا ایجنٹ بنانے میں بہتر ہے۔ یہ فرق اس بات پر اثرانداز ہوتا ہے کہ محققین کارکردگی کے دعووں کو کیسے سمجھیں اور انسانی جائزہ و آزادانہ آزمائش کہاں برقرار رکھیں۔
- **کس بات پر نظر رکھیں:** فیصلہ کن ثبوت جانشینوں کا ایک سلسلہ ہے جو وراثت میں ملے، نظرثانی شدہ بہتری کے طریقے سے بنے اور الگ رکھے گئے آزمائشی کاموں پر پرانے طریقے کے مقابل یکساں وسائل میں آزمائے جائیں۔ سروے میں شامل کام ابھی تک یہ ثابت نہیں کرتے کہ اس بنیاد پر بہتری نسل در نسل اعدادوشمار کے لحاظ سے قابلِ اعتماد طور پر جمع ہوتی ہے۔
## بہتری کے سلسلے پر کنٹرول کی پانچ سطحیں
مقالہ سب سے پہلے ایک کام تک محدود نظرثانی، جسے B0 کہتا ہے، اور مستقل بہتری میں فرق کرتا ہے۔ اگر کوئی ماڈل جواب کو اس وقت تک درست کرے جب تک وہ جانچ پر پورا نہ اترے تو اس نے وہ جواب بہتر کیا ہے۔ جب تک یہ تبدیلی بعد کے، آزاد کاموں میں منتقل نہ ہو، نظام نے خود کوئی دیرپا تبدیلی حاصل نہیں کی۔
درجہ **1** پر لوگ ہدف اور کامیابی کی جانچ منتخب کرتے ہیں؛ AI تبدیلی کرتا ہے، مثلاً انسان کے متعین کردہ ڈیٹا کوالٹی قاعدے پر عمل۔ **درجہ 2** پر AI سونپے گئے ہدف کے لیے حکمتِ عملی بھی چنتا ہے، مثلاً کوڈنگ ایجنٹ کی ناکامیوں کی تشخیص اور اس کے ٹولز میں تبدیلی کی تجویز۔ مقصد اور قبولیت کی جانچ اب بھی نظام کے باہر سے طے ہوتے ہیں۔
درجہ **3** پر نظام یہ چننے میں مدد دیتا ہے کہ اسے آگے کس تجربے کی ضرورت ہے، مثلاً اپنی شناخت کردہ کمزوریوں کے لیے مشقی کام بنانا۔ **درجہ 4** میں مسلسل استعمال سے ملنے والا فیڈبیک شامل ہوتا ہے: نئی صورتوں کا سامنا کرنے کے بعد نظام میموری، قواعد یا اجزا کی منظور شدہ تبدیلیاں محفوظ رکھتا ہے۔ مقالہ کہتا ہے کہ دونوں سطحیں فیڈبیک کے معیار اور یہ طے کرنے والے قواعد پر منحصر ہیں کہ کون سی تبدیلیاں برقرار رہیں۔
**درجہ 5** سروے کے مرکزی تصور تک پہنچتا ہے۔ AI اس طریقۂ کار پر نظرثانی کرتا ہے جو *بعد کی* بہتری کی رہنمائی کرتا ہے، مثلاً تلاش کی حکمتِ عملی، جانچنے والا یا جانشین تجویز کرنے والا ایجنٹ۔ نظرثانی شدہ طریقہ برقرار رہنا اور اگلے مرحلے میں استعمال ہونا چاہیے۔ یہاں بھی مقالہ کہتا ہے کہ لوگ مجموعی مقصد، محفوظ قبولیتی آزمائشوں اور وسائل کا کنٹرول اپنے پاس رکھ سکتے ہیں۔ سطح تفویض کردہ ذمہ داری بیان کرتی ہے، پیش رفت کی ضمانت یا بے قید خودمختاری نہیں۔
## موجودہ نظام حدود کو واضح کرتے ہیں
Darwin Gödel Machine کا [مطالعہ](https://arxiv.org/html/2505.22954) رپورٹ کرتا ہے کہ اس کے کوڈنگ ایجنٹ کا اسکور مطالعے کے SWE-bench ذیلی مجموعے پر 20% سے بڑھ کر 50% ہوا، جب مختلف صورتوں میں ایجنٹ کا کوڈ بدلا گیا اور کامیاب صورتیں آرکائیو میں شامل ہوئیں۔ مصنفین یہ بھی کہتے ہیں کہ آرکائیو کی دیکھ بھال اور یہ قاعدہ کہ کون سا متبادل اگلے نسخے کا نقطۂ آغاز بنے، مقرر تھے۔ سروے اس مثال سے دکھاتا ہے کہ بہتر جانشین بذاتِ خود یہ ثابت نہیں کرتے کہ جانشین منتخب کرنے کا عمل خود بہتر ہوا ہے۔
[A-Evolve-Training](https://arxiv.org/html/2606.20657) سطح 5 کی زیادہ محدود مثال دیتا ہے۔ اس میں 30 ارب پیرامیٹرز کے ماڈل پر بعد از تربیت کے چار دور چلائے گئے۔ ایک میٹا ایجنٹ نے نتائج یکجا کیے اور بعد کے کارکنوں کی رہنمائی کرنے والی تحقیقی پالیسی اس وقت بدلی جب اندرونی ڈیولپمنٹ اسکور بیرونی لیڈر بورڈ کے نتائج سے میل کھانا چھوڑ گیا۔ مطالعہ 0.86 کا آخری اسکور رپورٹ کرتا ہے، جبکہ اس وقت بہترین انسانی جمع کرائی گئی کوشش کا اسکور 0.87 تھا۔ وراثت میں ملنے والی پالیسی نے بعد کے تجربات کے انتخاب کا طریقہ بدلا۔ کارکنوں کا بنیادی نظام اور مقابلے کا مقصد مقرر رہے۔ یہ متعین پروجیکٹ کے اندر نظرثانی شدہ تحقیقی طریقہ کار کا استعمال دکھاتا ہے، ماڈل کی ترقی کے ہر حصے پر خودمختار کنٹرول نہیں۔
HyperAgents کا [مطالعہ](https://arxiv.org/html/2603.19461) جانچتا ہے کہ ایجنٹ بنانے کا بہتر طریقہ نئے شعبے میں منتقل ہوتا ہے یا نہیں۔ ریاضی کی جانچ کے کام پر 200 تکرار کے بعد، منتقل شدہ بہتری سے آغاز کرنے والی آزمائش نے اپنے ٹیسٹ سیٹ پر 0.640 اسکور کیا، جبکہ ابتدائی ایجنٹ سے شروع ہونے والی آزمائش کا اسکور 0.610 تھا۔ مصنفین کے مطابق یہ فرق اعدادوشمار کے لحاظ سے اہم نہیں تھا۔ نتیجہ طریقہ منتقل کرنے کی مزید تحقیق کی حمایت کرتا ہے، مگر مختلف آزمائشوں میں قابلِ اعتماد طور پر مرکب ہوتی بہتری ثابت نہیں کرتا۔
## زیادہ سرگرمی، بہتر بہتری کا ثبوت نہیں
سروے نظرثانی شدہ طریقہ دوبارہ استعمال کرنے کو *ساختی بازگشت* کہتا ہے، اور اسے *موثر بازگشت* سے الگ کرتا ہے: موثر بازگشت میں نظرثانی شدہ طریقہ یکساں وسائل اور آزادانہ جائزے کے تحت زیادہ مضبوط جانشین بناتا ہے۔ ڈرامائی عنوان پڑھنے والوں کو یہ فرض کرنے کی دعوت دیتا ہے کہ دوسرا امتحان پہلے ہی پورا ہوچکا ہے۔
سرگرمی کو پیش رفت سمجھنے کی کئی غلط وجوہ ہیں۔ کوئی نظام تلاش میں زیادہ کمپیوٹنگ وقت صرف کرسکتا ہے، جس بینچ مارک کو بار بار آزمایا گیا ہو اس پر حد سے زیادہ فِٹ ہوسکتا ہے یا ایسی تبدیلی برقرار رکھ سکتا ہے جو ایک کام میں مدد دے مگر دوسرے کو نقصان پہنچائے۔ اگر وہ اپنا جانچنے والا بھی بدل دے تو بلند اسکور کسی نئے پیمانے کا نتیجہ ہوسکتے ہیں۔ اسی لیے مقالہ مطالبہ کرتا ہے کہ کیا بدلا یہ ریکارڈ کیا جائے، دکھایا جائے کہ نظرثانی شدہ جزو نے اگلے دور کی واقعی رہنمائی کی، پرانے جزو سے یکساں وسائل میں موازنہ کیا جائے، اور آزاد کاموں پر تبدیلی کے برقرار رہنے اور منتقل ہونے کو جانچا جائے۔
مصنفین صاف کہتے ہیں کہ موجودہ نتائج بہتری کے طریقوں، جانچنے والوں اور تحقیقی پالیسیوں میں محدود تبدیلیوں کی حمایت کرتے ہیں، جبکہ “یکساں وسائل میں نسل در نسل اعدادوشمار کے لحاظ سے قابلِ اعتماد بہتری کا جمع ہونا ابھی ایک کھلا سوال ہے۔” “انسانوں کا بنایا ہوا آخری AI” وہ منزل ہے جو ان کے خاکے کو تحریک دیتی ہے۔ سروے اس تک پیش رفت پرکھنے کے معیارات فراہم کرتا ہے۔
## ذرائع اور مزید مطالعہ
- [Duan وغیرہ، *The Last AI Built by Humans*، نسخہ 3](https://arxiv.org/html/2609.11873v3) (22 ستمبر 2026)۔ بنیادی سروے B0 اور سطحیں 1 تا 5 متعین کرتا، ساختی بازگشت اور مؤثر بازگشت میں فرق کرتا اور شواہد کی حدود بیان کرتا ہے۔ اس کی درجہ بندی اور تشریحات مصنفین کا خاکہ ہیں، نئے نظام کا مظاہرہ نہیں۔
- [Zhang وغیرہ، *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (نسخہ 3، 12 مارچ 2026)۔ اصل مطالعہ کوڈنگ بینچ مارک میں بہتری بیان کرتا ہے اور بتاتا ہے کہ آرکائیو کی دیکھ بھال اور والد صورت کا انتخاب مقرر رہے۔
- [Shi وغیرہ، *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (نسخہ 3، 8 ستمبر 2026)۔ اصل پری پرنٹ بعد از تربیت کے چار دور، پالیسی میں نظرثانی اور بیان کردہ لیڈر بورڈ نتیجہ بتاتا ہے۔ اس کا مقصد اور کارکنوں کا بنیادی نظام بیرونی طور پر مقرر رہا۔
- [Zhang وغیرہ، *HyperAgents*](https://arxiv.org/html/2603.19461) (2026)۔ اصل مطالعہ ایجنٹ بنانے کا طریقہ منتقل کرنے کی جانچ کرتا اور بتاتا ہے کہ یہاں درج 200 تکرار والا موازنہ اعدادوشمار کے لحاظ سے اہم نہیں تھا۔
- [Manuel Muñoz Plá کا تفصیلی مطالعہ](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 ستمبر 2026) سروے کی اعلیٰ سطح کی مثالوں اور شواہد کی حدود کا باریک مطالعہ ہے۔ یہ مقالے کے پہلے نسخے کا تجزیہ کرتا ہے؛ اوپر کا مضمون نسخہ 3 اور حقائق کے لیے اصل مطالعات استعمال کرتا ہے۔
- [South China Morning Post کی رپورٹ](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 ستمبر 2026) سروے کے پانچ مرحلوں کے خاکے اور AI تحقیق کے سیاق کا احاطہ کرتی ہے۔ یہ ثانوی رپورٹنگ ہے، مطالعات کے نتائج کا ثبوت نہیں۔
- [The Rundown AI کی وضاحت](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 ستمبر 2026) سطحوں کا خلاصہ اور خودکار AI تحقیق کی بحث میں مقالے کی جگہ بیان کرتی ہے۔ یہ ثانوی مواد ہے؛ اوپر کے حقائق کی تائید مقالے اور اصل مطالعات کرتے ہیں۔
## Sources
- [Duan وغیرہ: The Last AI Built by Humans، نسخہ 3](https://arxiv.org/html/2609.11873v3) — AI کی خودمختاری کی سطحوں اور تحقیقی مثالوں کا بنیادی سروے۔ ساختی بازگشت اور مؤثر بازگشت میں فرق کرتا ہے اور کہتا ہے کہ یکساں وسائل کے تحت نسلوں میں جمع ہوتی قابلِ اعتماد بہتری ابھی اعدادوشماری طور پر ثابت نہیں ہوئی۔ یہ نئے خودمختار AI کی تیاری کا مظاہرہ نہیں۔
- [2609.11873 کے لیے arXiv جمع آوری کی تاریخ](https://arxiv.org/abs/2609.11873) — نسخہ 1 کی تاریخ 10 ستمبر اور نسخہ 3 کی 22 ستمبر درج کرتا اور Yi Duan سمیت 34 شریک مصنفین کی شناخت کرتا ہے۔
- [Zhang وغیرہ: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — اصل مطالعہ اپنے SWE-bench ذیلی مجموعے پر 20% سے 50% تک بہتری رپورٹ کرتا ہے اور کہتا ہے کہ نظام آرکائیو کی دیکھ بھال یا اگلے نمونے کے انتخاب کے عمل میں تبدیلی نہیں کرسکتا۔
- [Shi وغیرہ: A-Evolve-Training](https://arxiv.org/html/2606.20657) — اصل پری پرنٹ بعد از تربیت کے چار خودکار دور، نظرثانی شدہ محفوظ تحقیقی پالیسی اور متعلقہ وقت کے لیڈر بورڈ پر 0.86 بمقابلہ 0.87 اسکور بیان کرتا ہے۔ کارکنوں کا بنیادی نظام اور مقصد مقرر ہیں۔
- [Zhang وغیرہ: HyperAgents](https://arxiv.org/html/2603.19461) — اصل مطالعہ ریاضی کی جانچ کے ٹیسٹ سیٹ پر 200 تکرار کے بعد منتقلی کا 0.640 بمقابلہ 0.610 موازنہ رپورٹ کرتا ہے؛ فرق اعدادوشمار کے لحاظ سے اہم نہیں۔
- [Manuel Muñoz Plá: انسانوں کا بنایا ہوا آخری AI، تفصیلی مطالعہ](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — سروے کے پہلے نسخے کا آزادانہ باریک مطالعہ۔ سیاق کے لیے شامل ہے؛ اس مضمون کے تحقیقی دعووں کی تائید اصل مقالے کرتے ہیں۔
- [South China Morning Post: چینی محققین نے پانچ مرحلوں کا راستہ پیش کیا](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — اس سروے اور تحقیقی سیاق پر ثانوی رپورٹ۔ مزید مطالعے کے لیے ہے، تجرباتی نتائج کا بنیادی ثبوت نہیں۔
- [The Rundown AI: چینی محققین نے AI کے اپنے جانشین بنانے کا خاکہ پیش کیا](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — مقالے کی پانچ سطحوں اور وسیع تر بحث کی ثانوی وضاحت۔ تحقیق سے متعلق حقائق کے لیے اصل مقالے بنیادی ماخذ ہیں۔
BIG CHANGE نیوز لیٹر
بڑی تصویر۔ اپنی رفتار سے۔
AI اور روبوٹکس کی تازہ کہانیاں، قابلِ توجہ تبدیلیاں اور عملی خیالات۔ روزانہ بریفنگ، ہفتہ وار خلاصہ یا ماہانہ نقطۂ نظر منتخب کریں۔
Belgrade کے وقت کے مطابق 09:00 پر بھیجا جاتا ہے: روزانہ، پیر کو یا مہینے کی پہلی تاریخ کو۔ تصدیق کے بعد اگلی مقررہ ترسیل میں آپ کا پہلا شمارہ آئے گا۔
آپ کی رازداری، آپ کا انتخاب۔
ضروری اسٹوریج سائٹ کی حفاظت میں مدد دیتا ہے اور آپ کی ترجیحات یاد رکھتا ہے۔ آپ کی اجازت تک اختیاری Google Analytics بند رہتا ہے۔ آپ ہر کہانی صرف ضروری اسٹوریج کے ساتھ پڑھ سکتے ہیں۔ رازداری کی تفصیل