23 ستمبر کو ہونے والے Fellows Forum میں، OpenAI کے اطلاقی تحقیق کے سربراہ Boris Power نے اندازہ لگایا کہ کمپنی کی تحقیق کا 80–90 فیصد “GPT-7، GPT-8 اور اس کے بعد کی نسلوں” پر مرکوز ہے۔ انہوں نے یہ شرح اس وضاحت کے دوران بتائی کہ OpenAI موجودہ مصنوعات پر کام اور زیادہ صلاحیت والے ماڈلز کی تحقیق میں توازن کیسے رکھتا ہے۔ یہ عوامی گفتگو میں ان کا دیا ہوا اندازہ ہے؛ OpenAI نے تحقیق کے وسائل کی ایسی تفصیل شائع نہیں کی جس سے اس کا موازنہ کیا جا سکے۔

بڑی تبدیلی

  • کیا بدلا ہے: Power نے کام کی دو باہم مربوط سمتیں بیان کیں: اس وقت لوگ جو ماڈل استعمال کرتے ہیں ان میں بہتری، اور آنے والی نسلوں کے لیے تحقیق۔ ان کے اندازے میں OpenAI کی زیادہ تر تحقیق دوسری سمت میں ہے۔
  • یہ کیوں اہم ہے: زیادہ طاقتور بڑا ماڈل کسی متعین کام کے لیے چھوٹے اور کم خرچ ماڈل کو تربیتی مثالیں دے سکتا ہے۔ اسی لیے ڈویلپرز سرِفہرست ماڈلز کی تحقیق پر نظر رکھتے ہیں، چاہے اپنی مصنوعات میں وہ چھوٹے ماڈل استعمال کریں۔
  • کس بات پر نظر رکھیں: مستقبل کے ماڈل اور تکنیکی انکشافات دکھا سکتے ہیں کہ بڑے ماڈلز کی پیش رفت چھوٹے ماڈلز تک پہنچتی ہے یا نہیں۔ انٹرویو میں GPT-7 یا GPT-8 کی ریلیز کی کوئی تاریخ، خصوصیات یا نتائج نہیں دیے گئے۔

اس اندازے کا پس منظر

Power، Zachary Lipton کے اس سوال کا جواب دے رہے تھے کہ صارفین کی درخواستیں تحقیق پر کیسے اثر ڈالتی ہیں۔ ان کے مطابق، OpenAI مخصوص رویے—مثلاً ٹولز کے استعمال—کو خاص تربیتی ڈیٹا اور اطلاقی تحقیق سے بہتر بنا سکتا ہے۔ ان کے بیان میں، ماڈل کی ایک نسل کے اندر بتدریج اپ ڈیٹس اکثر ایسی ضروریات پوری کرتی ہیں۔ ان کا کہنا تھا کہ بڑے ماڈلز کی نئی نسل یہ بدل سکتی ہے کہ مخصوص اصلاحات کی ضرورت کن چیزوں کے لیے باقی رہتی ہے۔ انہوں نے کچھ موجودہ سرمایہ کاری کو آج ہی سیکھنے اور بہتری کی رفتار بڑھانے کا ذریعہ بتایا، خواہ وہ طویل مدتی حکمتِ عملی نہ ہو۔

اسی فرق نے 80–90 فیصد کے بیان کا پس منظر بنایا، جو Fellows Forum کی ریکارڈنگ میں 1:32:52 پر ہے۔ Power نے تحقیق کا حوالہ OpenAI میں دیا تھا، صرف اپنی ٹیم کی تحقیق کا نہیں۔ نہ ریکارڈنگ اور نہ OpenAI کا شائع شدہ مواد یہ بتاتا ہے کہ گنی گئی تحقیق کی تعریف کیا تھی، کون سا عرصہ، بجٹ یا عملے کی تعداد دیکھی گئی، یا اس اندازے تک پہنچنے کا طریقہ کیا تھا۔ اس لیے اس عدد کو Power کی ترجیحات کی وضاحت سمجھنا چاہیے، کمپنی کے اخراجات یا عملے کی آڈٹ شدہ پیمائش نہیں۔

Power نے GPT-7 اور GPT-8 کو آنے والی نسلوں کی مثالوں کے طور پر نام لیا۔ انہوں نے کسی بھی ماڈل کے اجرا کا اعلان نہیں کیا، ترقی کا کوئی سنگِ میل ظاہر نہیں کیا اور نہ ریلیز کا شیڈول دیا۔ OpenAI کے موجودہ ماڈلز کی فہرست میں GPT-6 Astra، Sol اور Luna درج ہیں؛ اس سے Power کے استعمال کردہ ناموں کا عوامی سیاق ملتا ہے، لیکن بعد کی نسلوں کی موجودہ حالت کا کوئی ثبوت نہیں۔

انہوں نے ڈسٹلیشن کا ذکر کیوں کیا

اندازہ بتانے کے فوراً بعد Power نے ایک بڑے GPT-6 Astra ماڈل کی جانب سے چھوٹے GPT Luna ماڈل کو سکھانے کی وضاحت کی۔ ان کا نکتہ یہ تھا کہ طاقتور بڑا ماڈل چھوٹے ماڈل کی تربیت کے لیے مثالیں فراہم کر سکتا ہے۔ وہ ایک تحقیقی طریقہ سمجھا رہے تھے، یہ دستاویز نہیں کر رہے تھے کہ Luna کے کسی مخصوص جاری شدہ ماڈل کو Astra سے تربیت دی گئی ہے۔

OpenAI کی زیرِ نگرانی فائن ٹیوننگ کی رہنمائی اس طریقۂ کار کی وضاحت کرتی ہے۔ پہلے ڈویلپر یہ جانچتا ہے کہ بڑا ماڈل کسی متعین کام میں اچھا نتیجہ دیتا ہے؛ پھر موزوں نتائج محفوظ کرتا، انہیں چھوٹے ماڈل کی تربیتی مثالوں کے طور پر استعمال کرتا اور چھوٹے ماڈل کی اسی کام میں جانچ کرتا ہے۔ OpenAI کے مطابق اس سے چھوٹے ماڈل کی کارکردگی بڑے ماڈل کے قریب آ سکتی ہے، لیکن صرف کسی مخصوص کام میں۔ اس کا مطلب یہ نہیں کہ چھوٹے ماڈل کو استاد ماڈل کی ہر صلاحیت مل جاتی ہے۔ OpenAI کا ماڈل ڈسٹلیشن کا اعلان بھی محفوظ کردہ نتائج، جانچ اور فائن ٹیوننگ کو بار بار دہرائے جانے والے عمل کے طور پر بیان کرتا ہے۔

اس خیال کی تاریخ اس سے پرانی ہے۔ 2015 کے ایک تحقیقی مقالے میں Geoffrey Hinton، Oriol Vinyals اور Jeff Dean نے بڑے نظاموں سے ایسے ماڈل میں علم منتقل کرنے کا مطالعہ کیا جسے تعینات کرنا آسان ہو۔ یہ کام استاد اور شاگرد کے تصور کی وضاحت کرتا ہے؛ یہ OpenAI میں تحقیق کے موجودہ وسائل کی تقسیم کے بارے میں کچھ نہیں کہتا۔

یہ اس ربط کی وضاحت کرتا ہے جو Power نے سرِفہرست ماڈلز کی تحقیق اور عملی ماڈلز کے درمیان بیان کیا۔ زیادہ صلاحیت والا استاد ماڈل محدود مقصد کے کم خرچ نظاموں کے لیے مفید تربیتی مواد بنا سکتا ہے۔ اس طریقے کی کامیابی کا انحصار کام، چنی گئی مثالوں اور جانچ پر ہے۔ Astra–Luna کی مثال کے لیے Power نے ڈسٹلیشن کے نتائج یا تقابلی پیمائشیں پیش نہیں کیں۔

Power کا اندازہ اس لیے معنی خیز ہے کہ یہ بتاتا ہے کہ ان کے خیال میں OpenAI تحقیق سے سب سے زیادہ قدر کہاں متوقع ہے۔ عوامی شواہد اس بیان اور اس عمومی طریقے کی تصدیق کرتے ہیں جس کا انہوں نے ذکر کیا۔ ان سے یہ ثابت نہیں ہوتا کہ OpenAI کے وسائل حقیقتاً کیسے تقسیم ہیں یا GPT کی آئندہ نسل کیا پیش کرے گی۔