23 सप्टेंबरच्या Fellows Forum मध्ये, OpenAI चे उपयोजित संशोधन प्रमुख Boris Power यांनी कंपनीतील संशोधनापैकी 80–90% संशोधन “GPT-7, GPT-8 आणि त्यापुढील पिढ्यांवर” केंद्रित असल्याचा अंदाज व्यक्त केला. सध्याच्या उत्पादनांवरील काम आणि अधिक सक्षम मॉडेल्सवरील संशोधन यांचा OpenAI समतोल कसा राखते हे सांगताना त्यांनी हा आकडा दिला. हा सार्वजनिक चर्चेत व्यक्त केलेला त्यांचा अंदाज आहे; त्याची पडताळणी करता येईल असा संशोधन-वाटपाचा तपशील OpenAI ने प्रकाशित केलेला नाही.

मोठा बदल

  • काय बदलले: Power यांनी दोन परस्परांशी जोडलेल्या कामांच्या दिशा सांगितल्या: लोक सध्या वापरत असलेल्या मॉडेल्समधील सुधारणा आणि पुढील पिढ्यांसाठीचे संशोधन. OpenAI च्या बहुतांश संशोधनाचा वाटा दुसऱ्या दिशेकडे असल्याचा त्यांनी अंदाज दिला.
  • हे का महत्त्वाचे: अधिक सक्षम मोठे मॉडेल एखाद्या ठरावीक कामासाठी लहान, कमी खर्चाच्या मॉडेलला प्रशिक्षण देण्याची उदाहरणे पुरवू शकते. त्यामुळे स्वतःच्या उत्पादनांत लहान मॉडेल्स वापरणाऱ्या विकासकांनाही अत्याधुनिक संशोधनाकडे लक्ष देण्याचे कारण मिळते.
  • कशाकडे लक्ष द्यावे: पुढील मॉडेल्सची प्रकाशने आणि तांत्रिक खुलासे मोठ्या मॉडेल्समधील प्रगती लहान मॉडेल्सपर्यंत पोहोचते का, हे दाखवू शकतात. मुलाखतीत GPT-7 किंवा GPT-8 च्या प्रकाशनाच्या तारखा, तपशील किंवा निकाल दिलेले नाहीत.

या अंदाजामागचा संदर्भ

ग्राहकांच्या विनंत्यांचा संशोधनावर कसा परिणाम होतो, या Zachary Lipton यांच्या प्रश्नाला Power उत्तर देत होते. टूल्सचा वापर यांसारख्या विशिष्ट वर्तनात सुधारणा करण्यासाठी OpenAI विशेष प्रशिक्षण डेटा आणि उपयोजित संशोधन वापरू शकते, असे त्यांनी सांगितले. त्यांच्या मते, मॉडेलच्या एका पिढीतील टप्प्याटप्प्याच्या सुधारणांमधून अशा गरजा अनेकदा पूर्ण होतात. मोठ्या मॉडेल्सची नवी पिढी आल्यावर कोणत्या खास सुधारणांची गरज उरते, ते बदलू शकते, असा त्यांचा युक्तिवाद होता. दीर्घकालीन धोरण नसले तरी आज अधिक वेगाने शिकण्यास आणि सुधारण्यास मदत करणाऱ्या काही सध्याच्या गुंतवणुकींचेही त्यांनी वर्णन केले.

या फरकाच्या संदर्भातच Power यांनी Fellows Forum च्या ध्वनिमुद्रणातील 1:32:52 या वेळेवर80–90% चा उल्लेख केला. त्यांनी OpenAI मधील संशोधनाचासंदर्भ दिला; केवळ स्वतःच्या टीमच्या संशोधनाचा नव्हे. मोजण्यात येणाऱ्या संशोधनाची व्याख्या, कालावधी, अर्थसंकल्प, कर्मचारीसंख्या किंवा हा अंदाज काढण्याची पद्धत ध्वनिमुद्रणात किंवा OpenAI च्या प्रकाशित सामग्रीत दिलेली नाही. त्यामुळे हा आकडा कंपनीचा लेखापरीक्षित खर्च किंवा कर्मचारी-वाटपाचा हिशेब नसून Power यांनी प्राधान्यांविषयी केलेले वर्णन म्हणून समजावा.

Power यांनी पुढील पिढ्यांची उदाहरणे म्हणून GPT-7 आणि GPT-8 यांची नावे घेतली. त्यांनी यांपैकी कोणतेही मॉडेल जाहीर केले नाही, विकासातील टप्पा उघड केला नाही किंवा प्रकाशनाचे वेळापत्रक दिले नाही. OpenAI ची सध्याची मॉडेल सूची GPT-6 Astra, Sol आणि Luna यांची नावे देते. त्यामुळे Power यांनी वापरलेल्या नावांचा सार्वजनिक संदर्भ मिळतो; पुढील पिढ्यांची स्थिती मात्र सिद्ध होत नाही.

त्यांनी डिस्टिलेशनचा उल्लेख का केला

या अंदाजानंतर लगेचच Power यांनी मोठे GPT-6 Astra मॉडेल लहान GPT Luna मॉडेलला शिकवू शकते असे सांगितले. सक्षम मोठे मॉडेल लहान मॉडेलला प्रशिक्षण देण्यासाठी उदाहरणे पुरवू शकते, हा त्यांचा मुद्दा होता. ते संशोधनाची एक पद्धत समजावत होते; Astra मधून एखादे विशिष्ट Luna मॉडेल प्रशिक्षित झाल्याची नोंद करत नव्हते.

OpenAI चे supervised fine-tuning मार्गदर्शक ही प्रक्रिया समजावते. विकासक प्रथम मोठे मॉडेल एखाद्या ठरावीक कामात चांगली कामगिरी करते का हे तपासतो, योग्य निष्पत्ती जतन करतो, त्या लहान मॉडेलसाठी प्रशिक्षण-उदाहरणे म्हणून वापरतो आणि मग त्या कामावर लहान मॉडेलचे मूल्यमापन करतो. यामुळे एखाद्या विशिष्ट कामासाठी लहान मॉडेलची कामगिरी मोठ्या मॉडेलच्या जवळ जाऊ शकते, असे OpenAI सांगते विशिष्ट कामापुरते. याचा अर्थ लहान मॉडेल शिक्षक-मॉडेलची प्रत्येक क्षमता आत्मसात करते असा नाही. OpenAI ची मॉडेल डिस्टिलेशनविषयीची घोषणा देखील मूल्यमापन, जतन केलेली उत्तरे आणि फाइन-ट्यूनिंग यांना पुनरावृत्तीच्या प्रक्रियेचा भाग म्हणून मांडते.

या कल्पनेचा इतिहास अधिक जुना आहे. 2015 मधील एका संशोधनपत्रातGeoffrey Hinton, Oriol Vinyals आणि Jeff Dean यांनी मोठ्या प्रणालींकडून ज्ञान अशा मॉडेलमध्ये हस्तांतरित करण्याचा अभ्यास केला जे वापरात आणणे सोपे आहे. त्या संशोधनातून शिक्षक–विद्यार्थी संकल्पनेचा संदर्भ मिळतो; OpenAI आज संशोधनाचे वाटप कसे करते याबद्दल त्यातून काही कळत नाही.

अत्याधुनिक संशोधन आणि प्रत्यक्ष वापरातील मॉडेल्स यांच्यातील संबंधाबद्दल Power काय सांगत होते, हे यातून स्पष्ट होते. अधिक सक्षम शिक्षक-मॉडेल केंद्रित आणि कमी खर्चाच्या प्रणालींसाठी उपयुक्त प्रशिक्षण-सामग्री तयार करू शकते. हे किती चांगले काम करेल ते काम, निवडलेली उदाहरणे आणि मूल्यमापन यांवर अवलंबून असते. Astra–Luna उदाहरणासाठी Power यांनी डिस्टिलेशनचे निकाल किंवा तुलनात्मक मोजमाप दिले नाही.

OpenAI च्या संशोधनातून सर्वाधिक मूल्य कुठे मिळेल, याविषयीचा Power यांचा दृष्टिकोन व्यक्त होत असल्याने त्यांचा अंदाज लक्षवेधी आहे. सार्वजनिक पुरावा त्यांच्या वक्तव्याची आणि त्यांनी सांगितलेल्या सर्वसाधारण तंत्राची पुष्टी करतो. OpenAI ची संसाधने प्रत्यक्षात कशी विभागली आहेत किंवा भविष्यातील GPT पिढी काय देईल, हे मात्र सिद्ध होत नाही.