9月23日のFellows Forumで、OpenAIの応用研究責任者ボリス・パワー氏は、同社の研究の80~90%が「GPT-7、GPT-8、そしてそれ以降」に集中していると推定した。現行製品の改善と、より高性能なモデルに関する研究のバランスを説明する中で、この数字を示した。これは公開の場で同氏が示した推定値であり、照合できる研究配分の内訳をOpenAIは公表していない。

大きな変化

  • 変わったこと:パワー氏は、現在人々が使うモデルの改善と、後続世代を目指す研究という、互いに関連する2つの取り組みを説明した。同氏は後者がOpenAIの研究の大半を占めると推定した。
  • なぜ重要か:より高性能な大規模モデルは、定められたタスクについて、より小さく安価なモデルの学習に使う例を提供できる。開発者が製品で小型モデルを利用する場合でも、最先端の研究を追う理由となる。
  • 今後の注目点:今後のモデル公開や技術情報の開示から、大規模モデルの進歩が小型モデルにどう波及するかが分かる可能性がある。このインタビューでは、GPT-7やGPT-8の公開日、仕様、成果は示されなかった。

推定の背景

パワー氏は、顧客からの要望が研究にどう反映されるかについて、ザカリー・リプトン氏の質問に答えていた。同氏によると、OpenAIは特定の振る舞い、たとえばツールの利用を、専門的な学習データと応用研究によって改善できる。説明では、モデル世代の途中に行う段階的な更新で、こうした要望に応えることが多い。より大きな新世代のモデルが登場すれば、どのような専門的な改良がなお必要かも変わりうる。同氏は、長期的な戦略そのものではないとしても、現在の学習を進め、改善を加速する方法として、いくつかの投資を位置付けた。

この区別を説明したうえで、同氏が80~90%との見解を示したのは、Fellows Forumの録画の1時間32分52秒での発言だった。パワー氏が言及したのは、OpenAIにおける研究であり、自身のチームの研究だけではない。録画にもOpenAIの公表資料にも、数えている研究の定義、対象期間、予算、人員数、推定方法は示されていない。そのため、この数字はパワー氏による優先事項の説明として読むべきであり、企業の支出や人員配置を監査した数値ではない。

パワー氏は後続世代の例としてGPT-7とGPT-8を挙げた。どちらのモデルも発表せず、開発段階を明かさず、公開時期も示さなかった。OpenAIの現行モデルカタログにはGPT-6 Astra、Sol、Lunaが掲載されている。これはパワー氏が使った名称の公開情報として参考になるが、後続世代の開発状況を示す証拠ではない。

なぜ蒸留を取り上げたのか

推定値を示した直後、パワー氏はGPT-6 Astraの大規模モデルが、より小さなGPT Lunaモデルを教える方法について説明した。高性能な大規模モデルが、小型モデルの学習例を提供できるというのが同氏の主旨だ。特定の公開済みLunaモデルがAstraから学習したと記録したわけではない。

OpenAIの教師ありファインチューニングのガイドは、その仕組みを説明している。開発者はまず、大規模モデルが定められたタスクで良好な性能を示すことを確認し、適切な出力を選び、それを小型モデルの学習例に使い、そのタスクで小型モデルの性能を評価する。OpenAIによると、この方法で小型モデルの性能を大規模モデルに近づけられるとしている(特定のタスクにおいて)。ただし、小型モデルが教師モデルの能力をすべて受け継ぐという意味ではない。OpenAIのモデル蒸留に関する発表も、評価、出力の保存、ファインチューニングを反復する工程として説明している。

この考え方には、より長い歴史がある。2015年の研究論文では、ジェフリー・ヒントン、オリオル・ビニャルス、ジェフ・ディーンが、より大きなシステムの知識を、より導入しやすいモデルへ移す方法を研究した。この研究は教師モデルと生徒モデルの概念を説明するものであり、OpenAIの現在の研究配分については何も示していない。

これにより、パワー氏が最先端研究と実用的なモデルのつながりとして説明した内容が分かる。より高性能な教師モデルは、特定の用途向けに絞った低コストのシステムに役立つ学習素材を作れる。その効果は、タスク、選ばれた例、評価方法によって異なる。パワー氏は、AstraとLunaの例に関する蒸留の成果や比較測定値を示していない。

パワー氏の推定が示唆的なのは、OpenAIが研究価値の大半をどこに見込んでいるかという同氏の見解を表しているためだ。公開情報から確認できるのは、発言があったことと、同氏が言及した一般的な手法である。OpenAIの資源配分の実態や、将来のGPT世代が何を実現するかまでは確認できない。