Beim Fellows Forum am 23. September schätzte Boris Power, Leiter der angewandten Forschung bei OpenAI, dass sich 80 bis 90 Prozent der Unternehmensforschung auf „GPT-7, GPT-8 und darüber hinaus“ konzentrieren. Er nannte diese Zahl, als er erläuterte, wie OpenAI die Arbeit an aktuellen Produkten mit der Forschung an leistungsfähigeren Modellen ausbalanciert. Es handelt sich um seine Schätzung aus einem öffentlichen Gespräch; OpenAI hat keine Aufschlüsselung der Forschungsressourcen veröffentlicht, anhand derer sie überprüft werden könnte.

Die große Änderung

  • Was sich geändert hat: Power beschrieb zwei miteinander verbundene Arbeitsfelder: Verbesserungen an den derzeit genutzten Modellen und Forschung mit Blick auf spätere Generationen. Seiner Einschätzung nach entfällt der Großteil der OpenAI-Forschung auf das zweite Feld.
  • Warum das wichtig ist: Ein leistungsfähigeres großes Modell kann Trainingsbeispiele für ein kleineres, kostengünstigeres Modell bei einer klar umrissenen Aufgabe liefern. Das gibt Entwicklern einen Grund, die Spitzenforschung zu verfolgen, selbst wenn sie in ihren Produkten kleinere Modelle einsetzen.
  • Worauf es ankommt: Künftige Modellveröffentlichungen und technische Angaben können zeigen, ob Fortschritte bei großen Modellen auch kleineren zugutekommen. Im Interview wurden weder Veröffentlichungstermine noch Spezifikationen oder Ergebnisse für GPT-7 und GPT-8 genannt.

Der Hintergrund der Schätzung

Power antwortete auf eine Frage von Zachary Lipton dazu, wie Kundenwünsche in die Forschung zurückfließen. OpenAI könne ein bestimmtes Verhalten, etwa die Werkzeugnutzung, mit spezialisierten Trainingsdaten und angewandter Forschung verbessern, sagte er. Seiner Darstellung zufolge werden solche Anforderungen innerhalb einer Modellgeneration oft mit schrittweisen Aktualisierungen aufgegriffen. Eine neue Generation größerer Modelle könne verändern, welche spezialisierten Anpassungen noch nötig sind, argumentierte er. Manche aktuellen Investitionen seien demnach darauf ausgerichtet, schon heute schneller zu lernen und sich zu verbessern, auch wenn sie nicht der langfristigen Strategie entsprächen.

Diese Unterscheidung führte zu der Schätzung von 80 bis 90 Prozent bei Minute 1:32:52 der Aufzeichnung des Fellows Forum. Power bezog sich auf Forschung bei OpenAI, nicht nur auf die seines eigenen Teams. Weder die Aufzeichnung noch die veröffentlichten Materialien von OpenAI definieren, welche Forschung gezählt wurde, über welchen Zeitraum, welches Budget oder welche Beschäftigtenzahl gemeint waren oder nach welcher Methode die Schätzung entstand. Die Zahl sollte deshalb als Powers Beschreibung der Prioritäten verstanden werden, nicht als geprüfte Kennzahl zu Ausgaben oder Personal.

Power nannte GPT-7 und GPT-8 als Beispiele für spätere Generationen. Er kündigte keines der Modelle an, gab keinen Entwicklungsmeilenstein bekannt und nannte keinen Zeitplan. Der aktuelle Modellkatalog von OpenAI führt GPT-6 Astra, Sol und Luna auf. Er liefert öffentlichen Kontext zu den von Power verwendeten Modellnamen, aber keine Hinweise zum Entwicklungsstand späterer Generationen.

Warum er die Destillation erwähnte

Unmittelbar nach der Schätzung beschrieb Power, wie ein großes GPT-6-Astra-Modell ein kleineres GPT-Luna-Modell trainieren könnte. Sein Punkt war, dass ein leistungsfähiges großes Modell Beispiele für das Training eines kleineren liefern kann. Er dokumentierte damit weder, dass ein bestimmtes veröffentlichtes Luna-Modell mit Astra trainiert wurde, noch behauptete er dies.

OpenAIs Leitfaden zum überwachten Feintuning beschreibt den Mechanismus. Zunächst prüft ein Entwickler, ob ein größeres Modell eine klar umrissene Aufgabe gut bewältigt, wählt geeignete Ausgaben aus, verwendet sie als Trainingsbeispiele für ein kleineres Modell und bewertet dieses anschließend anhand derselben Aufgabe. Laut OpenAI kann so die Leistung des kleineren Modells bei einer bestimmten Aufgabe näher an die des größeren heranrücken. Daraus folgt nicht, dass das kleinere Modell sämtliche Fähigkeiten des Lehrmodells übernimmt. Auch OpenAIs Ankündigung zur Modelldestillation beschreibt Evaluierung, gespeicherte Ausgaben und Feintuning als iterativen Prozess.

Die Idee hat eine längere Vorgeschichte. In einer Forschungsarbeit aus dem Jahr 2015 untersuchten Geoffrey Hinton, Oriol Vinyals und Jeff Dean, wie Wissen aus größeren Systemen in ein leichter einsetzbares Modell übertragen werden kann. Die Arbeit erläutert das Lehrer-Schüler-Konzept; sie sagt nichts über die derzeitige Verteilung der OpenAI-Forschung aus.

Damit wird die Verbindung verständlich, die Power zwischen Spitzenforschung und praktisch einsetzbaren Modellen zog. Ein leistungsfähigeres Lehrmodell kann nützliches Trainingsmaterial für spezialisierte, kostengünstigere Systeme erzeugen. Ob das gut funktioniert, hängt von der Aufgabe, den ausgewählten Beispielen und der Evaluierung ab. Für das Astra-Luna-Beispiel nannte Power weder Ergebnisse der Destillation noch Vergleichsmessungen.

Powers Schätzung ist aufschlussreich, weil sie seine Einschätzung dazu wiedergibt, wo OpenAI den größten Forschungsnutzen erwartet. Öffentlich belegt sind seine Aussage und die allgemeine Technik, auf die er verwies. Nicht belegt ist, wie OpenAI seine Ressourcen tatsächlich verteilt oder was eine künftige GPT-Generation leisten wird.