En Fellows Forum del 23 de septiembre, Boris Power, director de investigación aplicada de OpenAI, estimó que entre el 80 % y el 90 % de la investigación de la empresa se centra en «GPT-7, GPT-8 y las generaciones posteriores». Dio esa cifra al explicar cómo OpenAI equilibra el trabajo en sus productos actuales con la investigación de modelos más capaces. Es su estimación en una conversación pública; OpenAI no ha publicado un desglose de la asignación de recursos a investigación con el que contrastarla.

El gran cambio

  • Qué ha cambiado: Power describió dos líneas de trabajo relacionadas: mejorar los modelos que la gente usa ahora e investigar generaciones posteriores. Estimó que esta última representa la mayor parte de la investigación de OpenAI.
  • Por qué importa: Un modelo grande más potente puede proporcionar ejemplos de entrenamiento para un modelo más pequeño y barato en una tarea definida. Eso da a los desarrolladores motivos para seguir la investigación de frontera, incluso cuando sus productos dependen de modelos más pequeños.
  • Qué conviene observar: Los futuros lanzamientos de modelos y las publicaciones técnicas pueden mostrar si los avances de los modelos grandes llegan a los pequeños. La entrevista no dio fechas de lanzamiento, especificaciones ni resultados para GPT-7 o GPT-8.

El contexto de la estimación

Power respondía a una pregunta de Zachary Lipton sobre cómo las solicitudes de los clientes influyen en la investigación. Dijo que OpenAI puede mejorar un comportamiento concreto, como el uso de herramientas, mediante datos de entrenamiento especializados e investigación aplicada. Según su explicación, las actualizaciones incrementales dentro de una generación de modelos suelen atender esas necesidades. Sostuvo que una nueva generación de modelos más grandes puede cambiar cuáles correcciones especializadas siguen siendo necesarias. Describió algunas inversiones actuales como formas de aprender y mejorar más rápido hoy, aunque no sean la estrategia a largo plazo.

Esa distinción dio pie al comentario sobre el 80–90 % en el minuto 1:32:52 de la grabación de Fellows Forum. Power habló de investigación de OpenAI, no solo de la investigación de su propio equipo. Ni la grabación ni el material publicado por OpenAI definen qué investigación se contabiliza, el período, el presupuesto, la cantidad de personal ni el método usado para llegar a la estimación. Por tanto, la cifra debe leerse como la descripción que hace Power de las prioridades, no como una medición auditada del gasto o del personal de la empresa.

Power mencionó GPT-7 y GPT-8 como ejemplos de generaciones posteriores. No anunció ninguno de los dos modelos, reveló hitos de desarrollo ni dio un calendario de lanzamiento. El catálogo actual de modelos de OpenAI enumera GPT-6 Astra, Sol y Luna; aporta contexto público para los nombres mencionados por Power, pero no ofrece pruebas sobre el estado de las generaciones posteriores.

Por qué habló de destilación

Inmediatamente después de la estimación, Power describió a un modelo GPT-6 Astra grande que enseña a un modelo GPT Luna más pequeño. Su argumento era que un modelo grande potente puede aportar ejemplos para entrenar uno más pequeño. Explicaba un enfoque de investigación; no documentaba que un modelo Luna publicado en particular se hubiera entrenado a partir de Astra.

La guía de ajuste fino supervisado de OpenAI describe el mecanismo. Primero, un desarrollador comprueba que un modelo grande rinde bien en una tarea definida; después conserva las respuestas adecuadas, las utiliza como ejemplos de entrenamiento para un modelo más pequeño y evalúa a este último en esa tarea. OpenAI dice que así el modelo más pequeño puede acercarse al rendimiento del grande en una tarea específica. Eso no implica que herede todas las capacidades del modelo que lo enseña. El anuncio de OpenAI sobre destilación de modelos también describe la evaluación, la captura de resultados y el ajuste fino como un proceso iterativo.

La idea tiene una historia más larga. En un artículo de investigación de 2015, Geoffrey Hinton, Oriol Vinyals y Jeff Dean estudiaron cómo transferir conocimientos de sistemas grandes a un modelo más fácil de desplegar. Ese trabajo explica el concepto de profesor y alumno, pero no dice nada sobre la asignación actual de recursos a investigación en OpenAI.

Esto explica la conexión que Power trazó entre la investigación de frontera y los modelos prácticos. Un modelo docente más capaz puede generar material de entrenamiento útil para sistemas especializados de menor coste. Que el método funcione bien depende de la tarea, los ejemplos seleccionados y la evaluación. Power no aportó resultados de destilación ni mediciones comparativas para el ejemplo de Astra y Luna.

La estimación de Power es reveladora porque expresa su opinión sobre dónde espera OpenAI obtener el mayor valor de investigación. La evidencia pública confirma la declaración y la técnica general que mencionó. No permite determinar cómo se distribuyen realmente los recursos de OpenAI ni qué ofrecerá una futura generación de GPT.