No Fellows Forum, em 23 de setembro, Boris Power, chefe de pesquisa aplicada da OpenAI, estimou que 80% a 90% da pesquisa na empresa se concentra em “GPT-7, GPT-8 e além”. Ele apresentou o número ao explicar como a OpenAI equilibra o trabalho em produtos atuais com a pesquisa de modelos mais capazes. É uma estimativa pessoal feita em uma conversa pública; a OpenAI não publicou uma divisão de sua pesquisa que permita verificá-la.

A grande mudança

  • O que mudou: Power descreveu duas frentes conectadas: melhorias nos modelos usados atualmente pelas pessoas e pesquisas voltadas a gerações futuras. Ele estimou que essa segunda frente responde pela maior parte da pesquisa da OpenAI.
  • Por que isso importa: Um modelo grande mais forte pode fornecer exemplos de treinamento para um modelo menor e mais barato em uma tarefa definida. Isso dá aos desenvolvedores motivos para acompanhar a pesquisa de ponta, mesmo quando usam modelos menores em seus produtos.
  • O que acompanhar: Lançamentos futuros de modelos e divulgações técnicas poderão mostrar se avanços em modelos grandes chegam aos menores. A entrevista não forneceu datas de lançamento, especificações ou resultados do GPT-7 ou GPT-8.

O contexto da estimativa

Power respondia a uma pergunta de Zachary Lipton sobre como solicitações de clientes alimentam a pesquisa. Ele disse que a OpenAI consegue melhorar um comportamento específico, como o uso de ferramentas, com dados de treinamento especializados e pesquisa aplicada. Segundo seu relato, atualizações incrementais dentro de uma geração de modelos muitas vezes atendem a essas necessidades. Ele argumentou que uma nova geração de modelos maiores pode mudar quais ajustes especializados continuam necessários. Descreveu alguns investimentos atuais como formas de aprender e melhorar mais rápido no presente, mesmo quando não fazem parte da estratégia de longo prazo.

Essa distinção levou ao comentário sobre os 80% a 90% em 1:32:52 da gravação do Fellows Forum. Power se referiu à pesquisa na OpenAI, não apenas à pesquisa de sua própria equipe. Nem a gravação nem os materiais publicados pela OpenAI definem que pesquisa está sendo contabilizada, o período, o orçamento, o número de funcionários ou o método usado para chegar à estimativa. Portanto, o número deve ser lido como a descrição que Power faz das prioridades, não como uma medida auditada dos gastos ou da equipe da empresa.

Power citou GPT-7 e GPT-8 como exemplos de gerações futuras. Não anunciou nenhum dos modelos, não divulgou uma etapa de desenvolvimento nem forneceu um calendário de lançamento. O catálogo atual de modelos da OpenAI lista GPT-6 Astra, Sol e Luna; oferece contexto público para os nomes usados por Power, mas não traz evidências sobre o estágio de desenvolvimento de gerações futuras.

Por que ele falou sobre destilação

Logo após a estimativa, Power descreveu um modelo grande GPT-6 Astra ensinando um modelo menor GPT Luna. Seu argumento era que um modelo grande e forte pode fornecer exemplos para treinar um modelo menor. Ele explicava uma abordagem de pesquisa, não documentava que um modelo Luna lançado especificamente tivesse sido treinado com o Astra.

O guia da OpenAI sobre ajuste fino supervisionado descreve o mecanismo. Primeiro, o desenvolvedor verifica se um modelo maior tem bom desempenho em uma tarefa definida, seleciona resultados adequados, usa-os como exemplos de treinamento para um modelo menor e avalia o modelo menor nessa tarefa. A OpenAI diz que isso pode aproximar o desempenho do modelo menor ao do modelo maior em uma tarefa específica. Isso não significa que o modelo menor herde todas as capacidades do professor. O anúncio da OpenAI sobre destilação de modelos também descreve a avaliação, a captura de resultados e o ajuste fino como um processo iterativo.

A ideia tem uma história mais longa. Em um artigo de pesquisa de 2015, Geoffrey Hinton, Oriol Vinyals e Jeff Dean estudaram a transferência de conhecimento de sistemas maiores para um modelo mais fácil de implantar. Esse trabalho explica o conceito de professor e aluno; não informa como a OpenAI distribui sua pesquisa atualmente.

Isso explica a relação que Power traçou entre a pesquisa de ponta e os modelos práticos. Um professor mais capaz pode criar material de treinamento útil para sistemas focados e de menor custo. O resultado depende da tarefa, dos exemplos selecionados e da avaliação. Power não apresentou resultados de destilação nem medições comparativas para o exemplo Astra–Luna.

A estimativa de Power chama atenção porque expressa sua visão de onde a OpenAI espera obter o maior valor de pesquisa. As evidências públicas confirmam o comentário e a técnica geral que ele mencionou. Não mostram como os recursos da OpenAI estão de fato divididos nem o que uma geração futura do GPT oferecerá.