No Fellows Forum, em 23 de setembro, Boris Power, diretor de investigação aplicada da OpenAI, estimou que 80% a 90% da investigação da empresa se centra no «GPT-7, GPT-8 e seguintes». Apresentou este número ao explicar como a OpenAI equilibra o trabalho em produtos atuais com a investigação de modelos mais capazes. É uma estimativa pessoal feita numa conversa pública; a OpenAI não publicou uma distribuição da sua investigação que permita verificá-la.
A grande mudança
- O que mudou: Power descreveu duas frentes interligadas: melhorias nos modelos que as pessoas usam atualmente e investigação orientada para futuras gerações. Estimou que esta segunda frente representa a maior parte da investigação da OpenAI.
- Porque é importante: Um modelo grande mais potente pode fornecer exemplos de treino para um modelo menor e menos dispendioso numa tarefa definida. Isso dá aos programadores motivos para acompanhar a investigação de ponta, mesmo quando usam modelos menores nos seus produtos.
- O que acompanhar:Futuros lançamentos de modelos e divulgações técnicas poderão mostrar se os avanços nos modelos maiores chegam aos mais pequenos. A entrevista não indicou datas de lançamento, especificações ou resultados do GPT-7 ou do GPT-8.
O contexto da estimativa
Power respondia a uma pergunta de Zachary Lipton sobre a forma como os pedidos dos clientes alimentam a investigação. Disse que a OpenAI consegue melhorar um comportamento específico, como a utilização de ferramentas, com dados de treino especializados e investigação aplicada. Segundo o seu relato, as atualizações incrementais dentro de uma geração de modelos muitas vezes respondem a estas necessidades. Argumentou que uma nova geração de modelos maiores pode alterar os ajustes especializados que continuam a ser necessários. Descreveu alguns investimentos atuais como formas de aprender e melhorar mais rapidamente no presente, mesmo quando não fazem parte da estratégia de longo prazo.
Esta distinção levou ao comentário sobre os 80% a 90%, aos 1:32:52 da gravação do Fellows Forum. Power referia-se à investigação na OpenAI, não apenas à investigação da sua própria equipa. Nem a gravação nem os materiais publicados pela OpenAI definem que investigação é contabilizada, o período, o orçamento, o número de funcionários ou o método usado para chegar à estimativa. Por isso, o número deve ser entendido como a descrição que Power faz das prioridades, não como uma medição auditada das despesas ou da equipa da empresa.
Power citou o GPT-7 e o GPT-8 como exemplos de futuras gerações. Não anunciou nenhum dos modelos, não divulgou uma fase de desenvolvimento nem indicou um calendário de lançamento. O catálogo atual de modelos da OpenAI lista GPT-6 Astra, Sol e Luna; fornece contexto público para os nomes usados por Power, mas não apresenta provas sobre a fase de desenvolvimento das futuras gerações.
Porque falou de destilação
Logo após a estimativa, Power descreveu um modelo grande, o GPT-6 Astra, a ensinar um modelo menor, o GPT Luna. O seu argumento era que um modelo grande e potente pode fornecer exemplos para treinar um modelo menor. Explicava uma abordagem de investigação, não documentava que um modelo Luna já lançado tivesse sido especificamente treinado com o Astra.
O guia da OpenAI sobre ajuste fino supervisionado descreve o mecanismo. Primeiro, o programador verifica se um modelo maior tem bom desempenho numa tarefa definida, seleciona os resultados adequados, usa-os como exemplos de treino para um modelo menor e avalia este último na mesma tarefa. A OpenAI afirma que isto pode aproximar o desempenho do modelo menor ao do modelo maior numa tarefa específica. Isso não significa que o modelo menor herde todas as capacidades do modelo professor. O anúncio da OpenAI sobre destilação de modelos também descreve a avaliação, a captura de resultados e o ajuste fino como um processo iterativo.
A ideia tem uma história mais longa. Num artigo de investigação de 2015, Geoffrey Hinton, Oriol Vinyals e Jeff Dean estudaram a transferência de conhecimento de sistemas maiores para um modelo mais fácil de implementar. Esse trabalho explica o conceito de professor e aluno; não informa como a OpenAI distribui atualmente a sua investigação.
Isto explica a relação que Power estabeleceu entre a investigação de ponta e os modelos práticos. Um modelo professor mais capaz pode criar material de treino útil para sistemas especializados e menos dispendiosos. O resultado depende da tarefa, dos exemplos selecionados e da avaliação. Power não apresentou resultados de destilação nem medições comparativas para o exemplo Astra–Luna.
A estimativa de Power chama a atenção porque exprime a sua visão sobre onde a OpenAI espera obter o maior valor da investigação. As provas públicas confirmam o comentário e a técnica geral que mencionou. Não mostram como os recursos da OpenAI estão efetivamente distribuídos nem o que uma futura geração do GPT irá oferecer.



