Um levantamento publicado no arXiv a 10 de setembro e revisto a 22 de setembro estabelece cinco níveis de participação da IA no aperfeiçoamento de sistemas de IA. O título, A última IA criada por seres humanos, exprime uma aspiração, não um acontecimento relatado pelos autores. A evidência apresentada chega a exemplos limitados de sistemas que revêm partes do seu próprio processo de desenvolvimento. Não demonstra que um sistema produza sucessores cada vez melhores, de forma fiável e geração após geração.
Esta distinção é importante para interpretar afirmações sobre investigação automatizada em IA. Um agente pode executar experiências, registar aprendizagens e melhorar a pontuação num teste enquanto as pessoas continuam a definir o objetivo, a controlar os testes e a decidir que alterações são mantidas. A afirmação mais forte exige provas de que o sistema melhorou o método que utiliza para gerar a versão seguinte e de que o método revisto teve melhores resultados numa comparação justa.
A grande mudança
- O que mudou: Os investigadores dispõem agora de uma forma mais precisa de descrever o nível de controlo de um sistema sobre o ciclo de aperfeiçoamento da IA: desde aplicar atualizações atribuídas até rever o procedimento que será usado nas atualizações seguintes. O novo levantamento organiza trabalhos existentes; não anuncia um sistema concluído que crie sucessores autónomos.
- Porque é importante: Os laboratórios de IA podem automatizar mais experiências sem demonstrar que cada novo agente é melhor a criar o agente seguinte. Esta distinção afeta a interpretação das alegações de desempenho e os momentos em que se mantêm a revisão humana e os testes independentes.
- O que importa acompanhar: O teste decisivo é uma sequência de sucessores criada através de um método de aperfeiçoamento herdado e revisto, avaliada em tarefas protegidas face ao método anterior e com recursos comparáveis. Os trabalhos analisados ainda não demonstraram, com este critério, uma acumulação de melhorias estatisticamente fiável.
Cinco níveis descrevem o controlo do ciclo de aperfeiçoamento
O artigo começa por distinguir a revisão de uma única tarefa, designada B0, do aperfeiçoamento persistente. Um modelo que edita uma resposta até esta passar numa verificação melhorou essa resposta. Se a alteração não transitar para tarefas posteriores e independentes, o sistema não adquiriu uma atualização duradoura.
No nível 1, as pessoas escolhem o objetivo e o teste de sucesso; a IA aplica uma atualização, por exemplo, uma regra de qualidade de dados definida por uma pessoa. No nível 2, a IA também escolhe uma estratégia para o objetivo atribuído, talvez diagnosticando as falhas de um agente de programação e propondo alterações às suas ferramentas. O objetivo e o teste de aceitação continuam a ser definidos externamente.
No nível 3, o sistema ajuda a escolher de que experiência precisa a seguir, por exemplo, tarefas de prática dirigidas às fragilidades que detetou. O nível 4 acrescenta o feedback da utilização continuada: o sistema mantém alterações aprovadas na memória, nas regras ou nos componentes quando encontra novas condições. O artigo considera que ambos os níveis dependem da qualidade do feedback e das regras que determinam quais as alterações que persistem.
O nível 5 chega à ideia central do levantamento. A IA revê um procedimento que orienta o aperfeiçoamento posterior, como a sua política de pesquisa, o seu avaliador ou o agente que propõe sucessores. O procedimento revisto tem de ser mantido e utilizado numa ronda posterior. Mesmo neste nível, o artigo observa que as pessoas podem continuar a controlar o objetivo geral, os testes de aceitação protegidos e os recursos. O nível descreve uma responsabilidade delegada, não garante progresso nem implica autonomia sem restrições.
Os sistemas existentes mostram onde está o limite
O estudo da Darwin Gödel Machine relata que o seu agente de programação melhorou de 20% para 50% num subconjunto do SWE-bench, enquanto várias versões alteravam o código do agente e as versões bem-sucedidas eram guardadas num arquivo. Os autores afirmam também que a manutenção do arquivo e a regra para escolher qual versão se torna antecessora permaneceram fixas. O levantamento utiliza o exemplo para mostrar porque descendentes melhores, por si só, não provam que o processo que os seleciona se tenha aperfeiçoado.
O A-Evolve-Training apresenta um exemplo mais limitado do nível 5. Executou quatro rondas de pós-treino num modelo com 30 mil milhões de parâmetros. Um meta-agente consolidou os resultados e alterou a política de investigação que orientava os agentes seguintes depois de uma pontuação interna de desenvolvimento deixar de acompanhar uma classificação externa. O estudo indica uma pontuação final de 0,86, face a 0,87 da melhor submissão humana na altura. A política herdada alterou a forma como as experiências seguintes eram escolhidas. O sistema subjacente dos agentes e o objetivo da competição mantiveram-se fixos. Isto mostra um procedimento de investigação revisto a funcionar num projeto definido, não um controlo autónomo de todos os aspetos do desenvolvimento do modelo.
O estudo da avalia se um procedimento aperfeiçoado para criar agentes pode ser transferido para um novo domínio. Após 200 iterações na classificação de exercícios de matemática, uma execução iniciada com melhorias transferidas obteve 0,640 no seu conjunto de teste, face a 0,610 numa execução iniciada com o agente original. Os autores afirmam que a diferença não foi estatisticamente significativa. O resultado justifica continuar a investigar a transferência, mas não demonstra uma acumulação fiável de melhorias entre execuções.
Mais atividade não prova um melhor aperfeiçoamento
O levantamento distingue a reutilização de um procedimento revisto, a que chama recursão estrutural, da recursão efetiva: o procedimento revisto produz sucessores melhores com orçamentos comparáveis e avaliação independente. É este segundo teste que o título dramático convida os leitores a presumir que já foi realizado.
Há várias formas de confundir atividade com progresso. Um sistema pode dedicar mais capacidade de computação à pesquisa, ajustar-se em excesso a um teste consultado repetidamente ou conservar uma alteração que melhora uma tarefa enquanto prejudica outra. Se também modificar o seu avaliador, as pontuações mais altas poderão refletir uma nova fasquia. Por isso, o artigo propõe registar o que foi revisto, demonstrar que o componente revisto orientou efetivamente a ronda seguinte, compará-lo com o componente anterior usando recursos equivalentes e testar a retenção e a transferência em tarefas independentes.
Os autores afirmam explicitamente que os resultados atuais sustentam alterações limitadas em mecanismos de aperfeiçoamento, avaliadores e políticas de investigação, enquanto «continua em aberto a acumulação estatisticamente fiável entre gerações com recursos comparáveis». A expressão «a última IA criada por seres humanos» designa o destino que motiva o seu enquadramento. O levantamento fornece critérios para avaliar o progresso na sua direção.
Fontes e leituras complementares
- Duan et al., A última IA criada por seres humanos, versão 3 (22 de setembro de 2026). Este levantamento primário define B0 e os níveis 1–5, distingue a recursão estrutural da efetiva e descreve os limites da evidência. A taxonomia e as interpretações são o enquadramento dos autores, não uma demonstração de um novo sistema.
- Zhang et al., Darwin Gödel Machine (versão 3, 12 de março de 2026). O estudo original relata melhorias num teste de programação e especifica que a manutenção do arquivo e a seleção das versões antecessoras permaneceram fixas.
- Shi et al., A-Evolve-Training (versão 3, 8 de setembro de 2026). O pré-publicação original descreve quatro rondas de pós-treino, a revisão da política e o resultado indicado na classificação. O objetivo e o sistema subjacente dos agentes continuam definidos externamente.
- Zhang et al., HyperAgents (2026). O estudo original avalia a transferência de um procedimento para criar agentes e indica que a comparação de 200 iterações citada aqui não é estatisticamente significativa.
- Análise detalhada de Manuel Muñoz Plá (18 de setembro de 2026), que examina os exemplos de níveis superiores e os limites da evidência do levantamento. Analisa uma versão anterior do artigo; o texto principal utiliza a versão 3 e os estudos originais citados para as afirmações factuais.
- Reportagem do South China Morning Post (14 de setembro de 2026) sobre o roteiro de cinco etapas do levantamento e o contexto da investigação em IA. É cobertura secundária, não evidência dos resultados dos estudos.
- Explicação do The Rundown AI (16 de setembro de 2026) que resume os níveis e enquadra o artigo no debate sobre investigação automatizada em IA. É cobertura secundária; o levantamento e os estudos originais sustentam as afirmações factuais acima.



