AI-translated from English; not yet reviewed by a fluent editor.

# Levantamento sobre autoaperfeiçoamento da IA traça a distância entre automatização e sucessores melhores

> Um novo levantamento descreve cinco níveis de controlo da IA sobre o seu próprio aperfeiçoamento. Os sistemas atuais mostram progressos limitados, mas ainda não foi demonstrado um aperfeiçoamento fiável entre gerações sucessivas.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Um [levantamento publicado no arXiv a 10 de setembro e revisto a 22 de setembro](https://arxiv.org/html/2609.11873v3) estabelece cinco níveis de participação da IA no aperfeiçoamento de sistemas de IA. O título, *A última IA criada por seres humanos*, exprime uma aspiração, não um acontecimento relatado pelos autores. A evidência apresentada chega a exemplos limitados de sistemas que revêm partes do seu próprio processo de desenvolvimento. Não demonstra que um sistema produza sucessores cada vez melhores, de forma fiável e geração após geração.

Esta distinção é importante para interpretar afirmações sobre investigação automatizada em IA. Um agente pode executar experiências, registar aprendizagens e melhorar a pontuação num teste enquanto as pessoas continuam a definir o objetivo, a controlar os testes e a decidir que alterações são mantidas. A afirmação mais forte exige provas de que o sistema melhorou o *método* que utiliza para gerar a versão seguinte e de que o método revisto teve melhores resultados numa comparação justa.

## A grande mudança

- **O que mudou:** Os investigadores dispõem agora de uma forma mais precisa de descrever o nível de controlo de um sistema sobre o ciclo de aperfeiçoamento da IA: desde aplicar atualizações atribuídas até rever o procedimento que será usado nas atualizações seguintes. O novo levantamento organiza trabalhos existentes; não anuncia um sistema concluído que crie sucessores autónomos.
- **Porque é importante:** Os laboratórios de IA podem automatizar mais experiências sem demonstrar que cada novo agente é melhor a criar o agente seguinte. Esta distinção afeta a interpretação das alegações de desempenho e os momentos em que se mantêm a revisão humana e os testes independentes.
- **O que importa acompanhar:** O teste decisivo é uma sequência de sucessores criada através de um método de aperfeiçoamento herdado e revisto, avaliada em tarefas protegidas face ao método anterior e com recursos comparáveis. Os trabalhos analisados ainda não demonstraram, com este critério, uma acumulação de melhorias estatisticamente fiável.

## Cinco níveis descrevem o controlo do ciclo de aperfeiçoamento

O artigo começa por distinguir a revisão de uma única tarefa, designada B0, do aperfeiçoamento persistente. Um modelo que edita uma resposta até esta passar numa verificação melhorou essa resposta. Se a alteração não transitar para tarefas posteriores e independentes, o sistema não adquiriu uma atualização duradoura.

No **nível 1**, as pessoas escolhem o objetivo e o teste de sucesso; a IA aplica uma atualização, por exemplo, uma regra de qualidade de dados definida por uma pessoa. No **nível 2**, a IA também escolhe uma estratégia para o objetivo atribuído, talvez diagnosticando as falhas de um agente de programação e propondo alterações às suas ferramentas. O objetivo e o teste de aceitação continuam a ser definidos externamente.

No **nível 3**, o sistema ajuda a escolher de que experiência precisa a seguir, por exemplo, tarefas de prática dirigidas às fragilidades que detetou. O **nível 4** acrescenta o feedback da utilização continuada: o sistema mantém alterações aprovadas na memória, nas regras ou nos componentes quando encontra novas condições. O artigo considera que ambos os níveis dependem da qualidade do feedback e das regras que determinam quais as alterações que persistem.

**O nível 5** chega à ideia central do levantamento. A IA revê um procedimento que orienta o *aperfeiçoamento* posterior, como a sua política de pesquisa, o seu avaliador ou o agente que propõe sucessores. O procedimento revisto tem de ser mantido e utilizado numa ronda posterior. Mesmo neste nível, o artigo observa que as pessoas podem continuar a controlar o objetivo geral, os testes de aceitação protegidos e os recursos. O nível descreve uma responsabilidade delegada, não garante progresso nem implica autonomia sem restrições.

## Os sistemas existentes mostram onde está o limite

O estudo da [Darwin Gödel Machine](https://arxiv.org/html/2505.22954) relata que o seu agente de programação melhorou de 20% para 50% num subconjunto do SWE-bench, enquanto várias versões alteravam o código do agente e as versões bem-sucedidas eram guardadas num arquivo. Os autores afirmam também que a manutenção do arquivo e a regra para escolher qual versão se torna antecessora permaneceram fixas. O levantamento utiliza o exemplo para mostrar porque descendentes melhores, por si só, não provam que o processo que os seleciona se tenha aperfeiçoado.

[O A-Evolve-Training](https://arxiv.org/html/2606.20657) apresenta um exemplo mais limitado do nível 5. Executou quatro rondas de pós-treino num modelo com 30 mil milhões de parâmetros. Um meta-agente consolidou os resultados e alterou a política de investigação que orientava os agentes seguintes depois de uma pontuação interna de desenvolvimento deixar de acompanhar uma classificação externa. O estudo indica uma pontuação final de 0,86, face a 0,87 da melhor submissão humana na altura. A política herdada alterou a forma como as experiências seguintes eram escolhidas. O sistema subjacente dos agentes e o objetivo da competição mantiveram-se fixos. Isto mostra um procedimento de investigação revisto a funcionar num projeto definido, não um controlo autónomo de todos os aspetos do desenvolvimento do modelo.

O [estudo da ](https://arxiv.org/html/2603.19461) avalia se um procedimento aperfeiçoado para criar agentes pode ser transferido para um novo domínio. Após 200 iterações na classificação de exercícios de matemática, uma execução iniciada com melhorias transferidas obteve 0,640 no seu conjunto de teste, face a 0,610 numa execução iniciada com o agente original. Os autores afirmam que a diferença não foi estatisticamente significativa. O resultado justifica continuar a investigar a transferência, mas não demonstra uma acumulação fiável de melhorias entre execuções.

## Mais atividade não prova um melhor aperfeiçoamento

O levantamento distingue a reutilização de um procedimento revisto, a que chama *recursão estrutural*, da *recursão efetiva*: o procedimento revisto produz sucessores melhores com orçamentos comparáveis e avaliação independente. É este segundo teste que o título dramático convida os leitores a presumir que já foi realizado.

Há várias formas de confundir atividade com progresso. Um sistema pode dedicar mais capacidade de computação à pesquisa, ajustar-se em excesso a um teste consultado repetidamente ou conservar uma alteração que melhora uma tarefa enquanto prejudica outra. Se também modificar o seu avaliador, as pontuações mais altas poderão refletir uma nova fasquia. Por isso, o artigo propõe registar o que foi revisto, demonstrar que o componente revisto orientou efetivamente a ronda seguinte, compará-lo com o componente anterior usando recursos equivalentes e testar a retenção e a transferência em tarefas independentes.

Os autores afirmam explicitamente que os resultados atuais sustentam alterações limitadas em mecanismos de aperfeiçoamento, avaliadores e políticas de investigação, enquanto «continua em aberto a acumulação estatisticamente fiável entre gerações com recursos comparáveis». A expressão «a última IA criada por seres humanos» designa o destino que motiva o seu enquadramento. O levantamento fornece critérios para avaliar o progresso na sua direção.

## Fontes e leituras complementares

- [Duan et al., *A última IA criada por seres humanos*, versão 3](https://arxiv.org/html/2609.11873v3) (22 de setembro de 2026). Este levantamento primário define B0 e os níveis 1–5, distingue a recursão estrutural da efetiva e descreve os limites da evidência. A taxonomia e as interpretações são o enquadramento dos autores, não uma demonstração de um novo sistema.
- [Zhang et al., *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (versão 3, 12 de março de 2026). O estudo original relata melhorias num teste de programação e especifica que a manutenção do arquivo e a seleção das versões antecessoras permaneceram fixas.
- [Shi et al., *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (versão 3, 8 de setembro de 2026). O pré-publicação original descreve quatro rondas de pós-treino, a revisão da política e o resultado indicado na classificação. O objetivo e o sistema subjacente dos agentes continuam definidos externamente.
- [Zhang et al., *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). O estudo original avalia a transferência de um procedimento para criar agentes e indica que a comparação de 200 iterações citada aqui não é estatisticamente significativa.
- [Análise detalhada de Manuel Muñoz Plá](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 de setembro de 2026), que examina os exemplos de níveis superiores e os limites da evidência do levantamento. Analisa uma versão anterior do artigo; o texto principal utiliza a versão 3 e os estudos originais citados para as afirmações factuais.
- [Reportagem do South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 de setembro de 2026) sobre o roteiro de cinco etapas do levantamento e o contexto da investigação em IA. É cobertura secundária, não evidência dos resultados dos estudos.
- [Explicação do The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 de setembro de 2026) que resume os níveis e enquadra o artigo no debate sobre investigação automatizada em IA. É cobertura secundária; o levantamento e os estudos originais sustentam as afirmações factuais acima.

## Sources

- [Duan et al.: A última IA criada por seres humanos](https://arxiv.org/html/2609.11873v3) — Levantamento primário dos níveis de autonomia e de exemplos de investigação. Define a recursão estrutural e a efetiva e afirma que ainda não foi demonstrada uma acumulação estatisticamente fiável entre gerações com recursos comparáveis. Não demonstra a criação de uma nova IA autónoma.
- [Histórico de submissões ao arXiv do artigo 2609.11873](https://arxiv.org/abs/2609.11873) — Regista a versão 1, de 10 de setembro, e a versão 3, de 22 de setembro; identifica Yi Duan e outros 34 coautores.
- [Zhang et al.: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — O estudo original relata uma melhoria de 20% para 50% no subconjunto do SWE-bench e afirma que o sistema não pode alterar a manutenção do arquivo nem a seleção das versões antecessoras.
- [Shi et al.: A-Evolve-Training](https://arxiv.org/html/2606.20657) — A pré-publicação original descreve quatro rondas autónomas de pós-treino, uma política de investigação revista que é mantida e uma pontuação de classificação de 0,86 face a 0,87 na data de comparação indicada. O sistema subjacente e o objetivo mantêm-se fixos.
- [Zhang et al.: HyperAgents](https://arxiv.org/html/2603.19461) — O estudo original apresenta uma comparação de transferência com 200 iterações: 0,640 face a 0,610 num teste de classificação de matemática; a diferença não é estatisticamente significativa.
- [Manuel Muñoz Plá: leitura aprofundada de A última IA criada por seres humanos](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Análise independente de uma versão anterior do levantamento. Incluída como contexto; os artigos originais sustentam as afirmações de investigação deste texto.
- [South China Morning Post: investigadores chineses traçam um percurso de cinco etapas](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Reportagem secundária sobre este levantamento e o contexto da investigação. É uma leitura complementar, não evidência primária de resultados experimentais.
- [The Rundown AI: investigadores chineses descrevem uma IA capaz de criar as suas sucessoras](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Explicação secundária dos cinco níveis do artigo e do debate geral. Os estudos originais sustentam as afirmações factuais de investigação deste texto.
