AI-translated from English; not yet reviewed by a fluent editor.

# Pesquisa sobre autoaperfeiçoamento de IA mapeia a distância até sucessores melhores

> Uma nova pesquisa descreve cinco níveis de controle da IA sobre o próprio aperfeiçoamento. Os sistemas atuais mostram ganhos limitados, mas ainda não comprovaram melhorias confiáveis ao longo de gerações sucessivas.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Uma [pesquisa publicada no arXiv em 10 de setembro e revisada em 22 de setembro](https://arxiv.org/html/2609.11873v3) descreve cinco níveis de envolvimento da IA no aperfeiçoamento de sistemas de IA. Seu título, *The Last AI Built by Humans*, expressa uma ambição, não um acontecimento relatado pelos autores. As evidências que eles apresentam chegam a exemplos limitados de sistemas que revisam partes do próprio processo de desenvolvimento. Elas não comprovam a existência de um sistema que produza sucessores melhores de forma confiável, geração após geração.

Essa distinção importa ao interpretar alegações sobre pesquisa de IA automatizada. Um agente pode executar experimentos, registrar aprendizados e melhorar a pontuação em um benchmark enquanto as pessoas ainda definem seu objetivo, controlam os testes e decidem quais mudanças serão mantidas. A alegação mais forte exige evidências de que o sistema melhorou o *método* que produz sua próxima versão e de que o método revisado funcionou melhor em uma comparação justa.

## A grande mudança

- **O que mudou:** Agora, pesquisadores têm uma maneira mais precisa de descrever quanto controle um sistema de IA exerce sobre o ciclo de aperfeiçoamento: desde executar atualizações atribuídas até revisar o procedimento usado nas atualizações seguintes. A nova pesquisa organiza trabalhos já existentes; não anuncia a criação de um construtor autônomo de sucessores já concluído.
- **Por que isso importa:** Laboratórios de IA podem automatizar mais experimentos sem provar que cada novo agente é melhor em criar o próximo. Essa diferença afeta a interpretação de alegações de desempenho e ajuda a determinar onde manter a revisão humana e os testes independentes.
- **O que observar:** A evidência decisiva seria uma sequência de sucessores criados com um método de aperfeiçoamento herdado e revisado, testados em tarefas protegidas contra o método anterior e com recursos comparáveis. Os trabalhos analisados ainda não comprovaram um acúmulo estatisticamente confiável de melhorias nesses termos.

## Cinco níveis descrevem o controle do ciclo de aperfeiçoamento

Primeiro, o artigo diferencia a revisão de uma única tarefa, que chama de B0, do aperfeiçoamento persistente. Um modelo que edita uma resposta até ela passar por uma verificação aperfeiçoou aquela resposta. Se a mudança não se estender a tarefas posteriores e independentes, o próprio sistema não incorporou uma atualização duradoura.

No **Nível 1**, as pessoas escolhem o objetivo e o teste de sucesso; a IA executa uma atualização, como aplicar uma regra de qualidade de dados definida por uma pessoa. No **Nível 2**, a IA também escolhe uma estratégia para o objetivo atribuído, talvez diagnosticando as falhas de um agente de programação e propondo mudanças em suas ferramentas. O objetivo e o teste de aceitação ainda vêm de fora do sistema.

No **Nível 3**, o sistema ajuda a escolher qual experiência precisa ter em seguida, por exemplo, tarefas de prática voltadas a pontos fracos que identificou. No **Nível 4**, são incorporados também os comentários recebidos durante o uso contínuo: o sistema mantém alterações aprovadas em memória, regras ou componentes após encontrar novas condições. O artigo considera que ambos os níveis dependem da qualidade dos comentários e das regras que determinam quais mudanças persistem.

**O Nível 5** apresenta a ideia central da pesquisa. A IA revisa um procedimento que orienta o *aperfeiçoamento* posterior, como sua política de busca, seu avaliador ou o agente que propõe sucessores. O procedimento revisado precisa ser mantido e usado em uma rodada subsequente. Mesmo nesse nível, diz o artigo, as pessoas podem continuar controlando o objetivo geral, os testes de aceitação protegidos e os recursos. O nível descreve uma responsabilidade delegada, não uma garantia de progresso ou autonomia irrestrita.

## Sistemas existentes ilustram os limites

O estudo da [Darwin Gödel Machine](https://arxiv.org/html/2505.22954) relata que o agente de programação passou de 20% para 50% no subconjunto do SWE-bench usado no estudo, enquanto variantes modificavam o código do agente e as variantes bem-sucedidas entravam em um arquivo. Os autores também afirmam que a manutenção do arquivo e a regra para escolher qual variante se torna a predecessora eram fixas. A pesquisa cita o caso para mostrar por que descendentes melhores, por si só, não provam que o processo que os seleciona tenha melhorado.

[A-Evolve-Training](https://arxiv.org/html/2606.20657) oferece um exemplo mais restrito de Nível 5. Foram realizadas quatro rodadas de pós-treinamento em um modelo de 30 bilhões de parâmetros. Um meta-agente consolidou os resultados e alterou a política de pesquisa que orientava os trabalhadores das rodadas seguintes, depois que uma pontuação interna de desenvolvimento deixou de acompanhar um placar externo. O estudo relata uma pontuação final de 0,86, ante 0,87 da melhor submissão humana naquele momento. A política herdada mudou a escolha dos experimentos posteriores. O sistema subjacente dos trabalhadores e o objetivo da competição permaneceram fixos. O caso mostra um procedimento de pesquisa revisado operando dentro de um projeto definido, não o controle autônomo de todas as partes do desenvolvimento de modelos.

O estudo [HyperAgents](https://arxiv.org/html/2603.19461) testa se um procedimento aperfeiçoado de criação de agentes é transferido para um novo domínio. Após 200 iterações de correção de provas de matemática, uma execução iniciada com melhorias transferidas obteve 0,640 no conjunto de teste, contra 0,610 em uma execução iniciada com o agente original. Os autores relatam que a diferença não foi estatisticamente significativa. O resultado justifica investigar a transferência, mas não comprova um efeito cumulativo confiável entre execuções.

## Mais atividade não comprova um aperfeiçoamento melhor

A pesquisa distingue a reutilização de um procedimento revisado, chamada de *recursão estrutural*, da *recursão efetiva*: o procedimento revisado produz sucessores melhores com orçamentos comparáveis e avaliação independente. Esse segundo teste é o que o título ambicioso levaria o leitor a supor que já aconteceu.

Há várias maneiras de confundir atividade com progresso. Um sistema pode usar mais tempo de computação na busca, ajustar-se demais a um benchmark consultado repetidamente ou manter uma mudança que ajuda em uma tarefa, mas prejudica outra. Se também modificar o próprio avaliador, as pontuações mais altas podem refletir uma régua nova. Por isso, o artigo recomenda registrar o que foi revisado, demonstrar que o componente revisado realmente orientou a rodada seguinte, compará-lo ao componente anterior com recursos equivalentes e testar retenção e transferência em tarefas independentes.

Os autores afirmam explicitamente que os resultados atuais sustentam mudanças limitadas em processos de aperfeiçoamento, avaliadores e políticas de pesquisa, enquanto “o acúmulo estatisticamente confiável ao longo de gerações com recursos comparáveis continua em aberto”. A expressão “a última IA construída por humanos” nomeia o destino que motiva o modelo conceitual. A pesquisa fornece critérios para avaliar o progresso nessa direção.

## Fontes e leituras complementares

- [Duan et al., *The Last AI Built by Humans*, versão 3](https://arxiv.org/html/2609.11873v3) (22 de setembro de 2026). A pesquisa principal define B0 e os Níveis 1 a 5, diferencia recursão estrutural de efetiva e explicita os limites das evidências. A taxonomia e as interpretações são o modelo proposto pelos autores, não uma demonstração de um novo sistema.
- [Zhang et al., *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (versão 3, 12 de março de 2026). O estudo original relata ganhos em benchmarks de programação e especifica que a manutenção do arquivo e a seleção da predecessora permanecem fixas.
- [Shi et al., *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (versão 3, 8 de setembro de 2026). O preprint original descreve quatro rodadas de pós-treinamento, a revisão da política e o resultado informado no placar. O objetivo e o sistema subjacente dos trabalhadores permanecem definidos externamente.
- [Zhang et al., *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). O estudo original testa a transferência de um procedimento de criação de agentes e relata que a diferença estatística não foi significativa na comparação de 200 iterações citada aqui.
- [A análise detalhada de Manuel Muñoz Plá](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 de setembro de 2026) examina os exemplos de níveis mais altos da pesquisa e os limites das evidências. Ela analisa uma versão anterior do artigo; o texto acima usa a versão 3 e os estudos originais citados como base para as afirmações factuais.
- [A reportagem do South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 de setembro de 2026) aborda o roteiro de cinco etapas da pesquisa e o contexto do estudo. É uma cobertura secundária, não evidência dos resultados das pesquisas.
- [A explicação do The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 de setembro de 2026) resume os níveis e situa o artigo no debate sobre pesquisa automatizada de IA. É uma cobertura secundária; as afirmações factuais acima se apoiam no artigo e nos estudos originais.

## Sources

- [Duan et al.: The Last AI Built by Humans, versão 3](https://arxiv.org/html/2609.11873v3) — Pesquisa primária sobre níveis de autonomia e exemplos de pesquisa. Define recursão estrutural e efetiva e afirma que o acúmulo estatisticamente confiável ao longo de gerações com recursos comparáveis continua em aberto. Não demonstra a criação recente de uma IA autônoma.
- [Histórico de submissões no arXiv para 2609.11873](https://arxiv.org/abs/2609.11873) — Registra a versão 1, de 10 de setembro, e a versão 3, de 22 de setembro; identifica Yi Duan e 34 coautores.
- [Zhang et al.: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — O estudo original relata o avanço de 20% para 50% no subconjunto do SWE-bench usado e afirma que o sistema não pode modificar a manutenção do arquivo nem a seleção da predecessora.
- [Shi et al.: A-Evolve-Training](https://arxiv.org/html/2606.20657) — O preprint original descreve quatro rodadas autônomas de pós-treinamento, uma política de pesquisa revisada e mantida e a pontuação de 0,86 contra 0,87 no placar, na data de comparação informada. A infraestrutura dos trabalhadores e o objetivo permanecem fixos.
- [Zhang et al.: HyperAgents](https://arxiv.org/html/2603.19461) — O estudo original relata uma comparação de transferência em 200 iterações, com resultados de 0,640 e 0,610 no conjunto de teste de correção de provas de matemática; a diferença não é estatisticamente significativa.
- [Manuel Muñoz Plá: The last AI built by humans, lido em profundidade](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Análise independente e detalhada de uma versão anterior da pesquisa. Incluída para contextualização; os artigos originais fundamentam as afirmações de pesquisa deste texto.
- [South China Morning Post: pesquisadores chineses traçam caminho em cinco etapas](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Reportagem secundária sobre esta pesquisa e seu contexto. É uma leitura complementar, não evidência primária dos resultados experimentais.
- [The Rundown AI: pesquisadores chineses descrevem uma IA capaz de criar sucessoras](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Explicação secundária dos cinco níveis do artigo e do debate mais amplo. Os artigos originais fundamentam as afirmações factuais de pesquisa deste texto.
