EL MUNDO NO SE DETIENE.RSS
BIG CHANGE.

Edición en Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Una encuesta sobre auto-mejora de la IA traza la brecha entre automatizar y crear mejores sucesores

> Una nueva encuesta describe cinco niveles de control de la IA sobre su propia mejora. Los sistemas actuales muestran avances acotados, pero no se ha demostrado una mejora fiable entre generaciones sucesivas.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Una [encuesta publicada en arXiv el 10 de septiembre y revisada el 22 de septiembre](https://arxiv.org/html/2609.11873v3) establece cinco niveles de participación de la IA en la mejora de sistemas de IA. Su título, *La última IA creada por humanos*, expresa una aspiración, no un acontecimiento que relaten los autores. La evidencia que presentan llega a ejemplos acotados de sistemas que revisan partes de su propio proceso de desarrollo. No demuestra que un sistema produzca de manera fiable sucesores cada vez mejores, generación tras generación.

Esta distinción importa al interpretar las afirmaciones sobre investigación automatizada de IA. Un agente puede ejecutar experimentos, guardar aprendizajes y mejorar la puntuación de una prueba mientras las personas siguen fijando el objetivo, controlando las pruebas y decidiendo qué cambios se conservan. La afirmación más fuerte requiere pruebas de que el sistema mejoró el *método* que genera su siguiente versión y de que el método revisado funcionó mejor en una comparación justa.

## El gran cambio

- **Qué ha cambiado:** Ahora los investigadores disponen de una forma más precisa de describir cuánto controla un sistema del ciclo de mejora de la IA: desde aplicar actualizaciones asignadas hasta revisar el procedimiento que se usará en las actualizaciones posteriores. La nueva encuesta organiza trabajos existentes; no anuncia un sistema terminado que construya sucesores autónomos.
- **Por qué importa:** Los laboratorios de IA pueden automatizar más experimentos sin demostrar que cada nuevo agente sea mejor creando al siguiente. Esta diferencia afecta la interpretación de las afirmaciones de rendimiento y los puntos en que se mantienen la revisión humana y las pruebas independientes.
- **Qué conviene observar:** La prueba decisiva es una secuencia de sucesores creada mediante un método de mejora heredado y revisado, y evaluada en tareas protegidas frente al método anterior con recursos comparables. Los trabajos analizados aún no han demostrado una acumulación estadísticamente fiable con ese criterio.

## Cinco niveles describen el control del ciclo de mejora

El artículo primero distingue la revisión de una sola tarea, que denomina B0, de la mejora persistente. Un modelo que edita una respuesta hasta que supera una comprobación ha mejorado esa respuesta. Si el cambio no se traslada a tareas posteriores e independientes, el sistema no ha adquirido una actualización duradera.

En el **nivel 1**, las personas eligen el objetivo y la prueba de éxito; la IA aplica una actualización, por ejemplo, una regla de calidad de datos definida por una persona. En el **nivel 2**, la IA también elige una estrategia para el objetivo asignado, quizá diagnosticando los fallos de un agente de programación y proponiendo cambios en sus herramientas. El objetivo y la prueba de aceptación siguen fijándose fuera del sistema.

En el **nivel 3**, el sistema ayuda a elegir qué experiencia necesita a continuación, por ejemplo, tareas de práctica dirigidas a las debilidades que ha detectado. El **nivel 4** añade retroalimentación del uso continuado: el sistema conserva cambios aprobados en la memoria, las reglas o los componentes tras encontrarse con nuevas condiciones. El artículo considera que ambos niveles dependen de la calidad de la retroalimentación y de las reglas que determinan qué cambios persisten.

**El nivel 5** llega a la idea central de la encuesta. La IA revisa un procedimiento que orienta la *mejora* posterior, como su política de búsqueda, su evaluador o el agente que propone sucesores. El procedimiento revisado debe conservarse y utilizarse en una ronda posterior. Incluso en este nivel, el artículo señala que las personas pueden mantener el control del objetivo general, las pruebas de aceptación protegidas y los recursos. El nivel describe una responsabilidad delegada, no garantiza avances ni implica autonomía sin restricciones.

## Los sistemas existentes muestran dónde está el límite

El estudio de [Darwin Gödel Machine](https://arxiv.org/html/2505.22954) informa que su agente de programación mejoró del 20 % al 50 % en un subconjunto de SWE-bench, mientras distintas variantes modificaban el código del agente y las variantes exitosas se incorporaban a un archivo. Sus autores también indican que el mantenimiento del archivo y la regla para elegir la variante que sería progenitora se mantuvieron fijos. La encuesta lo utiliza para mostrar por qué unos descendientes mejores no demuestran que el proceso que los selecciona haya mejorado por sí mismo.

[A-Evolve-Training](https://arxiv.org/html/2606.20657) ofrece un ejemplo más acotado de nivel 5. Ejecutó cuatro rondas de posentrenamiento en un modelo de 30.000 millones de parámetros. Un metaagente consolidó los resultados y modificó la política de investigación que guiaba a los agentes posteriores, después de que una puntuación interna de desarrollo dejara de seguir una clasificación externa. El estudio informa de una puntuación final de 0,86, frente a 0,87 de la mejor propuesta humana de entonces. La política heredada cambió cómo se elegían los experimentos posteriores. El sistema subyacente de los agentes y el objetivo de la competición siguieron fijos. Esto muestra un procedimiento de investigación revisado dentro de un proyecto definido, no un control autónomo de todos los aspectos del desarrollo del modelo.

El estudio [El estudio de ](https://arxiv.org/html/2603.19461) evalúa si un procedimiento mejorado para crear agentes se transfiere a un nuevo ámbito. Tras 200 iteraciones sobre la calificación de matemáticas, una ejecución que partía de mejoras transferidas obtuvo 0,640 en su conjunto de prueba, frente a 0,610 para otra que partía de su agente inicial. Los autores dicen que la diferencia no fue estadísticamente significativa. El resultado justifica seguir investigando la transferencia, pero no demuestra una acumulación fiable entre ejecuciones.

## Más actividad no demuestra una mejora mayor

La encuesta distingue la reutilización de un procedimiento revisado, que denomina *recursión estructural*, de la *recursión efectiva*: que el procedimiento revisado produzca sucesores mejores con presupuestos comparables y evaluación independiente. Esa segunda prueba es lo que el título llamativo invita a los lectores a dar por hecho.

Hay varias formas de confundir actividad con progreso. Un sistema puede dedicar más capacidad de cómputo a buscar, sobreajustarse a una prueba que ha consultado repetidamente o conservar un cambio que mejora una tarea mientras perjudica otra. Si también modifica su evaluador, las puntuaciones más altas pueden reflejar una vara de medir nueva. Por eso, el artículo propone registrar qué se revisó, demostrar que el componente revisado guio realmente la ronda siguiente, compararlo con el componente anterior con recursos equivalentes y probar la retención y la transferencia en tareas independientes.

Los autores afirman explícitamente que los resultados actuales respaldan cambios acotados en mecanismos de mejora, evaluadores y políticas de investigación, mientras que «sigue abierta la acumulación estadísticamente fiable entre generaciones con recursos comparables». La frase «la última IA creada por humanos» nombra el destino que motiva su marco. La encuesta proporciona criterios para evaluar los avances hacia él.

## Fuentes y lecturas adicionales

- [Duan et al., *La última IA creada por humanos*, versión 3](https://arxiv.org/html/2609.11873v3) (22 de septiembre de 2026). Esta encuesta primaria define B0 y los niveles 1–5, distingue la recursión estructural de la efectiva y expone los límites de la evidencia. Su taxonomía e interpretaciones son el marco de los autores, no la demostración de un sistema nuevo.
- [Zhang et al., *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (versión 3, 12 de marzo de 2026). El estudio original informa de mejoras en una prueba de programación y especifica que el mantenimiento del archivo y la selección de progenitores siguieron fijos.
- [Shi et al., *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (versión 3, 8 de septiembre de 2026). El preprint original describe cuatro rondas de posentrenamiento, la revisión de políticas y el resultado declarado en la clasificación. El objetivo y el sistema subyacente de los trabajadores siguen definidos desde fuera.
- [Zhang et al., *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). El estudio original evalúa la transferencia de un procedimiento de creación de agentes e informa que la comparación de 200 iteraciones citada aquí no tiene significación estadística.
- [Análisis detallado de Manuel Muñoz Plá](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 de septiembre de 2026), que examina los ejemplos de nivel superior y los límites de la evidencia de la encuesta. Analiza una versión anterior del artículo; el texto principal utiliza la versión 3 y los estudios originales citados para sus afirmaciones factuales.
- [Reportaje del South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 de septiembre de 2026) sobre la hoja de ruta de cinco etapas de la encuesta y el contexto de investigación en IA. Es cobertura secundaria, no evidencia de los resultados de los estudios.
- [Explicación de The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 de septiembre de 2026) que resume los niveles y sitúa el artículo en el debate sobre la investigación automatizada en IA. Es cobertura secundaria; la encuesta y los estudios originales respaldan las afirmaciones factuales anteriores.

## Sources

- [Duan et al.: La última IA creada por humanos](https://arxiv.org/html/2609.11873v3) — Encuesta primaria de los niveles de autonomía y ejemplos de investigación. Define la recursión estructural y la efectiva, y afirma que aún no se ha demostrado una acumulación estadísticamente fiable entre generaciones con recursos comparables. No demuestra la creación de una IA autónoma nueva.
- [Historial de envíos a arXiv del artículo 2609.11873](https://arxiv.org/abs/2609.11873) — Registra la versión 1 el 10 de septiembre y la versión 3 el 22 de septiembre; identifica a Yi Duan y otros 34 coautores.
- [Zhang et al.: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — El estudio original informa de un aumento del 20 % al 50 % en su subconjunto de SWE-bench y dice que el sistema no puede modificar el mantenimiento del archivo ni la selección de progenitores.
- [Shi et al.: A-Evolve-Training](https://arxiv.org/html/2606.20657) — El preprint original describe cuatro rondas autónomas de posentrenamiento, una política de investigación revisada que se conserva y una puntuación de clasificación de 0,86 frente a 0,87 en la fecha de comparación indicada. El sistema subyacente y el objetivo permanecen fijos.
- [Zhang et al.: HyperAgents](https://arxiv.org/html/2603.19461) — El estudio original informa de una comparación de transferencia de 200 iteraciones: 0,640 frente a 0,610 en una prueba de calificación de matemáticas; la diferencia no es estadísticamente significativa.
- [Manuel Muñoz Plá: La última IA creada por humanos, leída en profundidad](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Análisis independiente de una versión anterior de la encuesta. Se incluye como contexto; los artículos originales respaldan las afirmaciones de investigación de este texto.
- [South China Morning Post: investigadores chinos trazan un camino de cinco etapas](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Reportaje secundario sobre esta encuesta y su contexto de investigación. Es lectura complementaria, no evidencia primaria de resultados experimentales.
- [The Rundown AI: investigadores chinos describen una IA capaz de crear a sus sucesoras](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Explicación secundaria de los cinco niveles del artículo y del debate general. Los estudios originales respaldan las afirmaciones factuales de investigación de este texto.
El boletín de BIG CHANGE

La visión global, a tu ritmo.

Historias recientes sobre IA y robótica, cambios que vale la pena observar e ideas prácticas para usar. Elige un informe diario, un resumen semanal o una perspectiva mensual.