Sebuah survei yang dipasang di arXiv pada 10 September dan direvisi pada 22 September menguraikan lima tingkat keterlibatan AI dalam memperbaiki sistem AI. Judulnya, AI Terakhir yang Dibangun Manusia, menggambarkan cita-cita, bukan peristiwa yang dilaporkan para penulis. Bukti mereka mencakup contoh terbatas ketika sistem merevisi sebagian proses pengembangannya sendiri. Bukti itu tidak menunjukkan sistem yang secara andal menghasilkan penerus yang lebih baik dari generasi ke generasi.
Perbedaan ini penting saat menafsirkan klaim tentang riset AI otomatis. Agen dapat menjalankan eksperimen, menyimpan pelajaran, dan meningkatkan skor tolok ukur sementara manusia tetap menetapkan tujuannya, mengendalikan pengujian, dan memutuskan perubahan mana yang dipertahankan. Klaim yang lebih kuat memerlukan bukti bahwa sistem memperbaiki metode yang menghasilkan versi berikutnya dan bahwa metode yang direvisi bekerja lebih baik dalam perbandingan yang adil.
Perubahan besar
- Yang berubah: Para peneliti kini memiliki cara yang lebih tepat untuk menjelaskan seberapa banyak bagian dari siklus perbaikan AI yang dikendalikan sistem, mulai dari menjalankan pembaruan yang ditugaskan hingga merevisi prosedur yang digunakan untuk pembaruan selanjutnya. Survei baru ini mengatur penelitian yang sudah ada; survei tersebut tidak mengumumkan pembangun penerus otonom yang telah selesai.
- Mengapa ini penting: Laboratorium AI dapat mengotomatiskan lebih banyak eksperimen tanpa membuktikan bahwa setiap agen baru lebih baik dalam membuat generasi berikutnya. Perbedaan itu memengaruhi cara peneliti menafsirkan klaim kinerja dan menentukan bagian yang tetap memerlukan tinjauan manusia serta pengujian independen.
- Yang perlu dicermati: Bukti penentu adalah serangkaian penerus yang dibuat dengan metode perbaikan turunan yang sudah direvisi, lalu diuji pada tugas terlindungi melawan metode lama dengan sumber daya sebanding. Penelitian yang disurvei belum membuktikan akumulasi peningkatan yang andal secara statistik dengan dasar tersebut.
Lima tingkat menggambarkan kendali atas siklus perbaikan
Makalah tersebut terlebih dahulu membedakan revisi satu tugas, yang disebut B0, dari perbaikan persisten. Model yang menyunting jawaban sampai lolos pemeriksaan telah memperbaiki jawaban itu. Jika perubahan tersebut tidak terbawa ke tugas-tugas independen berikutnya, sistem itu sendiri belum memperoleh pembaruan yang bertahan.
Pada Tingkat 1, manusia memilih sasaran dan uji keberhasilan; AI menjalankan pembaruan, misalnya menerapkan aturan kualitas data yang ditentukan manusia. Pada Tingkat 2, AI juga memilih strategi untuk sasaran yang ditetapkan, mungkin dengan mendiagnosis kegagalan agen pemrograman dan mengusulkan perubahan pada alatnya. Tujuan dan uji penerimaan tetap ditetapkan dari luar sistem.
Pada Tingkat 3, sistem membantu memilih pengalaman yang dibutuhkan selanjutnya, misalnya tugas latihan yang menargetkan kelemahan yang telah ditemukannya. Tingkat 4 menambahkan umpan balik dari penggunaan berkelanjutan: sistem mempertahankan perubahan yang disetujui pada memori, aturan, atau komponen setelah menghadapi kondisi baru. Makalah menyatakan bahwa kedua tingkat bergantung pada mutu umpan balik dan aturan yang menentukan perubahan mana yang bertahan.
Tingkat 5 mencapai gagasan utama survei. AI merevisi prosedur yang memandu perbaikan berikutnya, misalnya kebijakan pencariannya, evaluatornya, atau agen yang mengusulkan penerus. Prosedur yang direvisi harus dipertahankan dan digunakan dalam putaran berikutnya. Bahkan pada tingkat ini, makalah menyebut manusia dapat tetap mengendalikan tujuan keseluruhan, uji penerimaan terlindungi, dan sumber daya. Suatu tingkat menggambarkan tanggung jawab yang didelegasikan, bukan jaminan kemajuan atau otonomi tanpa batas.
Sistem yang ada menunjukkan batas tersebut
Studi Darwin Gödel Machine melaporkan bahwa agen pemrogramannya meningkat dari 20% menjadi 50% pada subset SWE-bench yang digunakan penelitian saat beberapa varian memodifikasi kode agen dan varian yang berhasil dimasukkan ke arsip. Penulisnya juga menyatakan bahwa pemeliharaan arsip dan aturan untuk memilih varian yang menjadi induk ditetapkan secara tetap. Survei memakai studi tersebut untuk menunjukkan mengapa keturunan yang lebih baik saja tidak membuktikan bahwa proses pemilihan keturunan itu sendiri telah diperbaiki.
A-Evolve-Training memberikan contoh Tingkat 5 yang lebih terbatas. Studi itu menjalankan empat putaran pascapelatihan pada model berparameter 30 miliar. Sebuah meta-agen merangkum hasil dan mengubah kebijakan riset yang memandu pekerja berikutnya setelah skor pengembangan internal berhenti selaras dengan papan peringkat eksternal. Studi melaporkan skor akhir 0,86, dibandingkan 0,87 untuk kiriman manusia teratas saat itu. Kebijakan turunan tersebut mengubah cara eksperimen berikutnya dipilih. Sistem dasar para pekerja dan tujuan kompetisi tetap sama. Ini menunjukkan prosedur riset yang direvisi bekerja di dalam proyek yang ditentukan, bukan kendali otonom atas semua bagian pengembangan model.
Studi HyperAgents menguji apakah prosedur pembuatan agen yang ditingkatkan dapat dialihkan ke ranah baru. Setelah 200 iterasi pada penilaian matematika, proses yang dimulai dengan peningkatan yang dialihkan mendapat skor 0,640 pada set uji, dibandingkan 0,610 untuk proses yang dimulai dari agen awalnya. Penulis melaporkan bahwa perbedaan ini tidak signifikan secara statistik. Hasilnya mendukung penelitian tentang transfer, tetapi tidak membuktikan akumulasi andal lintas proses.
Aktivitas yang lebih banyak bukan bukti perbaikan yang lebih baik
Survei membedakan penggunaan ulang prosedur yang direvisi, yang disebut rekursi struktural, dari rekursi efektif: prosedur yang direvisi menghasilkan penerus lebih kuat dengan anggaran yang sebanding dan evaluasi independen. Uji kedua inilah yang mudah diasumsikan pembaca sudah terjadi dari judulnya yang dramatis.
Ada beberapa cara untuk mengira aktivitas sebagai kemajuan. Sistem dapat menghabiskan lebih banyak komputasi untuk mencari, menyesuaikan diri secara berlebihan terhadap tolok ukur yang berulang kali diujinya, atau mempertahankan perubahan yang membantu satu tugas tetapi merusak tugas lain. Jika sistem juga mengubah evaluatornya sendiri, skor yang lebih tinggi mungkin mencerminkan tolok ukur baru. Karena itu makalah menyerukan pencatatan atas apa yang direvisi, pembuktian bahwa komponen yang direvisi benar-benar memandu putaran berikutnya, perbandingan dengan komponen lama menggunakan sumber daya yang sepadan, serta pengujian retensi dan transfer pada tugas independen.
Para penulis secara eksplisit menyatakan bahwa hasil saat ini mendukung perubahan terbatas pada sistem perbaikan, evaluator, dan kebijakan riset, sementara “akumulasi yang andal secara statistik lintas generasi dengan sumber daya sebanding masih menjadi pertanyaan terbuka.” Ungkapan “AI terakhir yang dibangun manusia” menamai tujuan yang melandasi kerangka mereka. Survei ini menyediakan kriteria untuk menilai kemajuan menuju tujuan tersebut.
Sumber & bacaan lebih lanjut
- Duan dkk., AI Terakhir yang Dibangun Manusia, versi 3 (22 September 2026). Survei utama ini mendefinisikan B0 dan Tingkat 1–5, membedakan rekursi struktural dan efektif, serta menjelaskan batas bukti. Taksonomi dan interpretasinya adalah kerangka para penulis, bukan demonstrasi sistem baru.
- Zhang dkk., Darwin Gödel Machine (versi 3, 12 Maret 2026). Studi asli melaporkan peningkatan tolok ukur pemrograman dan menjelaskan bahwa pemeliharaan arsip serta pemilihan induk tetap tidak berubah.
- Shi dkk., A-Evolve-Training (versi 3, 8 September 2026). Preprint asli menjelaskan empat putaran pascapelatihan, revisi kebijakan, dan hasil papan peringkat yang dilaporkan. Tujuan dan sistem dasar pekerjanya tetap ditetapkan dari luar.
- Zhang dkk., HyperAgents (2026). Studi asli menguji transfer prosedur pembuatan agen dan melaporkan bahwa perbandingan 200 iterasi yang dikutip di sini tidak signifikan secara statistik.
- Pembacaan kritis Manuel Muñoz Plá (18 September 2026) menelaah contoh tingkat tertinggi dan batas bukti dalam survei. Tulisan itu menganalisis versi makalah yang lebih lama; artikel di atas menggunakan versi 3 dan studi asli yang dikutip untuk klaim faktual.
- Laporan South China Morning Post (14 September 2026) membahas peta jalan lima tahap survei dan konteks riset AI. Ini adalah liputan sekunder, bukan bukti hasil penelitian.
- Penjelasan The Rundown AI (16 September 2026) merangkum tingkat-tingkat tersebut dan menempatkan makalah ini dalam perdebatan mengenai riset AI otomatis. Makalah dan studi aslinya mendukung klaim faktual di atas.



