AI-translated from English; not yet reviewed by a fluent editor.
# Survei perbaikan diri AI memetakan kesenjangan antara otomatisasi dan penerus yang lebih baik
> Survei baru memetakan lima tingkat kendali AI atas perbaikannya sendiri. Sistem yang ada menunjukkan kemajuan terbatas, sementara peningkatan andal dari satu generasi ke generasi berikutnya belum terbukti.
By BIG CHANGE Editorial
Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

AI-generated conceptual illustration by BIG CHANGE.
Sebuah [survei yang dipasang di arXiv pada 10 September dan direvisi pada 22 September](https://arxiv.org/html/2609.11873v3) menguraikan lima tingkat keterlibatan AI dalam memperbaiki sistem AI. Judulnya, *AI Terakhir yang Dibangun Manusia*, menggambarkan cita-cita, bukan peristiwa yang dilaporkan para penulis. Bukti mereka mencakup contoh terbatas ketika sistem merevisi sebagian proses pengembangannya sendiri. Bukti itu tidak menunjukkan sistem yang secara andal menghasilkan penerus yang lebih baik dari generasi ke generasi.
Perbedaan ini penting saat menafsirkan klaim tentang riset AI otomatis. Agen dapat menjalankan eksperimen, menyimpan pelajaran, dan meningkatkan skor tolok ukur sementara manusia tetap menetapkan tujuannya, mengendalikan pengujian, dan memutuskan perubahan mana yang dipertahankan. Klaim yang lebih kuat memerlukan bukti bahwa sistem memperbaiki *metode* yang menghasilkan versi berikutnya dan bahwa metode yang direvisi bekerja lebih baik dalam perbandingan yang adil.
## Perubahan besar
- **Yang berubah:** Para peneliti kini memiliki cara yang lebih tepat untuk menjelaskan seberapa banyak bagian dari siklus perbaikan AI yang dikendalikan sistem, mulai dari menjalankan pembaruan yang ditugaskan hingga merevisi prosedur yang digunakan untuk pembaruan selanjutnya. Survei baru ini mengatur penelitian yang sudah ada; survei tersebut tidak mengumumkan pembangun penerus otonom yang telah selesai.
- **Mengapa ini penting:** Laboratorium AI dapat mengotomatiskan lebih banyak eksperimen tanpa membuktikan bahwa setiap agen baru lebih baik dalam membuat generasi berikutnya. Perbedaan itu memengaruhi cara peneliti menafsirkan klaim kinerja dan menentukan bagian yang tetap memerlukan tinjauan manusia serta pengujian independen.
- **Yang perlu dicermati:** Bukti penentu adalah serangkaian penerus yang dibuat dengan metode perbaikan turunan yang sudah direvisi, lalu diuji pada tugas terlindungi melawan metode lama dengan sumber daya sebanding. Penelitian yang disurvei belum membuktikan akumulasi peningkatan yang andal secara statistik dengan dasar tersebut.
## Lima tingkat menggambarkan kendali atas siklus perbaikan
Makalah tersebut terlebih dahulu membedakan revisi satu tugas, yang disebut B0, dari perbaikan persisten. Model yang menyunting jawaban sampai lolos pemeriksaan telah memperbaiki jawaban itu. Jika perubahan tersebut tidak terbawa ke tugas-tugas independen berikutnya, sistem itu sendiri belum memperoleh pembaruan yang bertahan.
Pada **Tingkat 1**, manusia memilih sasaran dan uji keberhasilan; AI menjalankan pembaruan, misalnya menerapkan aturan kualitas data yang ditentukan manusia. Pada **Tingkat 2**, AI juga memilih strategi untuk sasaran yang ditetapkan, mungkin dengan mendiagnosis kegagalan agen pemrograman dan mengusulkan perubahan pada alatnya. Tujuan dan uji penerimaan tetap ditetapkan dari luar sistem.
Pada **Tingkat 3**, sistem membantu memilih pengalaman yang dibutuhkan selanjutnya, misalnya tugas latihan yang menargetkan kelemahan yang telah ditemukannya. **Tingkat 4** menambahkan umpan balik dari penggunaan berkelanjutan: sistem mempertahankan perubahan yang disetujui pada memori, aturan, atau komponen setelah menghadapi kondisi baru. Makalah menyatakan bahwa kedua tingkat bergantung pada mutu umpan balik dan aturan yang menentukan perubahan mana yang bertahan.
**Tingkat 5** mencapai gagasan utama survei. AI merevisi prosedur yang memandu perbaikan *berikutnya*, misalnya kebijakan pencariannya, evaluatornya, atau agen yang mengusulkan penerus. Prosedur yang direvisi harus dipertahankan dan digunakan dalam putaran berikutnya. Bahkan pada tingkat ini, makalah menyebut manusia dapat tetap mengendalikan tujuan keseluruhan, uji penerimaan terlindungi, dan sumber daya. Suatu tingkat menggambarkan tanggung jawab yang didelegasikan, bukan jaminan kemajuan atau otonomi tanpa batas.
## Sistem yang ada menunjukkan batas tersebut
Studi [Darwin Gödel Machine](https://arxiv.org/html/2505.22954) melaporkan bahwa agen pemrogramannya meningkat dari 20% menjadi 50% pada subset SWE-bench yang digunakan penelitian saat beberapa varian memodifikasi kode agen dan varian yang berhasil dimasukkan ke arsip. Penulisnya juga menyatakan bahwa pemeliharaan arsip dan aturan untuk memilih varian yang menjadi induk ditetapkan secara tetap. Survei memakai studi tersebut untuk menunjukkan mengapa keturunan yang lebih baik saja tidak membuktikan bahwa proses pemilihan keturunan itu sendiri telah diperbaiki.
[A-Evolve-Training](https://arxiv.org/html/2606.20657) memberikan contoh Tingkat 5 yang lebih terbatas. Studi itu menjalankan empat putaran pascapelatihan pada model berparameter 30 miliar. Sebuah meta-agen merangkum hasil dan mengubah kebijakan riset yang memandu pekerja berikutnya setelah skor pengembangan internal berhenti selaras dengan papan peringkat eksternal. Studi melaporkan skor akhir 0,86, dibandingkan 0,87 untuk kiriman manusia teratas saat itu. Kebijakan turunan tersebut mengubah cara eksperimen berikutnya dipilih. Sistem dasar para pekerja dan tujuan kompetisi tetap sama. Ini menunjukkan prosedur riset yang direvisi bekerja di dalam proyek yang ditentukan, bukan kendali otonom atas semua bagian pengembangan model.
Studi [HyperAgents](https://arxiv.org/html/2603.19461) menguji apakah prosedur pembuatan agen yang ditingkatkan dapat dialihkan ke ranah baru. Setelah 200 iterasi pada penilaian matematika, proses yang dimulai dengan peningkatan yang dialihkan mendapat skor 0,640 pada set uji, dibandingkan 0,610 untuk proses yang dimulai dari agen awalnya. Penulis melaporkan bahwa perbedaan ini tidak signifikan secara statistik. Hasilnya mendukung penelitian tentang transfer, tetapi tidak membuktikan akumulasi andal lintas proses.
## Aktivitas yang lebih banyak bukan bukti perbaikan yang lebih baik
Survei membedakan penggunaan ulang prosedur yang direvisi, yang disebut *rekursi struktural*, dari *rekursi efektif*: prosedur yang direvisi menghasilkan penerus lebih kuat dengan anggaran yang sebanding dan evaluasi independen. Uji kedua inilah yang mudah diasumsikan pembaca sudah terjadi dari judulnya yang dramatis.
Ada beberapa cara untuk mengira aktivitas sebagai kemajuan. Sistem dapat menghabiskan lebih banyak komputasi untuk mencari, menyesuaikan diri secara berlebihan terhadap tolok ukur yang berulang kali diujinya, atau mempertahankan perubahan yang membantu satu tugas tetapi merusak tugas lain. Jika sistem juga mengubah evaluatornya sendiri, skor yang lebih tinggi mungkin mencerminkan tolok ukur baru. Karena itu makalah menyerukan pencatatan atas apa yang direvisi, pembuktian bahwa komponen yang direvisi benar-benar memandu putaran berikutnya, perbandingan dengan komponen lama menggunakan sumber daya yang sepadan, serta pengujian retensi dan transfer pada tugas independen.
Para penulis secara eksplisit menyatakan bahwa hasil saat ini mendukung perubahan terbatas pada sistem perbaikan, evaluator, dan kebijakan riset, sementara “akumulasi yang andal secara statistik lintas generasi dengan sumber daya sebanding masih menjadi pertanyaan terbuka.” Ungkapan “AI terakhir yang dibangun manusia” menamai tujuan yang melandasi kerangka mereka. Survei ini menyediakan kriteria untuk menilai kemajuan menuju tujuan tersebut.
## Sumber & bacaan lebih lanjut
- [Duan dkk., *AI Terakhir yang Dibangun Manusia*, versi 3](https://arxiv.org/html/2609.11873v3) (22 September 2026). Survei utama ini mendefinisikan B0 dan Tingkat 1–5, membedakan rekursi struktural dan efektif, serta menjelaskan batas bukti. Taksonomi dan interpretasinya adalah kerangka para penulis, bukan demonstrasi sistem baru.
- [Zhang dkk., *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (versi 3, 12 Maret 2026). Studi asli melaporkan peningkatan tolok ukur pemrograman dan menjelaskan bahwa pemeliharaan arsip serta pemilihan induk tetap tidak berubah.
- [Shi dkk., *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (versi 3, 8 September 2026). Preprint asli menjelaskan empat putaran pascapelatihan, revisi kebijakan, dan hasil papan peringkat yang dilaporkan. Tujuan dan sistem dasar pekerjanya tetap ditetapkan dari luar.
- [Zhang dkk., *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). Studi asli menguji transfer prosedur pembuatan agen dan melaporkan bahwa perbandingan 200 iterasi yang dikutip di sini tidak signifikan secara statistik.
- [Pembacaan kritis Manuel Muñoz Plá](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 September 2026) menelaah contoh tingkat tertinggi dan batas bukti dalam survei. Tulisan itu menganalisis versi makalah yang lebih lama; artikel di atas menggunakan versi 3 dan studi asli yang dikutip untuk klaim faktual.
- [Laporan South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 September 2026) membahas peta jalan lima tahap survei dan konteks riset AI. Ini adalah liputan sekunder, bukan bukti hasil penelitian.
- [Penjelasan The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 September 2026) merangkum tingkat-tingkat tersebut dan menempatkan makalah ini dalam perdebatan mengenai riset AI otomatis. Makalah dan studi aslinya mendukung klaim faktual di atas.
## Sources
- [Duan dkk.: AI Terakhir yang Dibangun Manusia, versi 3](https://arxiv.org/html/2609.11873v3) — Survei utama tentang tingkat otonomi dan contoh penelitian. Mendefinisikan rekursi struktural dan efektif serta menyatakan akumulasi andal secara statistik lintas generasi dengan sumber daya sebanding masih menjadi pertanyaan terbuka. Survei tersebut tidak mendemonstrasikan AI otonom yang baru dibangun.
- [Riwayat pengajuan arXiv untuk 2609.11873](https://arxiv.org/abs/2609.11873) — Mencatat versi 1 pada 10 September dan versi 3 pada 22 September; mencantumkan Yi Duan dan 34 rekan penulis.
- [Zhang dkk.: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — Studi asli melaporkan hasil 20% menjadi 50% pada subset SWE-bench dan menyatakan pemeliharaan arsip serta pemilihan induk tidak dapat diubah oleh sistem.
- [Shi dkk.: A-Evolve-Training](https://arxiv.org/html/2606.20657) — Preprint asli menjelaskan empat putaran pascapelatihan otonom, kebijakan riset yang direvisi dan dipertahankan, serta skor papan peringkat 0,86 dibanding 0,87 pada tanggal perbandingan yang dinyatakan. Sistem dasar dan tujuannya tetap ditetapkan.
- [Zhang dkk.: HyperAgents](https://arxiv.org/html/2603.19461) — Studi asli melaporkan perbandingan transfer 200 iterasi sebesar 0,640 dibanding 0,610 pada set uji penilaian matematika; perbedaannya tidak signifikan secara statistik.
- [Manuel Muñoz Plá: AI terakhir yang dibangun manusia, dibaca secara mendalam](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Pembacaan kritis independen atas versi survei yang lebih lama. Dicantumkan sebagai konteks; makalah asli mendukung klaim penelitian dalam artikel ini.
- [South China Morning Post: Peneliti Tiongkok memetakan jalur 5 tahap](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Laporan sekunder tentang survei dan konteks penelitiannya. Ini bacaan tambahan, bukan bukti primer untuk hasil eksperimen.
- [The Rundown AI: Peneliti Tiongkok menguraikan AI yang dapat membangun penerusnya](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Penjelasan sekunder tentang lima tingkat makalah dan perdebatan yang lebih luas. Makalah asli mendukung klaim faktual penelitian dalam artikel ini.
Buletin BIG CHANGE
Gambaran besar. Sesuai tempo Anda.
Kisah terbaru tentang AI dan robotika, perubahan yang patut diikuti, serta gagasan praktis yang dapat diterapkan. Pilih rangkuman harian, mingguan, atau perspektif bulanan.
Dikirim pukul 09:00 waktu Belgrade: setiap hari, hari Senin, atau pada tanggal pertama setiap bulan. Edisi pertama Anda dikirim pada jadwal berikutnya setelah Anda mengonfirmasi.
Privasi Anda, pilihan Anda.
Penyimpanan yang diperlukan membantu menjaga keamanan situs dan mengingat pilihan Anda. Google Analytics opsional tetap nonaktif sampai Anda mengizinkannya. Anda dapat membaca semua artikel hanya dengan penyimpanan yang diperlukan. Detail privasi