一項於 9 月 10 日發布、9 月 22 日修訂的 arXiv 調查提出 AI 參與改進 AI 系統的五個層級。論文標題《人類打造的最後一個 AI》描述的是一項願景,並非作者宣稱已發生的事件。調查證據涵蓋的是系統修改自身開發流程部分環節的有限案例,並未證明有系統能一代接一代地可靠打造更好的後繼模型。
解讀自動化 AI 研究的主張時,這項區別很重要。代理可以執行實驗、保存經驗並提高基準分數,但人類仍可能設定目標、控制測試,並決定哪些改動得以保留。更強的主張需要證據證明,系統改進了產生下一版本的方法,而且在公平比較中,修訂後的方法表現更好。
重大變化
- 有哪些改變:研究人員現在有更精確的方式描述系統掌控 AI 改進循環的程度,範圍從執行指定更新,到修訂後續更新所使用的流程。這項新調查整理既有研究,並未宣布已有成熟的自主後繼模型建構器。
- 為何重要:AI 實驗室可以自動化更多實驗,但這不代表每個新代理都更擅長打造下一個代理。兩者之別會影響研究人員如何解讀效能主張,以及在哪些環節保留人工審查與獨立測試。
- 接下來觀察:關鍵證據應是一系列後繼模型:它們沿用經修訂的改進方法,在受保護任務上以可比較資源,對照舊方法進行測試。目前調查涵蓋的研究尚未證明,以此標準衡量的累積進步具有統計可靠性。
五個層級描述對改進循環的掌控程度
論文首先區分單一任務的修訂(稱為 B0)與持續改進。若模型反覆修改一個答案,直到通過檢查,改進的是該答案。除非這項改動延續到後續獨立任務,否則系統本身並未取得持續性的更新。
在第 1 級中,人類選擇目標與成功測試;AI 執行更新,例如套用由人類定義的資料品質規則。在第 2 級中,AI 也會為指定目標選擇策略,例如診斷程式編寫代理的失誤,並提出工具修改方式。目標與驗收測試仍由系統外部設定。
在第 3 級中,系統會協助選擇下一步需要哪些經驗,例如針對已發現的弱點安排練習任務。第 4 級則加入持續使用所帶來的回饋:系統遇到新情況後,會將經核准的修改保留在記憶、規則或元件中。論文指出,這兩個層級都取決於回饋品質,以及決定哪些修改能持續生效的規則。
第 5 級達到這項調查的核心概念:AI 會修訂引導後續改進的程序,例如搜尋策略、評估器或提出後繼模型的代理。修訂後的程序必須獲得保留,並在下一輪實際使用。即便如此,論文指出,人類仍可掌控整體目標、受保護的驗收測試及資源。層級描述的是委派的責任,不是進步保證,也不代表不受限制的自主權。
現有系統展示了這條界線
《Darwin Gödel Machine 研究》報告指出,在該研究的 SWE-bench 子集中,程式編寫代理的分數從 20% 提升到 50%;不同版本會修改代理程式碼,而成功版本會納入檔案庫。作者也說明,檔案庫維護方式及選擇哪一版本作為父版本的規則是固定的。調查引用此研究,說明為何後繼版本變得更好,不足以證明挑選後繼版本的流程本身也已改進。
A-Evolve-Training提供一個範圍較窄的第 5 級案例。研究人員以一個 300 億參數模型進行四輪後訓練。當內部開發分數不再與外部排行榜同步時,元代理整合實驗結果,並修改引導後續工作者的研究策略。研究報告的最終分數為 0.86,當時最高的人工作品為 0.87。沿用的策略改變了後續實驗的選擇方式;工作者底層系統與競賽目標仍維持不變。這顯示特定專案內的研究程序經過修訂並投入運作,並非由 AI 自主掌控模型開發的每個環節。
《HyperAgents 研究》測試經改進的代理建構程序能否轉移至新領域。在數學批改任務上迭代 200 次後,從轉移改進成果開始的一次執行,在測試集得分為 0.640;從初始代理開始的一次執行則為 0.610。作者指出,差異未達統計顯著。結果支持進一步研究轉移能力,但不能證明改進能在多輪執行中可靠累積。
活動增加不等於改進效果提升
調查區分了修訂後的程序獲得重用(稱為結構遞迴)與有效遞迴:後者要求修訂程序在可比較資源及獨立評估下,產生更強的後繼模型。戲劇化的論文標題容易讓讀者以為第二項測試已經通過。
有幾種情況容易讓人把活動誤認為進步。系統可能投入更多運算搜尋、對反覆查詢過的基準測試過度擬合,或保留一項有助於某個任務卻破壞另一任務的修改。如果系統也更改了自己的評估器,分數提高可能只是衡量標準改變。因此,論文主張應記錄哪些部分經過修訂、證明修訂元件確實引導了下一輪、在資源相同的條件下與舊元件比較,並在獨立任務上測試修改能否保留及轉移。
作者明確表示,目前結果支持對改進器、評估器與研究策略進行有限改動;但「在可比較資源下,跨世代累積出具統計可靠性的進步,仍是未解問題」。標題中的「人類打造的最後一個 AI」指出了促使作者提出此架構的目標。這項調查提供評估邁向該目標進展程度的標準。
來源與延伸閱讀
- Duan 等人:《人類打造的最後一個 AI》,第 3 版(2026 年 9 月 22 日)。這項主要調查定義 B0 與第 1 至第 5 級、區分結構遞迴與有效遞迴,並說明證據限制。其分類法與詮釋是作者提出的架構,並非新的系統示範。
- Zhang 等人:Darwin Gödel Machine(第 3 版,2026 年 3 月 12 日)。原始研究報告程式編寫基準測試的進步,並說明檔案庫維護與父版本選擇仍為固定流程。
- Shi 等人:A-Evolve-Training(第 3 版,2026 年 9 月 8 日)。原始預印本說明四輪後訓練、策略修訂及報告中的排行榜結果。目標與工作者底層系統仍由外部設定。
- Zhang 等人:HyperAgents(2026 年)。原始研究測試代理建構程序的轉移能力,並報告本文引用的 200 次迭代比較未達統計顯著。
- Manuel Muñoz Plá 的深入解讀(2026 年 9 月 18 日)檢視調查中較高層級的案例及證據限制。該文分析的是論文較早的版本;本文的事實主張依據第 3 版與所引原始研究。
- 《南華早報》的報導(2026 年 9 月 14 日)介紹調查提出的五階段路線圖與 AI 研究背景。這是二手報導,並非研究結果的證據。
- The Rundown AI 的解說(2026 年 9 月 16 日)整理各層級,並說明論文在自動化 AI 研究辯論中的位置。這是二手報導;本文事實主張依據論文與原始研究。



