三名前 OpenAI 安全研究人員要求公司監督機構保留獨立安全工作,並釐清員工如何與外部評估人員分享資訊。在一封10 月 8 日發表的公開信中,Tomek Korbak、Jasmine Wang 與 Mikita Balesni 反駁解僱後出現的不當行為指控。OpenAI 告訴 TechCrunch,調查發現研究資訊處理不當的情況反覆發生,範圍不只涉及與外部評估團體分享資訊。信件與 TechCrunch 報導都未提供調查原始紀錄,也未指出涉案的具體政策。

這封信是三名當事人為自身立場辯護。他們表示,自己相信與外部團體合作符合職務範圍與 OpenAI 的工作慣例。他們否認是向 The Information 洩漏有關所謂較難監控之模型架構資訊的人。這些陳述是他們對事件的說法,並非獨立調查確認的結論。

重大變化

  • 有哪些改變:研究人員要求 OpenAI 的安全與保安委員會、安全顧問小組及使命顧問委員會,處理員工如何在遵守保密要求的同時,與獨立安全評估人員合作。
  • 為何重要:信中要求持續讓稽核人員取得資料、保護模型的可監控性,並訂出明確的外部合作規則。這些要求同時涉及外部評估人員能取得哪些資訊,以及員工分享資訊時必須遵守的界線。
  • 接下來關注:OpenAI 據報回應稱,解僱是因違反政策,與提出安全疑慮無關。TechCrunch 報導的這項回應沒有指出具體政策或決策依據。

研究人員所述的事件經過

Korbak 表示,在一起涉及 Hugging Face 的 OpenAI 代理程式事件調查期間,他是外部評估機構 METR 的聯絡人。信中稱,這項調查沒有既定先例,當時內部程序仍在制定中。信中還說,他與外部同行聯絡時,嘗試遵循當時有效的政策。

Balesni 表示,他曾參與跨公司承諾,內容涉及監控模型推理能力。據信中所述,他曾與董事會成員及高階主管討論這項工作,向自己的主管確認,並在分享資料前刪除敏感細節。Wang 表示,為了招募工作,她獲得一名高階主管的電子郵件存取權;她意外開啟一封敏感郵件後,據稱立即通報,並再次要求 IT 撤銷存取權。這些說法都不能證明 OpenAI 調查得出了什麼結論。

要求與公司回應

信中提出三項建議。第一,OpenAI 應履行一項公開承諾;研究人員稱這項承諾由 Sam Altman 作出,內容是持續讓獨立評估人員取得資料。他們擔心解僱可能縮減與 METR 或其他稽核機構的合作。第二,他們要求 OpenAI 及其他前沿模型開發商避免進一步降低模型可監控性的改動,因為安全工作仍仰賴這項能力。信中特別提到監控思維鏈推理,但未證明任何具名模型的可監控性出現了可量測的下降。第三,他們要求 OpenAI 重申支持公開討論安全議題,並公布與外部組織合作的明確程序。

根據TechCrunch 10 月 8 日的報導,OpenAI 尚未正式回應這封信。該媒體稱,一份與其分享的內部備忘錄否認解僱是報復公開發言,並同意研究人員的建議。另有一名發言人告訴 TechCrunch,調查發現處理研究資訊時反覆出現不當行為,範圍超出對外分享。TechCrunch 表示,OpenAI 沒有回答其關於具體政策、解僱情況,或與外部評估人員合作員工所受保護措施的問題。

公開紀錄顯示,各方原則上認同外部安全工作的價值,但對這三名員工如何執行工作仍有爭議。這封信無法核實作者取得了哪些許可或其意圖;公司據報的說法也不足以讓讀者判斷所稱違規是否成立。OpenAI 的監督機構仍須處理這類合作適用哪些規則,以及獨立稽核人員能取得哪些權限。

來源與延伸閱讀