三名前OpenAI安全研究人员要求公司监督机构保护独立安全研究,并明确员工可以如何与外部评估人员分享信息。在一封10月8日发表的公开信中,Tomek Korbak、Jasmine Wang和Mikita Balesni反驳了他们被解雇后出现的不当行为指控。OpenAI告诉TechCrunch,调查发现,除了与外部评估团体分享信息之外,还存在一系列不当处理研究信息的行为。这封信和TechCrunch的报道都没有提供调查原始记录或涉事的具体政策。

这封信是三名当事人表达立场的文件。信中说,他们认为,与外部团体合作属于其工作职责,也符合OpenAI的工作惯例。他们否认自己向The Information泄露了有关所谓较难监测的模型架构的信息。这些陈述反映的是他们对事件的说法,并非独立调查已经确认的事实。

重大变化

  • 有哪些改变:研究人员要求OpenAI的安全与安保委员会、安全顾问小组和使命顾问委员会,说明员工如何在遵守保密要求的同时与独立安全评估人员合作。
  • 为何重要:他们在信中要求持续向审计人员开放、保护模型的可监测性,并为外部合作制定明确规则。这些要求既涉及外部评估人员可以获得哪些信息,也涉及员工分享信息时必须遵守的界限。
  • 接下来关注:据报,OpenAI回应称,解雇是因违反政策,并非因为员工提出安全问题。TechCrunch报道的回应没有说明相关具体政策或作出这些决定所依据的证据。

研究人员称发生了什么

Korbak说,在一起涉及Hugging Face的OpenAI智能体事件调查期间,他是外部评估机构METR的联络人。信中称,这项调查没有既定先例,当时内部流程也在制定中。信中还说,他在与外部同行沟通时,尝试遵守当时有效的政策。

Balesni说,他参与了有关监测模型推理能力的跨公司承诺。据这封信所述,他与董事会成员和高管讨论过这项工作,向自己的汇报对象确认,并在分享材料前删除了敏感细节。Wang说,一名高管的电子邮件访问权限曾因招聘工作而授予她;她意外打开一封敏感邮件后,据她所述,立即报告此事,并再次要求IT部门撤销权限。这些说法都不能证明OpenAI调查得出了什么结论。

研究人员的要求与公司的回应

这封信提出三项建议。第一,OpenAI应兑现一项公开承诺——研究人员称该承诺由Sam Altman作出——持续向独立评估人员开放访问权限。他们担心,这些解雇可能缩小与METR或其他审计机构合作的空间。第二,他们要求OpenAI及其他前沿模型开发商避免进一步降低模型可监测性的改动,因为安全工作仍依赖这种能力。信中特别提到对思维链推理的监测,但没有证明任何具名模型的可监测性已经出现可量化下降。第三,他们要求OpenAI重申支持开放讨论安全问题,并公布与外部机构合作的明确流程。

据TechCrunch 10月8日的报道,OpenAI尚未正式回应这封信。该媒体称,一份与其分享的内部备忘录否认解雇是对公开发声的报复,并表示赞同研究人员的建议。另有一名发言人告诉TechCrunch,调查发现处理研究信息时存在一系列不当行为,范围超出了对外分享。TechCrunch称,OpenAI没有回答其关于具体政策、解雇情形,或与外部评估人员合作员工所受保护措施的问题。

公开记录显示,各方原则上都认可外部安全研究的价值,但对这三名员工如何开展相关工作存在争议。这封信无法核实作者获得了哪些许可或其真实意图;公司据报作出的陈述也不足以让读者判断所谓违规是否成立。OpenAI监督机构仍需明确此类合作适用哪些规则,以及独立审计人员能获得哪些权限。

来源与延伸阅读

  • Korbak、Wang和Balesni:《OpenAI无法独自确保AI安全》,10月8日发表的公开信。作者对事件的说法及其三项建议的一手来源。信中对内部事件、权限和模型工作的描述均为相关当事人的主张。
  • Rebecca Bellan,TechCrunch,2026年10月8日。报道OpenAI发言人和内部备忘录的回应,以及该公司未回答的问题。该报道证实了双方各自的说法,但不能证实争议行为本身。