2026 年 9 月 21 日,不列颠哥伦比亚省宣布起诉 OpenAI;该省在 Tumbler Ridge 校园枪击事件后与 Peace River South 学区委员会共同采取了这一行动。省政府寻求就社区恢复和加强安全防护追究责任。公告陈述的是政府立场,并未证实该公司应承担法律责任。省政府声明

对试图评估 AI 安全的读者而言,值得关注的问题是:组织如何处理已经标记的信息?模型可以识别令人担忧的内容,但服务运营方仍须决定其含义、采取什么行动才有正当理由,以及谁有权采取行动。除了模型的回答,这些决策也值得审视。

重大变化

  • 变化内容:一个省政府和学区委员会正在通过一宗新民事诉讼,要求赔偿并要求 OpenAI 改变安全措施。
  • 为何重要:发现令人担忧的活动后,仍需作出是否人工审核、是否继续提供访问权限以及是否向主管机关披露等重要决定。每项决定都需要明确的负责人和站得住脚的理由。
  • 关注事项:关于这些决策的证据、法院如何处理各项主张,以及拟议监督能否在保护人们免受不合理侵扰的同时,审查未能防范的危险。

这些文件确立了什么

提交至加利福尼亚北区联邦法院的诉状,将该省及第 59 号学区委员会列为原告,将 Sam Altman 和 OpenAI 相关实体列为被告。诉状指称在威胁通报和产品安全方面存在疏失,并寻求损害赔偿和禁令。脚注 2 表示,聊天记录仍待提交。因此,关于内部决策和能否预防事件的指称仍需证据;这份诉状不是司法裁定。已提交的诉状

OpenAI 先前的说法提供了另一个有明确日期的参照点。公司在 2 月 26 日致加拿大人工智能部长的信中称,自动检测和人工审核促使其于 2025 年 6 月封禁一个账户。公司称,当时掌握的信息未达到向执法机关通报的门槛。信中称,之后强化的流程若在当时启用,就会通报该账户;公司还承认,在攻击者身份公开后发现了第二个账户。这些是公司自己的说法,并非关于改革有效性的独立核验结论。2 月的信函

路透社报道称,OpenAI 重申了与主管机关合作并持续开展安全工作的承诺。路透社

2 月的说法早于这场新诉讼,不应拿来替代针对诉状指称的详细回应。同样,声称后来的流程会作出不同决定,也不能证明作出该决定之后会发生什么。评估责任需要审查当时可用的证据以及当时各种选择可能造成的后果。

Three separate groups show a document under a magnifier, an orange barrier beside a blank account card, and an envelope in a tray.
AI-generated conceptual illustration by BIG CHANGE. Left: assessment. Center: account action. Right: external referral. These decisions require separate reasons; one does not automatically establish that the next is justified. Conceptual illustration, not an account of what happened in this case.

检测、账户处置和通报回答的是不同问题

OpenAI 于 4 月 28 日发布的社区安全声明称,公司先通过自动化方式检测,再由人工结合上下文进行评估。可能的结果包括排除警报、进一步调查和处置账户。声明还介绍了申诉流程以及针对重复违规账户采取的措施。网页称,如果对话显示存在迫在眉睫且可信的伤害他人风险,就会通知执法机关。这是公司公布的流程,并不能证明特定案件具体如何处理。社区安全政策

将这些步骤分开,有助于识别哪些证据才有用。检测系统回答的是筛查问题:这些材料是否值得关注?它的输出本身不能决定对某个人应作何判断。人工评估应审查上下文和不确定性,并拥有足够的时间和权限来质疑初步警报。记录应保留评估为何发生变化,包括新增信息何时使一个看似严重的信号显得不那么令人担忧。

账户处置涉及服务访问权限。暂停访问的决定,并不能决定是否应将信息披露给公司之外的机构。反过来,没有理由对外通报,也不一定意味着应当根据服务规则继续允许账户访问。将这些视为不同决定,可以为每项决定分别保留证据和理由。

设想一种假设的审核情形:工作人员一致认为某账户违反服务规则,却对是否存在可信的外部危险意见不一。有用的记录应说明分歧是什么、由谁作出最终决定,以及所依据的理由。仅仅记录“已采取行动”,会掩盖审核者需要评估的大部分信息。

通报会引入另一个具有自身权限和责任的机构。公司应能说明分享了哪些信息、为何披露有正当理由,以及如何确认信息已送达适当的接收方。发送信息无法保证对方会采取特定行动,也无法防止特定结果。评估这一交接环节时,必须清楚呈现这些限制。

改进一个步骤,可能仍会留下另一个问题。如果紧急审核任务一直无人处理,或审核者联系不到有权批准行动的人,那么更好的筛查几乎没有作用。政策变更必须伴随工作人员实际采取行动方式的变化。

审计需要了解决策和后果

诉状要求采用可审计的安全控制措施,并由独立监督方每季度开展合规审计。这些是原告提出的补救措施,并非法院命令作出的变更。诉求内容,第 38 页

现有治理框架为审查决策过程提供了依据。NIST 自愿采用的 2023 年 AI 风险管理框架要求记录责任和沟通方式、明确高层对风险决策的责任,并界定人工监督角色。该框架的评估条款还包括由一线开发人员之外的人员进行评估,并关注控制措施是否持续有效。这份框架是指导文件,并非对本案的裁定,也不是对任何公司的认证。NIST AI 风险管理框架

我们认为,有效的审计需要检查从提出审核请求到最终解决的全过程,包括延误、未解决的分歧和未采取行动便结案的情况。只检查已完成的通报,会遗漏那些使信息留在公司内部的决定;只检查伤害发生后才发现的失败,也会歪曲日常判断的情况。

审计人员还需要区分当时有效的规则与之后修订的规则。否则,公司可能仅凭已发布的新政策就显得符合要求,却没有证明员工接受了培训、必要工具已经到位,或有人检查过变更是否奏效。有用的后续核查应要求公司提供带日期的证据,说明已解决某项明确识别的问题。

审核结果可能揭示指引不清或人员不足等问题,从而让组织能在下一起棘手案件之前加以改正。结果也可能证实,员工在不确定情况下作出了合理判断。只有监督机制既有能力得出任一结论,又能解释其证据依据,监督才更可信。

独立性需要实际权限。如果评估者只能查看经过挑选的案例或汇总数字,就无法还原存在争议的决策。比显眼头衔更重要的是:能够访问相关记录、能够报告未解决的问题,并有明确的整改途径。这些安排本身也需要隐私保护,以及对敏感记录使用方式的限制。

增加报告也可能带来另一种安全问题

如果系统因通报次数增加而受到奖励,提高数字显而易见的方法就是通报更多人。这可能造成不必要的信息披露,也会分散对更强烈信号的注意力。统计通报数量,只能衡量活动量;若要判断质量,则需了解通报理由以及后来发现了哪些错误。

另一个方向的指标也可能误导人。较低的决定撤销率,可能说明判断准确,也可能说明人们无法有效提出异议。较短的平均审核时间,可能掩盖少数异常延误的案例。经理和外部审核者在将任何指标视为安全证据之前,都应先问清它遗漏了什么。

隐私也属于这项评估的一部分。审核记录可能含有关于某个人的高度私密信息,而最终该人可能并不存在任何相关威胁。为了检查决定而保留足够证据,并不意味着每位员工都应访问这些信息,也不意味着应无限期保留相关对话。记录目的、允许访问的范围和保留期限都应明确;如有法律义务,还应妥善保存所需材料。

公开解释系统与暴露个人记录之间也有区别。有关审核延误、纠正决定和政策变更的汇总信息,可以支持公众监督;详细记录则可限制为授权评估人员访问。如果小群体或罕见情况可能暴露个人身份,即便是汇总报告也要谨慎处理。

我们也希望监督能够检查不同群体所受的错误是否不均。如果相似材料在不同语言或上下文中受到不同处理,整体准确率数据可能掩盖问题。这是一项建议评估的问题,并非声称本案已经证实了这种模式。

可信的下一步应该是什么样

对于诉讼,读者应区分新的指称、提交的证据,以及法院实际作出的决定。要求设置某项保护措施,只能说明原告希望得到什么;该措施是否正当、是否足够明确或法律是否要求采取,是另一个问题。

对于整个行业,切实的进展应体现在有日期的流程变更、对困难决策明确分工负责,以及能证明修正措施已落实到日常运营的证据。公司应说明任何独立评估的范围和局限。政策制定者应同时考察过度干预的代价和未能采取行动的后果。

机会在于让安全工作更容易接受检查和纠正。风险则是公众压力带来更广泛的监控或更多文书工作,却没有改善决策。读者可以向每项承诺的改革提出一个具体问题:有什么证据能表明它改善了判断,包括有依据地保持克制的情况?