OpenAI于10月5日公布textGrain,这是一种不可见水印,会改变模型所选词语的统计模式。公司表示,为响应欧盟文本来源规则,正分阶段推出该功能。配套检测器可以查找一段文字中是否存在这种模式,但检测结果只能有限地提示文字是否由OpenAI系统生成或处理。
重大变化
- 发生了什么: OpenAI正把文本来源验证从研究课题推进到有限发布阶段。未来几周,欧盟符合条件的ChatGPT和Codex输出将加入水印;部分API客户现在即可在全球范围选择启用。
- 为何重要: 评估AI文本的机构未来或许能从措辞本身读取嵌入的信号。OpenAI公布的结果说明,检测结果需要结合上下文:简短或措辞受严格限制的文本,以及经过编辑的文本,都可能无法被检测到;误报也仍有可能。
- 接下来关注: 眼下要检验的是,这种信号在不同长度、主题和语言的日常使用中能否可靠保留。OpenAI正把检测器权限限制在获批研究人员和专业机构手中,同时评估这些局限。
两种发布方式,访问权限各不相同
OpenAI表示,将在未来几周为欧盟各套餐中的符合条件的ChatGPT和Codex文本输出添加textGrain。这是计划中的区域性推出,并不意味着今天每条欧盟回复都带有水印。对于API,全球客户从10月5日起可为部分模型选择启用;水印默认关闭。OpenAI表示,客户可以在项目或组织设置中启用该功能,并选择受支持的模型。符合条件的模型列表会显示在这些设置中,也可能发生变化。
TextGrain通过模型在可能的词语或词片段(称为token)之间进行选择来工作。OpenAI表示,一个密钥会在生成过程中引导这些选择发生细微变化。之后,拥有匹配密钥和设置的检测器会检查文本中是否含有由此形成的统计模式。水印不会添加隐藏字符、空格或可见标点。因此,复制文本无需携带单独的元数据;但即使文字保持完整,也不保证信号仍可被检测到。
这一差别也限制了能够检查文本的人群。OpenAI正在接受文本检测器的申请,初期对象为获批研究人员和专业机构。发布之初,检测器不会向公众开放。其面向公众的图像和音频验证工具适用于其他受支持内容;这些工具不能公开检测textGrain。
信号可能漏检,也可能误报
OpenAI报告称,在一项评估中,检测率对应的目标误报率为1%。对于心理学文本,检测器在约80%的200-token样本和约95%的400-token样本中发现了水印。公司称,数学文本的检测率明显较低,因为措辞的自由度较小。这些是在特定条件下由公司评估得出的结果,并非对现实环境中遇到的文本进行的成功率测量。
在另一项针对400-token文本的公司测试中,编辑削弱了信号:将10%的词替换为同义词,检测率从约92%降至66%;替换25%则降至17%。OpenAI文档还指出,翻译、大幅改写、简短回答和代码都是更难检测的情况。公司表示,检测效果因语言而异。因此,阴性结果不能证明文字由人类撰写。文本可能太短、被修改、生成于功能推出之前,或由水印覆盖范围之外的模型或产品生成。
阳性结果同样有局限。检测器可能误报水印。若检测到信号,OpenAI称这表明其系统很可能生成或处理了文本的至少一部分。但检测结果无法衡量某个人贡献了多少内容,也无法识别账户或提示词,或确定谁撰写、拥有或应对文本负责。它也不能验证文本是否准确。仅凭检测结果无法识别使用工具的人。
OpenAI计划继续评估,并表示有意将textGrain作为开源技术发布。目前实际变化较为有限:部分新生成的OpenAI文本会带有机器可读信号,但检查信号的方式及其能够支持的结论仍受到限制。本文依据OpenAI公告和帮助文档撰写;BIG CHANGE没有生成带水印的文本,也未运行检测器。



