OpenAI 於 10 月 5 日宣布推出 textGrain,這是一種隱形浮水印,會改變模型選用詞語的統計模式。該公司表示,這項功能正分階段推出,以回應歐盟的文字來源規範。相容的偵測器可以在一段文字中尋找該模式,但結果只能有限地提示文字是否由 OpenAI 系統生成或處理。
主要變化
- 有哪些改變: OpenAI 正將文字來源驗證從研究議題推進到有限推出階段。未來幾週,歐盟符合條件的 ChatGPT 與 Codex 輸出將加入浮水印;部分 API 客戶現在已可在全球選擇啟用。
- 為何重要: 評估 AI 文字的組織,未來或許能從措辭本身讀取嵌入的訊號。OpenAI 公布的結果說明,為何偵測結果需要脈絡:短篇或措辭受嚴格限制的文字,以及經過編輯的文字,都可能躲過偵測;誤報也仍有可能。
- 接下來要觀察什麼: 眼前的測試是,這項訊號在不同長度、主題及語言的日常使用中能否可靠保留。OpenAI 正限制偵測器的使用權限,只開放給核准的研究人員與專業機構,同時評估這些限制。
兩種推出方式,存取權限各異
OpenAI 表示,未來幾週將在歐盟所有方案中,為符合條件的ChatGPT 與 Codex 文字輸出加入 textGrain。這是預定的區域性推出,並不代表目前歐盟每一則回覆都有浮水印。至於 API,全球客戶可自 10 月 5 日起選擇在部分模型上啟用;浮水印預設為關閉。OpenAI 表示,客戶可在專案或組織設定中啟用,並選擇支援的模型。符合條件的模型清單會顯示在這些設定中,也可能變動。
TextGrain 透過模型在可能的詞語或詞語片段(稱為 token)之間做選擇來運作。OpenAI 表示,祕密金鑰會在生成過程中引導這些選擇出現細微變化。接著,持有相符金鑰與設定的偵測器會檢查文字中是否含有由此形成的統計模式。浮水印不會新增隱藏字元、空格或可見標點。因此,複製文字不必另外攜帶中繼資料;不過,即使文字完全未改,也不保證訊號一定可被偵測。
這項差異也限制了哪些人能檢查文字。OpenAI 正接受文字偵測器的使用申請,初期對象為核准的研究人員和專業機構。推出時不會向一般大眾開放偵測器。其支援圖片和音訊的公開驗證工具則是另一回事,並不提供開放的 textGrain 檢查功能。
訊號可能漏檢,也可能遭到誤判
OpenAI 在一項評估中回報偵測率,其目標誤報率為 1%。在心理學文字中,偵測器約在 80% 的 200-token 樣本及 95% 的 400-token 樣本中找到浮水印。該公司表示,數學文字的偵測率明顯較低,因為措辭選擇的自由度較小。這些是在指定條件下由公司評估得出的結果,不是對現實世界所遇文字進行的成功率測量。
在另一項針對 400-token 文字的公司測試中,編輯會削弱訊號:以同義詞取代 10% 的詞語,偵測率就從約 92% 降至 66%;取代 25% 則降至 17%。OpenAI 的文件也指出,翻譯、大幅改寫、簡短回答和程式碼都是較難偵測的情況。該公司表示,偵測效果因語言而異。因此,陰性結果不能證明文字是由人撰寫。文字可能太短、經過修改、在功能推出前生成,或由不在浮水印涵蓋範圍內的模型或產品生成。
陽性結果也有其限制。偵測器可能誤報浮水印。若偵測到訊號,OpenAI 表示,這表示其系統很可能至少生成或處理了該段文字的一部分。結果無法衡量個人的貢獻程度、識別帳戶或提示,也不能判定誰撰寫、擁有或應對文字負責。它也無法驗證文字是否正確。單靠結果無法辨認使用工具的人。
OpenAI 計畫進一步評估,並表示打算以開源技術形式發布 textGrain。目前實際變化較有限:部分新生成的 OpenAI 文字會帶有機器可讀訊號,但檢查訊號的方式及其支持的結論仍受到限制。本文依據 OpenAI 的公告與說明文件撰寫;BIG CHANGE 並未生成帶有浮水印的文字,也未執行偵測器。



