OpenAIは10月5日、textGrainを発表した。これは、モデルが選ぶ単語の統計的なパターンを変える目に見えない透かしだ。同社はEUのテキスト来歴ルールに対応し、段階的に導入を始めるとしている。対応する検出器は文章内のパターンを探せるが、その結果が示すのは、OpenAIのシステムがテキストを生成または処理したかどうかについての限られた手がかりにすぎない。

大きな変化

  • 何が変わったのか: OpenAIはテキスト来歴を研究課題として扱う段階から、限定的な提供へと移る。EUで条件を満たすChatGPTとCodexの出力には今後数週間で透かしが付く予定で、一部のAPI顧客はすでに世界各地で任意に有効化できる。
  • なぜ重要なのか: AIテキストを評価する組織は、将来的に文章そのものに埋め込まれた信号を利用できるかもしれない。OpenAIの公表結果は、検出結果に文脈が必要な理由を示している。短い文章や表現に厳しい制約がある文章、編集されたテキストは検出をすり抜けることがあり、誤検出も起こり得る。
  • 今後の注目点: まず問われるのは、長さ、主題、言語が異なる通常の利用環境で、信号がどの程度確実に保たれるかだ。OpenAIは限界を評価する間、検出器の利用を承認済みの研究者と専門機関に限定している。

2つの提供方法、異なるアクセス条件

OpenAIは今後数週間で、欧州連合のすべてのプランにおいて、条件を満たすChatGPTとCodexのテキスト出力にtextGrainを追加するとしている。これは予定されている地域限定の導入であり、現在EUのすべての応答に透かしが付いているという意味ではない。APIでは、世界各地の顧客が10月5日から一部モデルで任意に有効化できる。透かしは初期設定でオフだ。顧客はプロジェクトまたは組織の設定から有効にし、対応モデルを選べるとOpenAIは説明している。対象モデルの一覧は設定画面に表示され、変更されることもある。

textGrainは、モデルが候補となる単語や単語の一部(トークンと呼ばれる)から選択する仕組みを利用する。OpenAIによると、秘密鍵が生成中の選択にわずかな変化を加えるよう導く。その後、対応する鍵と設定を持つ検出器が、文章に統計的なパターンが含まれているかを調べる。透かしによって隠し文字や空白、見える句読点が追加されることはない。そのため、文章をコピーする際に別のメタデータを持ち運ぶ必要はないが、単語をそのまま保っても信号が検出できるとは限らない。

この違いは、誰が文章を確認できるかにも影響する。OpenAIはテキスト検出器の利用申請を受け付けており、当初は承認済みの研究者と専門機関が対象となる。公開時点で一般向けには開放しない。対応する画像や音声向けの公開検証ツールは別のもので、textGrainを誰でも確認できる仕組みではない。

信号を見逃すことも誤って検出することもある

OpenAIはある評価で、検出率を誤検出率の目標を1%として報告した。心理学の文章では、200トークンのサンプルの約80%、400トークンのサンプルの約95%で検出器が透かしを見つけたという。表現の自由度が低い数学では検出率が大幅に下がったと同社は述べている。これは特定の条件で行った同社の評価結果であり、実社会で目にするテキストの成功率を測定したものではない。

同社が400トークンの文章で行った別のテストでは、編集によって信号が弱まった。単語の10%を同義語に置き換えると検出率は約92%から66%に下がり、25%を置き換えると17%になった。OpenAIの文書では、翻訳、大幅な言い換え、短い回答、コードも検出が難しいケースとして挙げられている。同社によると検出率は言語によって異なる。したがって、陰性の結果だけで人間が書いたとは判断できない。文章が短すぎる、改変されている、導入前に生成された、または透かしの対象外のモデルや製品から生成された可能性がある。

陽性の結果にも限界がある。検出器が透かしを誤って報告することもある。信号が見つかった場合、OpenAIは、自社システムが文章の少なくとも一部を生成または処理した可能性を示す証拠だとしている。その結果から人の貢献度を測ったり、アカウントやプロンプトを特定したり、誰が文章を書いたか、所有するか、責任を負うかを決めたりすることはできない。文章が正確かどうかも確認できない。結果だけではツールを使った人を特定できない。

OpenAIは追加評価を計画しており、textGrainをオープンソース技術として公開する意向を示している。現時点で実用上の変化はより限定的だ。新たに生成されるOpenAIのテキストの一部に機械可読な信号が付く一方、それを調べる手段と信号が裏付ける結論は限られたままだ。この記事はOpenAIの発表とヘルプ文書に基づく。BIG CHANGEは透かし付きテキストを生成しておらず、検出器も実行していない。