企業は、モデルの回答を比較し、問題点を説明し、より良い作業の例を示す人を雇う。その仕事では、洗練された回答を提出するだけでは要件を満たさない。購入側は、テスト対象のモデルから生成されたものではない判断に対価を払っている場合がある。
404 Mediaは、OpenAI関連のプロジェクトに取り組む請負業者3人がAI利用禁止の規則について説明し、そのうち2人はAIを使ったことでプロジェクトから外された人がいたと話したと報じた。取材対象者のうち2人がMercor経由で仕事をしていた。同社は、プロジェクトの作業を完了するために大規模言語モデルを使うことを契約で禁じており、違反が確認された場合は案件から外すと同媒体に説明した。OpenAIはコメントを控えた。私たちは非公開のプロジェクト文書を見ておらず、個別事例を独自に検証していない。
考えるべきなのは、一つの請負業者プラットフォームに限った問題ではない。企業が人間による独立した確認を求めるとき、AI支援が許される作業とどう区別すべきだろうか。
大きな変化
- 何が変わったか:報じられた請負業者をめぐる問題は、AI訓練の仕事から何を得ようとしているのか、つまり完成済みの回答なのか、独立した人間の評価なのかという食い違いを浮き彫りにする。
- なぜ重要か:Mercorが公開するパイロットでは、専門家の判断そのものを測定する。モデルが生成した順位に置き換えれば、提出物がどれほど洗練されていても、評価対象が変わる。
- 今後の注目点:評価を依頼する企業にとって重要なのは、どの工程で独力の判断を求めるかだ。その要件は作業指示に記し、作業を引き受ける前に担当者が確認できるようにする。
独立した判断自体が購入対象になることがある
AIアシスタントは、最初の草稿をすばやく作る作業なら役に立つ。しかし、参考回答や独立した比較評価を求める作業で、AIの使用を隠せば問題になる。
Mercorが公開する業務分野の専門家向けモデル評価パイロットは、要件を特に明確にしている。専門家は業務上の課題を解き、5つのモデル回答を順位付けして採点し、根拠に基づく説明を書く。専門家の判断自体を測るため、採点基準や正解例は提示しないと掲載されている。課題を解く段階、順位付け、採点、理由の記述ではAIアシスタントの使用を禁じている。
これらの条件が説明しているのは、1つのパイロットだ。その比較は専門家自身の評価を前提としている。評価をモデルに委ねると、実験の内容が変わる。
合成データによるフィードバックが常に悪いデータとは限らない
AI生成の訓練回答をすべて「モデル崩壊」と結び付けたくなるかもしれないが、今回の証拠からはそこまで言えない。Natureに掲載された研究は、元の分布から得たデータを生成データに置き換える再帰的な訓練条件を調べた。その実験では、モデルを重ねて訓練するたびに、元の分布に関する情報が失われた。この設定は、報じられた請負業者の仕事を調査したものではなく、個別の評価が稼働中のOpenAIモデルに影響したかを論文から判断することもできない。
別のモデル崩壊に関する研究は、この区別が重要な理由を示している。各世代の合成データで元の実データを置き換えると崩壊が生じた一方、実データを残して世代ごとの合成データも加えた実験では、著者らは崩壊を回避した。すべての混合が安全だと証明したわけではない。「AI生成」というだけでは原因を特定できず、データの出所、選択方法、訓練過程が重要だと示している。
許可する作業手順を明示する
作業要項では、使用可能なツール、独力での判断が必要な工程、支援を使った場合の開示方法を明記する。Mercorのパイロットは、課題の解決と評価の双方で独立性を求める。AI支援を認める作業を依頼する企業も、担当者自身にどの専門的判断を求めるか説明する必要がある。
レビューにも同じ注意が必要だ。404 Mediaの報道によると、ある内部文書は査読者にAI検出ツールを使わないよう警告し、信頼性に欠けると説明していた。これは基本的な管理原則とも一致する。句読点、作業速度、洗練された文章だけでは、本人がモデルを使った証拠にならない。レビュー担当者は、説明が資料を根拠にしているかを確認し、判断の理由を作業者に尋ね、提出内容の一貫性を比較し、プロジェクトが適法に収集したツール記録を調べることができる。文体上の手掛かり一つだけで、作業者への措置を決めるべきではない。
作業者に必要なのは推測ゲームではなく、異議を申し立てられる規則だ
独立請負業者は、プロジェクトへのアクセスを突然失うことがある。そのため、信頼できる制度では、有償作業を始める前に規則を示し、違反の疑いと確認済みの違反を区別し、関連する証拠について作業者が説明できる窓口を設けるべきだ。これは公正な手続きに関する提言であり、特定の契約や法律に基づく権利を主張するものではない。
作業者側も、独力で判断する要件を依頼内容の一部として扱うべきだ。承認済みのツールが必要だと思う場合は使用前に確認するか、作業を断ることができる。モデルが流暢に書けるからといって、支援利用を隠すことが容認されるわけではない。禁止された外部協力者が正答を出したとしても、利用禁止が変わらないのと同じだ。
判断の出どころを明記する
Mercorの公開パイロットは、作業の仕様を明確にしている。すなわち、補助を使わない専門家の評価だ。AI支援を使う作業を依頼する企業にも、許可するツールと担当者が担うべき判断を同じように明示する必要がある。



