企業聘請人員比較模型答案、指出問題,並提供更好成果的範例。在這類工作中,答案寫得流暢只是交付內容的一部分;買方付費購買的,可能是並非來自受測模型的判斷。

404 Media 報導,三名參與 OpenAI 相關專案的承包人表示,專案規則禁止使用 AI,其中兩人稱曾有人因此遭撤離專案。曾提供其中兩名受訪者的 Mercor 告訴該媒體,其合約禁止使用大型語言模型完成專案工作,確認違規後會將人員移除。OpenAI 拒絕評論。我們未看過私下專案文件,也未獨立查證個案。

值得探討的問題不只涉及某個承包人平台:企業要求獨立的人類審查時,應如何將這類工作與歡迎 AI 輔助的任務區分開來?

重大變化

  • 改變了什麼:報導中的承包人爭議揭露了 AI 訓練工作的目的之爭:究竟要交付完成的答案,還是獨立的人類評估?
  • 為何重要:Mercor 公開招募的試行專案將專業判斷作為衡量標準。即使模型產生的排名寫得很好,用它取代人類判斷,也會改變評估實際衡量的內容。
  • 值得觀察:評估服務買方最重要的選擇,是哪些階段必須由人員在未受 AI 協助下完成。應將這項要求寫入任務說明,讓工作者在接受任務前就能看到。

獨立性可能正是買方付費購買的內容

若任務是快速產出初稿,AI 助理很有用;但若任務要求提供參考答案或獨立比較,而這項差異又被隱瞞,AI 助理就會造成問題。

Mercor 公開刊登的 商業領域模型評估試行專案清楚列出相關要求:專家完成專業任務、排列五個模型的嘗試結果、評分並撰寫以證據為基礎的理由。招募頁指出,專案不會提供評分規準或標準答案,因為專業判斷本身就是衡量標準。專案禁止在解題、排名、評分及撰寫理由時使用 AI 助理。

這些條款只描述一項試行專案。其比較依賴專業人士自行評估;若將評估工作交由模型完成,實驗本身就會改變。

合成回饋不一定是壞資料

把任何 AI 生成的訓練回覆都和「模型崩潰」連在一起很容易,但這會超出本文證據所能支持的範圍。 發表於《Nature》的研究探討了遞迴訓練情境,其中生成資料取代來自原始分布的資料。在這些實驗中,連續訓練的模型逐漸失去對底層分布資訊的掌握。這種設定並非對報導中承包人工作的研究,也無法說明任何特定評分是否影響了已部署的 OpenAI 模型。

另一項 模型崩潰研究則顯示這項差異為何重要。研究作者發現,當每一代合成資料都取代原始真實資料時會發生崩潰;但在實驗中,只要保留真實資料,並讓後續合成資料累積於其上,就能避免崩潰。這並不能證明所有混合方式都安全,但說明「由 AI 生成」本身不足以判定問題;資料來源、篩選方式與訓練流程都很重要。

明確說明允許的工作流程

任務簡介應列明允許使用的工具、指出哪些階段必須由人員獨立判斷,並說明工作者應如何揭露 AI 協助。Mercor 的試行專案要求解題與評估皆須保持獨立。委託 AI 輔助工作的買方,也應說清楚仍期待工作者提供哪些專業判斷。

審查工作同樣需要謹慎。404 Media 報導指出,一份內部文件曾提醒審查者不要使用 AI 偵測工具,並稱這些工具不可靠。這符合基本管理原則:標點、速度或流暢文句都不能證明某人使用了模型。審查者可以檢查理由是否引用來源資料、請工作者說明決策、比對重複提交的內容,並依法調查專案蒐集的工具紀錄。任何單一文風線索都不應決定工作者的處境。

工作者需要可提出異議的規則,而不是猜謎

獨立承包人可能很快失去專案存取權。因此,可信的制度應在有薪工作開始前公布規則,區分疑似違規與已確認違規,並提供管道讓工作者說明相關證據。這是公平程序的建議,不是對任何合約或法律權利的主張。

工作者也應將不得使用 AI 協助的判斷要求視為產品規格的一部分。認為必須使用核准工具的人,可以先詢問,或拒絕該任務。不能因模型寫得流暢,就讓隱瞞協助變得可以接受;正如外部協作者若遭禁止,也不會因答案正確就變得可接受。

明確指定判斷來自何處

Mercor 公開的試行專案明確列出產品規格:由專業人士獨立評估。委託 AI 輔助工作的買方也需要同樣清楚地說明允許哪些工具,以及工作者必須提供什麼判斷。