AI-translated from English; not yet reviewed by a fluent editor.

# AI 訓練工作者也使用 AI 時，缺少的產品是人的判斷

> 報導指出，有人因違規使用 AI 而遭撤離專案；這揭示更大的商業問題：企業必須區分 AI 輔助產出與其原本要購買的獨立人類判斷。

By BIG CHANGE Editorial

Published: 2026-09-22T17:43:18.226Z
Updated: 2026-09-22T23:32:55.869Z
Canonical: https://bigchange.ai/blog/ai-trainers-human-judgment-independent-evaluation

![Three inspection chambers show a machine lens, a human profile alone, and a machine lens beside a human profile.](https://bigchange.ai/api/media/file/ai-trainers-human-judgment-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE. AI-assisted production, independent human judgment and disclosed assisted review can all be useful, but they provide different kinds of evidence. This conceptual apparatus shows those distinct roles; it is not a product interface, detector or claim that synthetic feedback is always harmful.

企業聘請人員比較模型答案、指出問題，並提供更好成果的範例。在這類工作中，答案寫得流暢只是交付內容的一部分；買方付費購買的，可能是並非來自受測模型的判斷。

[404 Media 報導](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai)，三名參與 OpenAI 相關專案的承包人表示，專案規則禁止使用 AI，其中兩人稱曾有人因此遭撤離專案。曾提供其中兩名受訪者的 Mercor 告訴該媒體，其合約禁止使用大型語言模型完成專案工作，確認違規後會將人員移除。OpenAI 拒絕評論。我們未看過私下專案文件，也未獨立查證個案。

值得探討的問題不只涉及某個承包人平台：企業要求獨立的人類審查時，應如何將這類工作與歡迎 AI 輔助的任務區分開來？

## 重大變化

- **改變了什麼：**報導中的承包人爭議揭露了 AI 訓練工作的目的之爭：究竟要交付完成的答案，還是獨立的人類評估？
- **為何重要：**Mercor 公開招募的試行專案將專業判斷作為衡量標準。即使模型產生的排名寫得很好，用它取代人類判斷，也會改變評估實際衡量的內容。
- **值得觀察：**評估服務買方最重要的選擇，是哪些階段必須由人員在未受 AI 協助下完成。應將這項要求寫入任務說明，讓工作者在接受任務前就能看到。

## 獨立性可能正是買方付費購買的內容

若任務是快速產出初稿，AI 助理很有用；但若任務要求提供參考答案或獨立比較，而這項差異又被隱瞞，AI 助理就會造成問題。

Mercor 公開刊登的 [商業領域模型評估試行專案](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting)清楚列出相關要求：專家完成專業任務、排列五個模型的嘗試結果、評分並撰寫以證據為基礎的理由。招募頁指出，專案不會提供評分規準或標準答案，因為專業判斷本身就是衡量標準。專案禁止在解題、排名、評分及撰寫理由時使用 AI 助理。

這些條款只描述一項試行專案。其比較依賴專業人士自行評估；若將評估工作交由模型完成，實驗本身就會改變。

## 合成回饋不一定是壞資料

把任何 AI 生成的訓練回覆都和「模型崩潰」連在一起很容易，但這會超出本文證據所能支持的範圍。 [發表於《Nature》的研究](https://www.nature.com/articles/s41586-024-07566-y)探討了遞迴訓練情境，其中生成資料取代來自原始分布的資料。在這些實驗中，連續訓練的模型逐漸失去對底層分布資訊的掌握。這種設定並非對報導中承包人工作的研究，也無法說明任何特定評分是否影響了已部署的 OpenAI 模型。

另一項 [模型崩潰研究](https://arxiv.org/abs/2404.01413)則顯示這項差異為何重要。研究作者發現，當每一代合成資料都取代原始真實資料時會發生崩潰；但在實驗中，只要保留真實資料，並讓後續合成資料累積於其上，就能避免崩潰。這並不能證明所有混合方式都安全，但說明「由 AI 生成」本身不足以判定問題；資料來源、篩選方式與訓練流程都很重要。

## 明確說明允許的工作流程

任務簡介應列明允許使用的工具、指出哪些階段必須由人員獨立判斷，並說明工作者應如何揭露 AI 協助。Mercor 的試行專案要求解題與評估皆須保持獨立。委託 AI 輔助工作的買方，也應說清楚仍期待工作者提供哪些專業判斷。

審查工作同樣需要謹慎。404 Media 報導指出，一份內部文件曾提醒審查者不要使用 AI 偵測工具，並稱這些工具不可靠。這符合基本管理原則：標點、速度或流暢文句都不能證明某人使用了模型。審查者可以檢查理由是否引用來源資料、請工作者說明決策、比對重複提交的內容，並依法調查專案蒐集的工具紀錄。任何單一文風線索都不應決定工作者的處境。

## 工作者需要可提出異議的規則，而不是猜謎

獨立承包人可能很快失去專案存取權。因此，可信的制度應在有薪工作開始前公布規則，區分疑似違規與已確認違規，並提供管道讓工作者說明相關證據。這是公平程序的建議，不是對任何合約或法律權利的主張。

工作者也應將不得使用 AI 協助的判斷要求視為產品規格的一部分。認為必須使用核准工具的人，可以先詢問，或拒絕該任務。不能因模型寫得流暢，就讓隱瞞協助變得可以接受；正如外部協作者若遭禁止，也不會因答案正確就變得可接受。

## 明確指定判斷來自何處

Mercor 公開的試行專案明確列出產品規格：由專業人士獨立評估。委託 AI 輔助工作的買方也需要同樣清楚地說明允許哪些工具，以及工作者必須提供什麼判斷。

## Sources

- [404 Media：因使用 AI 訓練 AI 而遭解雇的 OpenAI AI 訓練人員](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) — 原始報導根據承包人訪談與文件，說明禁止使用 AI 的規則及據報有人因此遭撤離專案。我們未看過私下文件，也未獨立查證個案；OpenAI 拒絕評論。
- [Mercor：商業領域專家—AI 模型評估試行專案](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) — 公開招募頁指出，專業判斷是衡量標準，並禁止在解題、排名、評分及撰寫理由時使用 AI 助理。它說明的是這項試行專案的設計，並非 Mercor 所有專案的規則或執行情形。
- [Shumailov 等人：以遞迴生成資料訓練時，AI 模型會崩潰](https://www.nature.com/articles/s41586-024-07566-y) — 論文研究生成資料取代原始分布資料的遞迴訓練情境；並未評估報導中的承包人個案，也未證明已部署的 OpenAI 模型受到損害。
- [Gerstgrasser 等人：模型崩潰是否不可避免？](https://arxiv.org/abs/2404.01413) — 實驗區分以合成資料取代原始真實資料，以及保留真實資料並讓合成資料累積於其上兩種情況。結果顯示，合成資料的影響取決於資料處理方式；研究並未替所有真實與合成資料混合方案背書。
