AI-translated from English; not yet reviewed by a fluent editor.

# AI 训练员也用 AI 时，缺失的产品是人的判断

> 据报道，有人因在工作中违规使用 AI 而被撤出项目。这暴露出一个更大的业务问题：企业必须区分 AI 辅助生产与独立的人类判断，明确自己真正想购买哪一种服务。

By BIG CHANGE Editorial

Published: 2026-09-22T17:43:18.226Z
Updated: 2026-09-22T23:32:55.869Z
Canonical: https://bigchange.ai/blog/ai-trainers-human-judgment-independent-evaluation

![Three inspection chambers show a machine lens, a human profile alone, and a machine lens beside a human profile.](https://bigchange.ai/api/media/file/ai-trainers-human-judgment-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE. AI-assisted production, independent human judgment and disclosed assisted review can all be useful, but they provide different kinds of evidence. This conceptual apparatus shows those distinct roles; it is not a product interface, detector or claim that synthetic feedback is always harmful.

企业雇人比较模型答案、解释问题所在，并提供更好的工作示例。在这种场景下，回复写得漂亮只是交付的一部分。买家购买的可能是一种并非来自受测模型本身的判断。

[404 Media 报道](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai)称，参与 OpenAI 相关项目的三名承包人员介绍了禁止使用 AI 的规则，其中两人表示有人因违规使用 AI 而被撤出项目。为受访者中的两人提供项目的 Mercor 告诉该媒体，其合同禁止使用大型语言模型完成项目工作，一经证实违规就会将人员移出项目。OpenAI 拒绝置评。我们没有看到这些私人项目文件，也未独立核实个案。

有用的问题不止涉及某一个承包平台：当企业要求独立的人工审核时，应如何将这类工作与欢迎使用 AI 辅助的任务区分开？

## 重大变化

- **变化内容：**据报道的承包人员争议，凸显了一个冲突：AI 训练工作旨在提供已完成的答案，还是独立的人工评估？
- **为何重要：**Mercor 公布的试点将专业判断作为测量对象。用模型生成的排序取代这种判断，就会改变评估实际测量的内容，即使提交结果写得很专业也一样。
- **关注事项：**对于评估服务的买家而言，关键选择是哪些环节必须由人员独立判断。这一要求应写进任务说明，让工作者在接单前就能看到。

## 买家购买的可能正是独立判断

如果任务是快速产出初稿，AI 助手很有用。但如果任务要求提供参考答案或独立比较，且这种区别被隐瞒，AI 助手就会成为问题。

Mercor 公开列出的[商业领域模型评估试点](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting)清楚说明了这一要求。专家要完成一项专业任务，对五个模型的尝试结果排序、评分，并撰写以证据为依据的理由。招聘信息称，不提供评分标准或标准答案，因为专业判断本身就是测量对象。它禁止在解题、排序、评分和撰写理由时使用 AI 助手。

这些条款描述的是一项试点。其比较依赖专业人员自己的评估；若将此评估委托给模型，实验本身就会改变。

## 合成反馈并非天然就是坏数据

人们很容易把任何 AI 生成的训练回复都与“模型崩溃”联系起来，但这里的证据不足以支持这种推断。[《自然》发表的研究](https://www.nature.com/articles/s41586-024-07566-y)考察了递归训练情形，即用生成数据取代来自原始分布的数据。在这些实验中，后续模型逐渐丢失有关底层分布的信息。这种实验设置并非对据报承包工作所作的研究，论文也无法告诉我们某条具体评分是否影响了已部署的 OpenAI 模型。

另一项[模型崩溃研究](https://arxiv.org/abs/2404.01413)进一步说明了这种区别为何重要。研究作者发现，如果每一代生成数据取代了原始真实数据，就会出现模型崩溃；在他们的实验中，若保留真实数据，同时逐代累积合成数据，则可避免崩溃。该结果并不能证明所有混合方式都安全，但确实说明“AI 生成”本身不足以构成判断依据；数据来源、筛选方式和训练流程都很重要。

## 明确说明哪些工作流程获准

任务说明应列明允许使用的工具、哪些环节必须由人员独立判断，以及工作者应如何披露所获辅助。Mercor 的试点要求解题和评估都独立完成。委托 AI 辅助工作的买家，则应说明仍希望工作者提供哪些专业判断。

审核同样需要谨慎。404 Media 报道称，一份内部文件提醒审核人员不要使用 AI 检测工具，并称这类工具并不可靠。这符合一项基本管理原则：标点、速度或措辞流畅，都不能证明某人使用了模型。审核人员可以检查理由是否引用了源材料、请工作者解释某项决定、比较其重复提交的内容，并查看项目依法收集的工具记录。任何单一的文风线索都不应决定工作者的去留。

## 工作者需要的是可以申辩的规则，而不是猜谜游戏

独立承包人员可能很快失去项目访问权。因此，可信的制度应在付费工作开始前公开规则，区分疑似违规和已确认违规，并提供渠道，让工作者解释相关证据。这是关于公平程序的建议，并非对任何合同或法律权利的判断。

与此同时，工作者应将独立判断要求视为产品规格的一部分。如果认为必须使用获准工具，可以先询问再使用，或拒绝该任务。隐瞒辅助工具的使用，不会因为模型写得漂亮就变得可以接受；这就像禁止与外部合作者共同完成答案，即使答案正确，也不意味着违规可以接受。

## 明确说明判断来自何处

Mercor 公开的试点将产品规格写得很清楚：由专业人员独立评估。委托辅助工作的买家，也应同样明确说明允许使用哪些工具，以及工作者必须提供何种判断。

## Sources

- [404 Media：为 OpenAI 训练 AI 的工作者因使用 AI 而被解雇](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) — 原创报道依据承包人员访谈和文件，介绍了禁止使用 AI 的规定及据报发生的撤出项目事件。我们没有看到私人文件，也未独立核实个案；OpenAI 拒绝置评。
- [Mercor：商业领域专家 — AI 模型评估试点](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) — 公开招聘信息称，专业判断是评估对象，并禁止在解题、排序、评分和撰写理由时使用 AI 助手。该信息说明的是这一试点的设计，不代表 Mercor 所有项目的规则或执行方式。
- [Shumailov 等人：用递归生成的数据训练会导致 AI 模型崩溃](https://www.nature.com/articles/s41586-024-07566-y) — 论文研究了用生成数据取代原始分布数据的递归训练设置。它并未评估据报的承包人员个案，也未证明已部署的 OpenAI 模型受到损害。
- [Gerstgrasser 等人：《模型崩溃不可避免吗？》](https://arxiv.org/abs/2404.01413) — 实验区分了取代原始真实数据与在保留原始数据的同时累积合成数据两种做法。结果表明，合成数据的影响取决于数据处理流程；研究并未证明所有真实数据与合成数据的混合都安全。
