企业雇人比较模型答案、解释问题所在,并提供更好的工作示例。在这种场景下,回复写得漂亮只是交付的一部分。买家购买的可能是一种并非来自受测模型本身的判断。
404 Media 报道称,参与 OpenAI 相关项目的三名承包人员介绍了禁止使用 AI 的规则,其中两人表示有人因违规使用 AI 而被撤出项目。为受访者中的两人提供项目的 Mercor 告诉该媒体,其合同禁止使用大型语言模型完成项目工作,一经证实违规就会将人员移出项目。OpenAI 拒绝置评。我们没有看到这些私人项目文件,也未独立核实个案。
有用的问题不止涉及某一个承包平台:当企业要求独立的人工审核时,应如何将这类工作与欢迎使用 AI 辅助的任务区分开?
重大变化
- 变化内容:据报道的承包人员争议,凸显了一个冲突:AI 训练工作旨在提供已完成的答案,还是独立的人工评估?
- 为何重要:Mercor 公布的试点将专业判断作为测量对象。用模型生成的排序取代这种判断,就会改变评估实际测量的内容,即使提交结果写得很专业也一样。
- 关注事项:对于评估服务的买家而言,关键选择是哪些环节必须由人员独立判断。这一要求应写进任务说明,让工作者在接单前就能看到。
买家购买的可能正是独立判断
如果任务是快速产出初稿,AI 助手很有用。但如果任务要求提供参考答案或独立比较,且这种区别被隐瞒,AI 助手就会成为问题。
Mercor 公开列出的商业领域模型评估试点清楚说明了这一要求。专家要完成一项专业任务,对五个模型的尝试结果排序、评分,并撰写以证据为依据的理由。招聘信息称,不提供评分标准或标准答案,因为专业判断本身就是测量对象。它禁止在解题、排序、评分和撰写理由时使用 AI 助手。
这些条款描述的是一项试点。其比较依赖专业人员自己的评估;若将此评估委托给模型,实验本身就会改变。
合成反馈并非天然就是坏数据
人们很容易把任何 AI 生成的训练回复都与“模型崩溃”联系起来,但这里的证据不足以支持这种推断。《自然》发表的研究考察了递归训练情形,即用生成数据取代来自原始分布的数据。在这些实验中,后续模型逐渐丢失有关底层分布的信息。这种实验设置并非对据报承包工作所作的研究,论文也无法告诉我们某条具体评分是否影响了已部署的 OpenAI 模型。
另一项模型崩溃研究进一步说明了这种区别为何重要。研究作者发现,如果每一代生成数据取代了原始真实数据,就会出现模型崩溃;在他们的实验中,若保留真实数据,同时逐代累积合成数据,则可避免崩溃。该结果并不能证明所有混合方式都安全,但确实说明“AI 生成”本身不足以构成判断依据;数据来源、筛选方式和训练流程都很重要。
明确说明哪些工作流程获准
任务说明应列明允许使用的工具、哪些环节必须由人员独立判断,以及工作者应如何披露所获辅助。Mercor 的试点要求解题和评估都独立完成。委托 AI 辅助工作的买家,则应说明仍希望工作者提供哪些专业判断。
审核同样需要谨慎。404 Media 报道称,一份内部文件提醒审核人员不要使用 AI 检测工具,并称这类工具并不可靠。这符合一项基本管理原则:标点、速度或措辞流畅,都不能证明某人使用了模型。审核人员可以检查理由是否引用了源材料、请工作者解释某项决定、比较其重复提交的内容,并查看项目依法收集的工具记录。任何单一的文风线索都不应决定工作者的去留。
工作者需要的是可以申辩的规则,而不是猜谜游戏
独立承包人员可能很快失去项目访问权。因此,可信的制度应在付费工作开始前公开规则,区分疑似违规和已确认违规,并提供渠道,让工作者解释相关证据。这是关于公平程序的建议,并非对任何合同或法律权利的判断。
与此同时,工作者应将独立判断要求视为产品规格的一部分。如果认为必须使用获准工具,可以先询问再使用,或拒绝该任务。隐瞒辅助工具的使用,不会因为模型写得漂亮就变得可以接受;这就像禁止与外部合作者共同完成答案,即使答案正确,也不意味着违规可以接受。
明确说明判断来自何处
Mercor 公开的试点将产品规格写得很清楚:由专业人员独立评估。委托辅助工作的买家,也应同样明确说明允许使用哪些工具,以及工作者必须提供何种判断。



