AI-translated from English; not yet reviewed by a fluent editor.
# AI 트레이너가 AI를 쓸 때 빠진 상품은 인간의 판단이다
> AI 사용 금지 규정을 어겼다는 이유로 계약 업무에서 배제됐다는 보도는 더 큰 사업상 문제를 드러낸다. 기업은 AI의 도움을 받은 작업과 구매하려는 독립적인 인간의 판단을 구분해야 한다.
By BIG CHANGE Editorial
Published: 2026-09-22T17:43:18.226Z
Updated: 2026-09-22T23:32:55.869Z
Canonical: https://bigchange.ai/blog/ai-trainers-human-judgment-independent-evaluation

AI-generated conceptual illustration by BIG CHANGE. AI-assisted production, independent human judgment and disclosed assisted review can all be useful, but they provide different kinds of evidence. This conceptual apparatus shows those distinct roles; it is not a product interface, detector or claim that synthetic feedback is always harmful.
기업은 모델의 답변을 비교하고, 무엇이 잘못됐는지 설명하며, 더 나은 작업의 예시를 제시할 사람을 고용한다. 이런 업무에서 매끄러운 답변은 의뢰 내용의 일부일 뿐이다. 구매자는 평가 대상 모델에서 나오지 않은 판단에 비용을 지불하는 것일 수 있다.
[404 Media는](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) OpenAI 관련 프로젝트에서 일한 계약직 세 명이 AI 사용 금지 규정이 있었다고 말했고, 그중 두 명은 AI 사용 때문에 계약 업무에서 배제됐다고 밝혔다고 보도했다. 인터뷰 대상 두 명을 공급한 Mercor는 해당 매체에 자사 계약은 대규모 언어 모델을 프로젝트 업무에 사용하는 것을 금지하며, 위반이 확인되면 업무에서 배제한다고 말했다. OpenAI는 논평을 거부했다. 우리는 비공개 프로젝트 문서를 보지 못했고 개별 사례를 독립적으로 확인하지 않았다.
유용한 질문은 한 계약직 플랫폼을 넘어선다. 기업이 독립적인 인간의 검토를 요청할 때, AI 보조를 허용하는 업무와 어떻게 구분해야 할까?
## 큰 변화
- **무엇이 바뀌었나:** 계약직 업무를 둘러싼 이번 분쟁 보도는 AI 학습 작업이 무엇을 제공해야 하는지를 둘러싼 충돌을 드러낸다. 완성된 답변인가, 독립적인 인간의 평가인가.
- **왜 중요한가:** Mercor의 공개 시범 프로젝트에서는 전문적인 판단 자체가 측정 대상이다. 제출물이 잘 쓰였더라도 모델이 만든 순위로 이를 대체하면 평가하는 대상이 달라진다.
- **지켜볼 점:** 평가 업무를 의뢰하는 구매자가 내려야 할 중요한 결정은 어떤 단계에서 보조 도구 없이 판단해야 하는지다. 작업자는 일을 수락하기 전에 확인할 수 있도록 이 선택을 업무 지침에 명시해야 한다.
## 독립성 자체가 구매 대상일 수 있다
AI 도우미는 빠르게 초안을 만드는 일이 과제라면 유용하다. 그러나 기준 답안이나 독립적인 비교를 제공하는 것이 과제인데 그 차이를 숨긴다면 문제가 된다.
Mercor가 공개한 [기업 분야 모델 평가 시범 프로젝트](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting)의 공고는 요구 사항을 이례적으로 분명하게 밝힌다. 전문가가 전문 분야의 과제를 풀고, 모델이 시도한 답변 다섯 개의 순위를 매기고, 점수를 부여한 뒤 근거에 기반한 설명을 작성한다. 공고는 전문적인 판단이 측정 대상이므로 평가 기준표나 정답 예시를 제공하지 않는다고 밝힌다. 문제 풀이, 순위 선정, 점수 부여, 근거 작성 단계에서 AI 도우미 사용을 금지한다.
이 조건은 하나의 시범 프로젝트에 관한 것이다. 이 비교는 전문가 자신의 평가에 달려 있으며, 그 평가를 모델에 맡기면 실험의 성격이 달라진다.
## 합성 피드백이 자동으로 나쁜 데이터가 되는 것은 아니다
AI가 생성한 학습 응답이라면 무엇이든 ‘모델 붕괴’와 연결하고 싶은 유혹이 있다. 여기서 확보된 증거로는 그렇게 결론 내릴 수 없다. [Nature에 발표된 연구](https://www.nature.com/articles/s41586-024-07566-y)는 생성된 데이터가 원래 분포에서 얻은 데이터를 대체하는 재귀적 학습 체계를 살펴봤다. 그 실험에서는 모델을 거듭 학습시키자 기저 분포에 관한 정보가 사라졌다. 그러나 그런 설정은 보도된 계약직 업무를 연구한 것이 아니며, 이 논문만으로는 특정 평가 결과가 배포된 OpenAI 모델에 영향을 미쳤는지 알 수 없다.
또 다른 [모델 붕괴 연구](https://arxiv.org/abs/2404.01413)는 이 구분이 중요한 이유를 보여 준다. 연구진은 각 세대의 합성 데이터가 기존의 실제 데이터를 대체할 때 붕괴가 발생했지만, 실제 데이터가 계속 남아 있는 상태에서 합성 데이터를 세대가 바뀔 때마다 더하는 실험에서는 붕괴를 피했다고 밝혔다. 그렇다고 모든 혼합이 안전하다는 뜻은 아니다. 다만 ‘AI 생성’이라는 사실만으로는 충분히 진단할 수 없으며, 데이터의 출처, 선별 방식, 학습 과정이 중요하다는 점은 보여 준다.
## 허용되는 작업 절차를 명확히 하라
업무 지침에는 허용 도구를 명시하고, 보조 없이 판단해야 하는 단계를 밝히며, 작업자가 보조 도구 사용 사실을 어떻게 공개해야 하는지 적어야 한다. Mercor의 시범 프로젝트는 문제 풀이부터 평가까지 독립적으로 수행하도록 규정한다. 보조 도구 사용을 전제로 업무를 의뢰하는 구매자도 작업자에게 기대하는 전문적 판단이 무엇인지 설명해야 한다.
검토에도 같은 주의가 필요하다. 404 Media의 보도에 따르면 내부 문서 하나는 검토자에게 AI 탐지 도구를 사용하지 말라고 경고하며 해당 도구들이 신뢰할 수 없다고 설명했다. 이는 기본적인 관리 원칙과도 맞닿아 있다. 문장 부호나 속도, 매끄러운 문장만으로 누군가 모델을 썼다고 입증할 수는 없다. 검토자는 근거 설명에 원자료가 인용됐는지 살피고, 작업자에게 판단 이유를 설명해 달라고 요청하고, 반복된 제출물을 비교하며, 프로젝트가 적법하게 수집한 도구 기록을 조사할 수 있다. 문체의 단서 하나만으로 작업자의 사례를 판정해서는 안 된다.
## 작업자에게는 추측 게임이 아니라 이의를 제기할 수 있는 규칙이 필요하다
독립 계약자는 프로젝트 접근 권한을 빠르게 잃을 수 있다. 따라서 신뢰할 만한 체계라면 유급 업무가 시작되기 전에 규칙을 확인할 수 있게 하고, 위반 의심과 확인된 위반을 구분하며, 작업자가 관련 증거를 설명할 통로를 제공해야 한다. 이는 공정한 절차에 관한 권고이지, 어떤 계약이나 법률에 따른 권리를 주장하는 것은 아니다.
한편 작업자는 보조 없이 판단하라는 요구를 제품 사양의 일부로 여겨야 한다. 승인된 도구가 필요하다고 생각한다면 사용하기 전에 문의하거나 업무를 거절할 수 있다. 모델이 글을 잘 썼다고 해서 사용 사실을 숨긴 보조가 허용되는 것은 아니다. 답이 정확하더라도 금지된 외부 협력자를 써서는 안 되는 것과 마찬가지다.
## 판단의 주체를 명시하라
Mercor의 공개 시범 프로젝트는 제품 사양을 분명히 한다. 보조 없이 수행하는 전문가 평가다. 보조 작업을 의뢰하는 구매자도 어떤 도구를 허용하며 작업자가 어떤 판단을 제공해야 하는지 똑같이 명확하게 설명해야 한다.
## Sources
- [404 Media: OpenAI의 AI를 학습시키던 사람이 AI 사용으로 해고됐다](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) — 계약직 노동자 인터뷰와 문서를 토대로 한 이 보도는 AI 사용 금지 규정과 업무에서 배제됐다는 사례를 전한다. 우리는 비공개 문서를 보지 못했고 개별 사례를 독립적으로 확인하지 않았다. OpenAI는 논평을 거부했다.
- [Mercor: 기업 분야 전문가 — AI 모델 평가 시범 프로젝트](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) — 공개된 공고는 전문적인 판단이 측정 대상이라고 밝히고, 문제 풀이·순위 선정·점수 부여·근거 작성 단계에서 AI 도우미 사용을 금지한다. 이는 이 시범 프로젝트가 내세운 설계를 보여 주지만, 모든 Mercor 프로젝트의 규칙이나 집행 방식을 입증하지는 않는다.
- [슈마일로프 외: 재귀적으로 생성된 데이터로 학습하면 AI 모델이 붕괴한다](https://www.nature.com/articles/s41586-024-07566-y) — 이 논문은 생성 데이터가 원래 분포의 데이터를 대체하는 재귀적 학습 조건을 연구한다. 보도된 계약직 사례를 평가하지 않았으며 배포된 OpenAI 모델에 피해가 발생했다고 입증하지 않는다.
- [게르스트그라서 외: 모델 붕괴는 불가피한가?](https://arxiv.org/abs/2404.01413) — 실험은 원래의 실제 데이터를 대체하는 경우와 그 데이터를 유지하면서 합성 데이터를 더하는 경우를 구분한다. 결과는 합성 데이터의 효과가 데이터 처리 과정에 따라 달라진다는 점을 보여 주지만, 실제 데이터와 합성 데이터를 섞은 모든 경우가 안전하다고 보증하지는 않는다.
BIG CHANGE 뉴스레터
큰 그림을 나만의 속도로.
AI와 로봇공학에 관한 최신 기사, 주목할 변화, 활용할 수 있는 실용적인 아이디어입니다. 일일 브리핑, 주간 다이제스트 또는 월간 전망을 선택하세요.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
개인정보는 이용자가 선택합니다.
필수 저장소는 사이트 보안을 지원하고 선택 사항을 기억합니다. 선택 사항인 Google Analytics는 허용하기 전까지 꺼져 있습니다. 필수 저장 기능만 사용해 모든 기사를 읽을 수 있습니다. 개인정보 보호 세부 정보