O MUNDO NÃO ESTÁ PARADO.RSS
BIG CHANGE.

Edição em Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Quando um treinador de IA usa IA, falta julgamento humano

> Relatos de desligamento de profissionais por uso proibido de IA expõem um problema empresarial maior: as empresas precisam distinguir a produção assistida por IA do julgamento humano independente que pretendem contratar.

By BIG CHANGE Editorial

Published: 2026-09-22T17:43:18.226Z
Updated: 2026-09-22T23:32:55.869Z
Canonical: https://bigchange.ai/blog/ai-trainers-human-judgment-independent-evaluation

![Three inspection chambers show a machine lens, a human profile alone, and a machine lens beside a human profile.](https://bigchange.ai/api/media/file/ai-trainers-human-judgment-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE. AI-assisted production, independent human judgment and disclosed assisted review can all be useful, but they provide different kinds of evidence. This conceptual apparatus shows those distinct roles; it is not a product interface, detector or claim that synthetic feedback is always harmful.

Empresas contratam pessoas para comparar respostas de modelos, explicar o que está errado e dar exemplos de trabalhos melhores. Nesse contexto, uma resposta bem escrita é apenas parte do serviço. O comprador pode estar pagando por um julgamento que não veio do modelo avaliado.

[A 404 Media relata](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) que três prestadores de serviço envolvidos em projetos relacionados à OpenAI descreveram regras contra o uso de IA, e dois disseram que prestadores foram removidos do projeto por esse motivo. A Mercor, que forneceu dois dos entrevistados, disse à publicação que seus contratos proíbem o uso de modelos de linguagem grandes para concluir o trabalho do projeto e que violações confirmadas levam à remoção. A OpenAI não quis comentar. Não vimos os documentos privados do projeto nem verificamos de forma independente casos individuais.

A questão útil vai além de uma plataforma de contratação: quando uma empresa pede uma avaliação humana independente, como deve separar esse trabalho das tarefas em que a assistência de IA é bem-vinda?

## A grande mudança

- **O que mudou:** A disputa relatada entre prestadores de serviço expõe um conflito sobre o que o trabalho de treinamento de IA deve fornecer: respostas concluídas ou uma avaliação humana independente.
- **Por que isso importa:** No piloto público da Mercor, o julgamento profissional é a medida. Substituir classificações humanas por classificações geradas por um modelo altera o que essa avaliação mede, mesmo que o resultado esteja bem escrito.
- **O que observar:** Para quem compra avaliações, a escolha decisiva é quais etapas exigem julgamento sem assistência. Essa condição deve constar nas instruções da tarefa, visíveis aos profissionais antes de aceitarem o trabalho.

## A independência pode ser o produto contratado

Um assistente de IA é útil quando a tarefa é produzir rapidamente um primeiro rascunho. Ele se torna um problema quando a tarefa exige uma resposta de referência ou uma comparação independente e essa distinção é ocultada.

O anúncio público da Mercor para um [piloto de avaliação de modelos por especialistas de domínio](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) deixa a exigência especialmente clara. Especialistas resolvem uma tarefa profissional, classificam cinco tentativas de modelos, dão notas e escrevem justificativas baseadas em evidências. O anúncio diz que não há rubrica nem resposta ideal porque o julgamento profissional é a medida. Ele proíbe assistentes de IA durante a resolução, a classificação, a pontuação e a redação das justificativas.

Esses termos descrevem um único piloto. A comparação depende da avaliação do próprio profissional; delegá-la a um modelo altera o experimento.

## Feedback sintético não é automaticamente um dado ruim

É tentador relacionar qualquer resposta de treinamento gerada por IA ao “colapso de modelos”. Isso iria além das evidências disponíveis neste caso. [Uma pesquisa publicada na Nature](https://www.nature.com/articles/s41586-024-07566-y) examinou regimes de treinamento recursivo nos quais dados gerados substituem dados retirados de uma distribuição original. Nesses experimentos, modelos sucessivos perderam informações sobre a distribuição subjacente. Essa configuração não estuda o trabalho relatado dos prestadores e o artigo não permite saber se alguma avaliação específica afetou um modelo da OpenAI em produção.

Outro [estudo sobre colapso de modelos](https://arxiv.org/abs/2404.01413) mostra por que essa distinção importa. Os autores observaram colapso quando os dados sintéticos de cada geração substituíam os dados reais originais, mas não nos experimentos em que os dados reais eram mantidos e os sintéticos sucessivos eram acumulados junto deles. O resultado não prova que toda mistura seja segura. Mostra, sim, que a expressão “gerado por IA” não basta para diagnosticar o problema; a procedência, a seleção e o processo de treinamento também importam.

## Deixe explícito o fluxo de trabalho permitido

O briefing deve nomear as ferramentas permitidas, identificar as etapas que exigem julgamento sem assistência e dizer como os profissionais devem declarar o uso de ajuda. O piloto da Mercor especifica independência tanto na resolução quanto na avaliação. Quem contrata trabalho assistido deve descrever que julgamento profissional ainda espera que o trabalhador forneça.

A revisão exige o mesmo cuidado. A reportagem da 404 Media diz que um documento interno alertava os revisores para não usar ferramentas de detecção de IA e as descrevia como pouco confiáveis. Isso condiz com um princípio básico de gestão: pontuação, rapidez ou linguagem bem polida não provam que alguém usou um modelo. Um revisor pode conferir se a justificativa cita os materiais de origem, pedir ao profissional que explique uma decisão, comparar envios repetidos e investigar registros de ferramentas que o projeto colete legalmente. Nenhum indício estilístico isolado deve decidir o caso de um trabalhador.

## Profissionais precisam de uma regra contestável, não de um jogo de adivinhação

Prestadores independentes podem perder rapidamente o acesso a um projeto. Um sistema confiável deve, portanto, apresentar a regra antes do início do trabalho remunerado, distinguir uma suspeita de uma violação confirmada e oferecer ao profissional um canal para apresentar evidências pertinentes. Esta é uma recomendação de procedimento justo, não uma afirmação sobre direitos previstos em qualquer contrato ou lei.

Enquanto isso, os profissionais devem tratar a exigência de julgamento sem assistência como parte da especificação do trabalho. Quem acreditar que precisa de uma ferramenta aprovada pode perguntar antes de usá-la ou recusar a tarefa. Ocultar a assistência não se torna aceitável só porque o modelo escreve bem, assim como um colaborador externo proibido não se tornaria aceitável só porque a resposta estava correta.

## Especifique de onde vem o julgamento

O piloto público da Mercor explicita a especificação do serviço: uma avaliação profissional sem assistência. Quem contrata trabalho assistido precisa descrever com a mesma clareza quais ferramentas são permitidas e qual julgamento o profissional deve fornecer.

## Sources

- [404 Media: profissionais que treinavam a IA da OpenAI foram demitidos por usar IA no treinamento da própria IA](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) — A reportagem original, baseada em entrevistas com prestadores de serviço e documentos, descreve regras contra o uso de IA e relatos de remoção dos projetos. Não vimos os documentos privados nem verificamos os casos individuais de forma independente; a OpenAI não quis comentar.
- [Mercor: piloto de avaliação de modelos por especialistas de domínio](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) — O anúncio público afirma que o julgamento profissional é a medida e proíbe assistentes de IA durante a resolução, a classificação, a pontuação e a redação das justificativas. Ele estabelece o desenho declarado deste piloto, não as regras ou sua aplicação em todos os projetos da Mercor.
- [Shumailov et al.: modelos de IA entram em colapso quando treinados com dados gerados recursivamente](https://www.nature.com/articles/s41586-024-07566-y) — O artigo estuda configurações de treinamento recursivo nas quais dados gerados substituem dados de uma distribuição original. Ele não avalia os casos relatados de prestadores nem comprova danos a um modelo da OpenAI implantado.
- [Gerstgrasser et al.: o colapso de modelos é inevitável?](https://arxiv.org/abs/2404.01413) — Os experimentos distinguem substituir dados reais originais de acumular dados sintéticos junto com eles. Os resultados mostram que os efeitos dos dados sintéticos dependem do processo de geração; não certificam toda mistura de dados reais e sintéticos.