Empresas contratam pessoas para comparar respostas de modelos, explicar o que está errado e dar exemplos de trabalhos melhores. Nesse contexto, uma resposta bem escrita é apenas parte do serviço. O comprador pode estar pagando por um julgamento que não veio do modelo avaliado.
A 404 Media relata que três prestadores de serviço envolvidos em projetos relacionados à OpenAI descreveram regras contra o uso de IA, e dois disseram que prestadores foram removidos do projeto por esse motivo. A Mercor, que forneceu dois dos entrevistados, disse à publicação que seus contratos proíbem o uso de modelos de linguagem grandes para concluir o trabalho do projeto e que violações confirmadas levam à remoção. A OpenAI não quis comentar. Não vimos os documentos privados do projeto nem verificamos de forma independente casos individuais.
A questão útil vai além de uma plataforma de contratação: quando uma empresa pede uma avaliação humana independente, como deve separar esse trabalho das tarefas em que a assistência de IA é bem-vinda?
A grande mudança
- O que mudou: A disputa relatada entre prestadores de serviço expõe um conflito sobre o que o trabalho de treinamento de IA deve fornecer: respostas concluídas ou uma avaliação humana independente.
- Por que isso importa: No piloto público da Mercor, o julgamento profissional é a medida. Substituir classificações humanas por classificações geradas por um modelo altera o que essa avaliação mede, mesmo que o resultado esteja bem escrito.
- O que observar: Para quem compra avaliações, a escolha decisiva é quais etapas exigem julgamento sem assistência. Essa condição deve constar nas instruções da tarefa, visíveis aos profissionais antes de aceitarem o trabalho.
A independência pode ser o produto contratado
Um assistente de IA é útil quando a tarefa é produzir rapidamente um primeiro rascunho. Ele se torna um problema quando a tarefa exige uma resposta de referência ou uma comparação independente e essa distinção é ocultada.
O anúncio público da Mercor para um piloto de avaliação de modelos por especialistas de domínio deixa a exigência especialmente clara. Especialistas resolvem uma tarefa profissional, classificam cinco tentativas de modelos, dão notas e escrevem justificativas baseadas em evidências. O anúncio diz que não há rubrica nem resposta ideal porque o julgamento profissional é a medida. Ele proíbe assistentes de IA durante a resolução, a classificação, a pontuação e a redação das justificativas.
Esses termos descrevem um único piloto. A comparação depende da avaliação do próprio profissional; delegá-la a um modelo altera o experimento.
Feedback sintético não é automaticamente um dado ruim
É tentador relacionar qualquer resposta de treinamento gerada por IA ao “colapso de modelos”. Isso iria além das evidências disponíveis neste caso. Uma pesquisa publicada na Nature examinou regimes de treinamento recursivo nos quais dados gerados substituem dados retirados de uma distribuição original. Nesses experimentos, modelos sucessivos perderam informações sobre a distribuição subjacente. Essa configuração não estuda o trabalho relatado dos prestadores e o artigo não permite saber se alguma avaliação específica afetou um modelo da OpenAI em produção.
Outro estudo sobre colapso de modelos mostra por que essa distinção importa. Os autores observaram colapso quando os dados sintéticos de cada geração substituíam os dados reais originais, mas não nos experimentos em que os dados reais eram mantidos e os sintéticos sucessivos eram acumulados junto deles. O resultado não prova que toda mistura seja segura. Mostra, sim, que a expressão “gerado por IA” não basta para diagnosticar o problema; a procedência, a seleção e o processo de treinamento também importam.
Deixe explícito o fluxo de trabalho permitido
O briefing deve nomear as ferramentas permitidas, identificar as etapas que exigem julgamento sem assistência e dizer como os profissionais devem declarar o uso de ajuda. O piloto da Mercor especifica independência tanto na resolução quanto na avaliação. Quem contrata trabalho assistido deve descrever que julgamento profissional ainda espera que o trabalhador forneça.
A revisão exige o mesmo cuidado. A reportagem da 404 Media diz que um documento interno alertava os revisores para não usar ferramentas de detecção de IA e as descrevia como pouco confiáveis. Isso condiz com um princípio básico de gestão: pontuação, rapidez ou linguagem bem polida não provam que alguém usou um modelo. Um revisor pode conferir se a justificativa cita os materiais de origem, pedir ao profissional que explique uma decisão, comparar envios repetidos e investigar registros de ferramentas que o projeto colete legalmente. Nenhum indício estilístico isolado deve decidir o caso de um trabalhador.
Profissionais precisam de uma regra contestável, não de um jogo de adivinhação
Prestadores independentes podem perder rapidamente o acesso a um projeto. Um sistema confiável deve, portanto, apresentar a regra antes do início do trabalho remunerado, distinguir uma suspeita de uma violação confirmada e oferecer ao profissional um canal para apresentar evidências pertinentes. Esta é uma recomendação de procedimento justo, não uma afirmação sobre direitos previstos em qualquer contrato ou lei.
Enquanto isso, os profissionais devem tratar a exigência de julgamento sem assistência como parte da especificação do trabalho. Quem acreditar que precisa de uma ferramenta aprovada pode perguntar antes de usá-la ou recusar a tarefa. Ocultar a assistência não se torna aceitável só porque o modelo escreve bem, assim como um colaborador externo proibido não se tornaria aceitável só porque a resposta estava correta.
Especifique de onde vem o julgamento
O piloto público da Mercor explicita a especificação do serviço: uma avaliação profissional sem assistência. Quem contrata trabalho assistido precisa descrever com a mesma clareza quais ferramentas são permitidas e qual julgamento o profissional deve fornecer.



