As empresas contratam pessoas para comparar respostas de modelos, explicar o que está errado e dar exemplos de trabalho melhor. Nesse contexto, uma resposta bem escrita é apenas parte do que se adquire. O cliente pode estar a pagar por uma avaliação que não foi feita pelo modelo em análise.
A 404 Media relata que três trabalhadores contratados para projetos relacionados com a OpenAI descreveram regras que proibiam a utilização de IA e que dois afirmaram ter sido afastados por esse motivo. A Mercor, que forneceu duas das pessoas entrevistadas, disse à publicação que os seus contratos proíbem a utilização de grandes modelos de linguagem para concluir o trabalho dos projetos e que as violações confirmadas levam ao afastamento. A OpenAI recusou comentar. Não consultámos os documentos privados dos projetos nem verificámos de forma independente os casos individuais.
A questão útil vai além de uma plataforma de contratação: quando uma empresa pede uma avaliação humana independente, como deve distinguir esse trabalho das tarefas em que a assistência de IA é bem-vinda?
A grande mudança
- O que mudou: A disputa relatada entre trabalhadores contratados expõe um conflito sobre o que o trabalho de treino de IA deve fornecer: respostas concluídas ou uma avaliação humana independente.
- Porque é importante: O projeto-piloto público da Mercor utiliza a avaliação profissional como medida. Substituir a classificação humana por classificações geradas por modelos altera aquilo que está a ser avaliado, mesmo que o trabalho apresentado esteja bem escrito.
- O que acompanhar: Para quem compra serviços de avaliação, a decisão mais importante é determinar que etapas exigem uma avaliação sem assistência de IA. Essa condição deve constar das instruções da tarefa, para que os trabalhadores a possam consultar antes de aceitar o trabalho.
A avaliação independente pode ser aquilo que o cliente está a comprar
Um assistente de IA é útil quando a tarefa consiste em produzir rapidamente um primeiro rascunho. Torna-se problemático quando a tarefa exige uma resposta de referência ou uma comparação independente e essa distinção é ocultada.
O anúncio público da Mercor para um projeto-piloto de avaliação de modelos de IA por especialistas de setores profissionais torna o requisito invulgarmente claro. Os especialistas resolvem uma tarefa profissional, classificam cinco respostas de modelos, atribuem-lhes pontuações e escrevem justificações fundamentadas em provas. O anúncio indica que não são fornecidos critérios de avaliação nem uma resposta de referência, porque a avaliação profissional é a medida pretendida. Proíbe assistentes de IA durante a resolução, classificação, pontuação e redação das justificações.
Estas condições descrevem um único projeto-piloto. A comparação depende da avaliação do próprio profissional; delegá-la num modelo altera a experiência.
O feedback sintético não é automaticamente mau dado
É tentador associar qualquer resposta de treino gerada por IA ao «colapso dos modelos». Isso iria além das provas disponíveis neste caso. Um estudo publicado na Nature analisou regimes de treino recursivo em que dados gerados substituem os dados provenientes de uma distribuição original. Nessas experiências, os modelos sucessivos perderam informação sobre a distribuição subjacente. Essa configuração não é um estudo do trabalho dos contratados aqui referido e o artigo não permite concluir se alguma avaliação específica afetou um modelo da OpenAI já implementado.
Outro estudo sobre o colapso dos modelos mostra por que razão esta distinção importa. Os autores observaram colapso quando os dados sintéticos de cada geração substituíam os dados reais originais, mas não nas experiências em que os dados reais se mantinham e os dados sintéticos de gerações sucessivas se acumulavam com eles. O resultado não prova que todas as misturas sejam seguras. Mostra, isso sim, que a expressão «gerado por IA» não basta para identificar o problema: a proveniência, a seleção e o processo de treino são importantes.
Especifique claramente o fluxo de trabalho permitido
Um briefing deve identificar as ferramentas permitidas, indicar quais as etapas que exigem uma avaliação sem assistência de IA e explicar como os trabalhadores devem declarar a assistência recebida. O projeto-piloto da Mercor exige independência na resolução e na avaliação. Os clientes que encomendam trabalho assistido devem descrever a avaliação profissional que ainda esperam que o trabalhador forneça.
A revisão exige o mesmo cuidado. A reportagem da 404 Media diz que um documento interno alertava os revisores para não utilizarem ferramentas de deteção de IA e descrevia-as como pouco fiáveis. Isso é coerente com um princípio básico de gestão: a pontuação, a rapidez ou uma formulação polida não provam que alguém tenha utilizado um modelo. Um revisor pode verificar se a justificação cita o material de origem, pedir ao trabalhador que explique uma decisão, comparar envios repetidos e analisar registos de ferramentas que o projeto recolha legalmente. Nenhum indício estilístico isolado deve determinar o caso de um trabalhador.
Os trabalhadores precisam de uma regra passível de contestação, não de um jogo de adivinhas
Os trabalhadores independentes podem perder rapidamente o acesso a um projeto. Por isso, um sistema credível deve apresentar a regra antes do início do trabalho pago, distinguir uma suspeita de violação de uma violação confirmada e permitir que o trabalhador apresente provas relevantes. Trata-se de uma recomendação para um processo justo, não de uma afirmação sobre direitos previstos num contrato ou na lei.
Por seu lado, os trabalhadores devem tratar a exigência de avaliação sem assistência como parte das especificações do serviço. Quem considerar necessário utilizar uma ferramenta aprovada pode perguntar antes de a usar ou recusar a tarefa. A assistência ocultada não se torna aceitável só porque o modelo escreve bem, tal como a colaboração externa proibida não se tornaria aceitável apenas porque a resposta estava correta.
Especifique a origem da avaliação
O projeto-piloto público da Mercor explicita a especificação do serviço: uma avaliação profissional sem assistência de IA. Os clientes que encomendam trabalho assistido precisam de uma descrição igualmente clara das ferramentas permitidas e da avaliação que o trabalhador tem de fornecer.



