Les entreprises embauchent des personnes pour comparer les réponses de modèles, expliquer ce qui ne va pas et fournir des exemples de meilleur travail. Dans ce contexte, une réponse bien rédigée ne représente qu’une partie de la prestation. Le client peut payer pour un jugement qui n’émane pas du modèle évalué.

404 Media rapporte que trois prestataires travaillant sur des projets liés à OpenAI ont décrit des règles interdisant l’usage de l’IA, et que deux d’entre eux ont déclaré avoir été retirés du projet pour cette raison. Mercor, qui avait fourni deux des personnes interrogées, a indiqué au média que ses contrats interdisent d’utiliser de grands modèles de langage pour effectuer le travail demandé et que toute violation confirmée entraîne le retrait du projet. OpenAI a refusé de commenter. Nous n’avons pas vu les documents privés du projet et n’avons pas vérifié les cas individuels de manière indépendante.

La question utile dépasse une seule plateforme de prestataires : lorsqu’une entreprise demande une vérification humaine indépendante, comment distinguer cette tâche de celles où l’assistance de l’IA est bienvenue ?

Le grand changement

  • Ce qui change : Le différend rapporté entre des prestataires met au jour un conflit sur la nature du travail demandé pour entraîner l’IA : produire des réponses terminées ou fournir une évaluation humaine indépendante.
  • Pourquoi c’est important : Le projet pilote public de Mercor fait du jugement professionnel la mesure évaluée. Remplacer les classements par des résultats générés par un modèle change ce que l’évaluation mesure, même si la réponse est bien rédigée.
  • À surveiller : Pour les acheteurs de services d’évaluation, la décision importante est de déterminer quelles étapes exigent un jugement sans assistance. Ce choix doit figurer dans les instructions de la tâche, afin que les personnes puissent le consulter avant de l’accepter.

Le jugement indépendant peut être le produit acheté

Un assistant d’IA est utile lorsque la tâche consiste à produire rapidement une première version. Il pose problème lorsque le travail consiste à fournir une réponse de référence ou une comparaison indépendante et que cette distinction est dissimulée.

La page publique de Mercor consacrée au projet pilote d’évaluation de modèles par des experts métier rend l’exigence particulièrement claire. Les experts résolvent une tâche professionnelle, classent cinq tentatives de modèles, les notent et rédigent des justifications étayées. La page précise qu’aucun barème ni réponse de référence n’est fourni, car c’est le jugement professionnel qui est mesuré. Elle interdit les assistants d’IA pendant la résolution, le classement, la notation et la rédaction des justifications.

Ces conditions décrivent un projet pilote précis. La comparaison repose sur l’évaluation propre à chaque professionnel ; déléguer cette évaluation à un modèle change l’expérience.

Les retours synthétiques ne sont pas automatiquement de mauvaises données

Il peut être tentant d’associer toute réponse d’entraînement générée par l’IA à « l’effondrement des modèles ». Ce serait aller au-delà des éléments disponibles ici. Une étude publiée dans Nature a examiné des régimes d’entraînement récursif dans lesquels des données générées remplacent celles issues d’une distribution d’origine. Dans ces expériences, les modèles successifs ont perdu de l’information sur la distribution sous-jacente. Ce protocole n’étudie pas le travail rapporté des prestataires et l’article ne permet pas de savoir si une évaluation particulière a influencé un modèle OpenAI déployé.

Une autre étude sur l’effondrement des modèles montre pourquoi la distinction compte. Ses auteurs ont observé un effondrement lorsque les données synthétiques de chaque génération remplaçaient les données réelles d’origine, mais pas dans leurs expériences lorsque les données réelles étaient conservées et que les données synthétiques successives s’y ajoutaient. Ce résultat ne prouve pas que tous les mélanges sont sans risque. Il montre que le seul fait qu’une donnée soit « générée par l’IA » ne suffit pas à établir un problème ; la provenance, la sélection et le processus d’entraînement comptent.

Définir clairement le flux de travail autorisé

Un cahier des charges doit préciser les outils autorisés, indiquer les étapes exigeant un jugement sans assistance et expliquer comment signaler l’aide reçue. Le projet pilote de Mercor exige l’indépendance pour la résolution et l’évaluation. Les acheteurs qui commandent un travail assisté doivent décrire le jugement professionnel qu’ils attendent encore de la personne.

La vérification demande la même prudence. Selon l’article de 404 Media, un document interne mettait en garde les évaluateurs contre les outils de détection de l’IA et les qualifiait de peu fiables. Cela rejoint un principe élémentaire de gestion : la ponctuation, la rapidité ou une formulation soignée ne prouvent pas qu’une personne a utilisé un modèle. Un évaluateur peut vérifier si la justification cite les documents sources, demander à la personne d’expliquer une décision, comparer des soumissions répétées et examiner les journaux d’outils que le projet collecte légalement. Aucun indice stylistique isolé ne devrait trancher le cas d’un travailleur.

Les travailleurs ont besoin d’une règle contestable, pas d’un jeu de devinettes

Les prestataires indépendants peuvent perdre rapidement l’accès à un projet. Un système crédible devrait donc rendre la règle visible avant le début du travail rémunéré, distinguer une violation présumée d’une violation confirmée et permettre à la personne de présenter les éléments pertinents. Il s’agit d’une recommandation de procédure équitable, et non d’une affirmation concernant des droits au titre d’un contrat ou d’une loi.

De leur côté, les travailleurs devraient considérer toute exigence de jugement sans assistance comme une partie du cahier des charges. Une personne qui estime qu’un outil approuvé est nécessaire peut demander avant de l’utiliser, ou refuser la tâche. Dissimuler une assistance ne devient pas acceptable parce que le modèle écrit bien, pas plus qu’un collaborateur extérieur interdit ne le deviendrait parce que sa réponse est correcte.

Préciser l’origine du jugement

Le projet pilote public de Mercor explicite le cahier des charges : une évaluation professionnelle sans assistance. Les acheteurs qui commandent un travail assisté doivent aussi décrire clairement les outils autorisés et le jugement que la personne doit fournir.