Las empresas contratan a personas para comparar respuestas de modelos, explicar qué está mal y ofrecer ejemplos de un trabajo mejor. En ese contexto, una respuesta pulida es solo una parte del encargo. Puede que el cliente esté pagando por una valoración independiente, no por un juicio del modelo sometido a prueba.
404 Media informa de que tres contratistas que trabajaban en proyectos relacionados con OpenAI describieron reglas que prohibían usar IA, y que dos dijeron que los habían apartado del proyecto por hacerlo. Mercor, que había contratado a dos de las personas entrevistadas, dijo a la publicación que sus contratos prohíben usar modelos de lenguaje grandes para completar el trabajo del proyecto y que las infracciones confirmadas conllevan la expulsión. OpenAI declinó hacer comentarios. No hemos visto los documentos privados del proyecto ni verificado de forma independiente los casos particulares.
La pregunta útil va más allá de una plataforma de contratistas: cuando una empresa solicita una revisión humana independiente, ¿cómo debe distinguirla de las tareas en las que sí se permite la ayuda de la IA?
El cambio de fondo
- Qué ha cambiado: La disputa denunciada sobre el trabajo de contratistas pone de manifiesto un conflicto sobre qué debe aportar el entrenamiento de IA: respuestas completas o una evaluación humana independiente.
- Por qué importa: El piloto público de Mercor utiliza el criterio profesional como medida. Sustituir por clasificaciones generadas por un modelo cambia lo que mide la evaluación, aunque el trabajo entregado esté bien redactado.
- Qué conviene observar: Para quienes encargan evaluaciones, la decisión clave es en qué etapas se exige un juicio sin ayuda. Esa condición debe figurar en las instrucciones de la tarea para que los trabajadores puedan verla antes de aceptarla.
La independencia puede ser el producto que se compra
Un asistente de IA resulta útil cuando la tarea consiste en preparar rápidamente un primer borrador. Se convierte en un problema cuando se pide una respuesta de referencia o una comparación independiente y se oculta esa diferencia.
El anuncio público de Mercor para un piloto de evaluación de modelos en un ámbito profesional deja el requisito inusualmente claro. Los expertos resuelven una tarea profesional, clasifican cinco intentos de modelos, los puntúan y redactan justificaciones basadas en pruebas. El anuncio indica que no se proporciona una rúbrica ni una respuesta de referencia, porque lo que se mide es el criterio profesional. Prohíbe usar asistentes de IA al resolver, clasificar, puntuar y redactar las justificaciones.
Estas condiciones describen un solo programa piloto. La comparación depende de la evaluación propia de un profesional; delegarla en un modelo cambia el experimento.
Los comentarios sintéticos no son automáticamente datos malos
Es tentador relacionar cualquier respuesta de entrenamiento generada por IA con el «colapso de los modelos». En este caso, las pruebas no permiten llegar tan lejos. Una investigación publicada en Nature estudió regímenes de entrenamiento recursivo en los que los datos generados sustituyen a los datos de una distribución original. En esos experimentos, los modelos sucesivos perdieron información sobre la distribución subyacente. Esa configuración no estudia el trabajo denunciado de los contratistas, y el artículo no permite determinar si alguna evaluación concreta afectó a un modelo de OpenAI desplegado.
Otro estudio sobre el colapso de los modelos muestra por qué importa la distinción. Sus autores observaron colapso cuando los datos sintéticos de cada generación sustituían a los datos reales originales, pero lo evitaron en sus experimentos cuando los datos reales se mantuvieron y los sintéticos de las generaciones sucesivas se acumularon junto a ellos. El resultado no demuestra que todas las mezclas sean seguras. Sí demuestra que «generado por IA» no basta, por sí solo, para diagnosticar un problema: importan la procedencia, la selección y el proceso de entrenamiento.
Especificar con claridad el flujo de trabajo permitido
Las instrucciones deben indicar qué herramientas están permitidas, qué etapas requieren un juicio sin ayuda y cómo deben declarar los trabajadores la asistencia recibida. El piloto de Mercor especifica que tanto la resolución como la evaluación deben ser independientes. Quienes encarguen trabajo asistido deben describir qué criterio profesional esperan que aporte el trabajador.
La revisión requiere el mismo cuidado. El reportaje de 404 Media señala que un documento interno advertía a los revisores que no usaran herramientas de detección de IA y las describía como poco fiables. Esto concuerda con un principio básico de gestión: la puntuación, la rapidez o una redacción pulida no demuestran que alguien haya usado un modelo. Un revisor puede examinar si la justificación cita las fuentes, pedir al trabajador que explique una decisión, comparar entregas repetidas e investigar los registros de herramientas que el proyecto recopile legalmente. Ningún indicio estilístico aislado debería decidir el caso de un trabajador.
Los trabajadores necesitan una regla impugnable, no un juego de adivinanzas
Los contratistas independientes pueden perder el acceso a un proyecto rápidamente. Por eso, un sistema creíble debe comunicar la regla antes de que empiece el trabajo remunerado, distinguir una infracción sospechada de una confirmada y ofrecer al trabajador un canal para explicar las pruebas pertinentes. Esta es una recomendación de debido proceso, no una afirmación sobre derechos reconocidos por ningún contrato o ley.
Mientras tanto, los trabajadores deberían considerar que la exigencia de emitir un juicio sin ayuda forma parte de las especificaciones del encargo. Si alguien cree que necesita una herramienta autorizada, puede preguntar antes de usarla o rechazar la tarea. Ocultar la asistencia no se vuelve aceptable porque el modelo redacte bien, del mismo modo que un colaborador externo prohibido no sería admisible solo porque la respuesta fuese correcta.
Especificar de quién procede el criterio
El piloto público de Mercor deja clara la especificación del servicio: una evaluación profesional sin ayuda. Quienes encarguen trabajo asistido necesitan describir con igual claridad qué herramientas se permiten y qué criterio debe aportar el trabajador.



