DIE WELT BLEIBT NICHT STEHEN.RSS
BIG CHANGE.

Markdown-Ausgabe

AI-translated from English; not yet reviewed by a fluent editor.

# Wenn KI-Trainer KI nutzen, fehlt das menschliche Urteilsvermögen

> Berichte über den Abzug von Auftragnehmern wegen untersagter KI-Nutzung machen ein größeres Geschäftsproblem sichtbar: Unternehmen müssen zwischen KI-gestützter Produktion und dem unabhängigen menschlichen Urteil unterscheiden, für das sie bezahlen wollen.

By BIG CHANGE Editorial

Published: 2026-09-22T17:43:18.226Z
Updated: 2026-09-22T23:32:55.869Z
Canonical: https://bigchange.ai/blog/ai-trainers-human-judgment-independent-evaluation

![Three inspection chambers show a machine lens, a human profile alone, and a machine lens beside a human profile.](https://bigchange.ai/api/media/file/ai-trainers-human-judgment-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE. AI-assisted production, independent human judgment and disclosed assisted review can all be useful, but they provide different kinds of evidence. This conceptual apparatus shows those distinct roles; it is not a product interface, detector or claim that synthetic feedback is always harmful.

Unternehmen beauftragen Menschen damit, Modellantworten zu vergleichen, Fehler zu erklären und Beispiele für bessere Arbeit zu liefern. Bei solchen Aufgaben ist eine ausgefeilte Antwort nur ein Teil des Auftrags. Der Auftraggeber bezahlt möglicherweise für ein Urteil, das nicht von dem Modell stammt, das gerade geprüft wird.

[404 Media berichtet](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai), dass drei Auftragnehmer an OpenAI-bezogenen Projekten Regeln beschrieben, die den Einsatz von KI untersagten; zwei von ihnen gaben an, deswegen vom Projekt abgezogen worden zu sein. Mercor, das zwei der Befragten gestellt hatte, erklärte der Publikation, dass seine Verträge den Einsatz großer Sprachmodelle zur Erledigung von Projektarbeit untersagten und bestätigte Verstöße zum Ausschluss führten. OpenAI wollte sich nicht äußern. Die privaten Projektunterlagen liegen uns nicht vor; die einzelnen Fälle haben wir nicht unabhängig geprüft.

Die entscheidende Frage geht über eine einzelne Auftragnehmerplattform hinaus: Wie sollte ein Unternehmen unabhängige menschliche Prüfung von Aufgaben trennen, bei denen KI-Unterstützung willkommen ist?

## Die große Veränderung

- **Was sich geändert hat:** Der berichtete Streit um Auftragnehmer macht einen Konflikt darüber sichtbar, was KI-Trainingsarbeit leisten soll: fertige Antworten oder eine unabhängige menschliche Bewertung.
- **Warum das wichtig ist:** Im öffentlich ausgeschriebenen Pilotprojekt von Mercor bildet das fachliche Urteil die Messgröße. Werden KI-generierte Bewertungen eingesetzt, ändert sich, was diese Evaluation misst – selbst wenn die Einreichung gut formuliert ist.
- **Was zu beachten ist:** Für Auftraggeber von Evaluierungen ist entscheidend, in welchen Phasen ein Urteil ohne KI-Unterstützung erforderlich ist. Diese Vorgabe gehört in die Aufgabenbeschreibung, damit Arbeitende sie vor der Annahme des Auftrags sehen.

## Unabhängigkeit kann das sein, wofür bezahlt wird

Ein KI-Assistent ist nützlich, wenn eine Aufgabe darin besteht, schnell einen ersten Entwurf zu erstellen. Problematisch wird es, wenn eine Referenzantwort oder ein unabhängiger Vergleich verlangt und dieser Unterschied verschleiert wird.

Die öffentliche Ausschreibung von Mercors Pilotprojekt zur [Evaluation von KI-Modellen durch Fachleute aus der Wirtschaft](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) formuliert die Anforderung ungewöhnlich deutlich. Fachleute lösen eine berufliche Aufgabe, ordnen fünf Modellantworten, bewerten sie und verfassen beleggestützte Begründungen. Laut Ausschreibung gibt es weder ein Bewertungsraster noch eine Musterlösung, weil das fachliche Urteil selbst die Messgröße ist. KI-Assistenten sind beim Lösen, Einordnen, Bewerten und Verfassen der Begründung untersagt.

Diese Bedingungen beschreiben ein einzelnes Pilotprojekt. Der Vergleich hängt vom eigenen Urteil einer Fachperson ab; überträgt man diese Beurteilung an ein Modell, verändert man das Experiment.

## Synthetisches Feedback ist nicht automatisch schlechte Datenqualität

Es liegt nahe, jede KI-generierte Trainingsantwort mit einem „Modellkollaps“ in Verbindung zu bringen. Das würde über die hier verfügbare Beweislage hinausgehen. [Eine in Nature veröffentlichte Studie](https://www.nature.com/articles/s41586-024-07566-y) untersuchte rekursive Trainingsverfahren, bei denen generierte Daten die aus einer ursprünglichen Verteilung stammenden Daten ersetzen. In diesen Experimenten verloren aufeinanderfolgende Modelle Informationen über die zugrunde liegende Verteilung. Die Studie befasst sich nicht mit der berichteten Auftragnehmerarbeit und kann nicht klären, ob eine bestimmte Bewertung ein eingesetztes OpenAI-Modell beeinflusst hat.

Eine weitere [Studie zum Modellkollaps](https://arxiv.org/abs/2404.01413) zeigt, warum diese Unterscheidung wichtig ist. Ihre Autoren beobachteten einen Kollaps, wenn synthetische Daten jeder Generation die ursprünglichen realen Daten ersetzten. In ihren Experimenten blieb er dagegen aus, wenn reale Daten erhalten blieben und im Verlauf weitere synthetische Daten hinzukamen. Das Ergebnis belegt nicht, dass jede Mischung sicher ist. Es zeigt jedoch, dass „KI-generiert“ allein keine ausreichende Diagnose darstellt; Herkunft, Auswahl und Trainingsverfahren sind entscheidend.

## Den erlaubten Arbeitsablauf ausdrücklich festlegen

Eine Aufgabenbeschreibung sollte die erlaubten Werkzeuge nennen, Phasen kennzeichnen, in denen ein Urteil ohne KI-Unterstützung erforderlich ist, und angeben, wie Arbeitende den Einsatz von Hilfsmitteln offenlegen sollen. Mercors Pilotprojekt verlangt Unabhängigkeit beim Lösen und Bewerten. Auftraggeber, die KI-gestützte Arbeit beauftragen, sollten beschreiben, welches fachliche Urteil die beauftragte Person weiterhin selbst liefern muss.

Auch bei der Prüfung ist Sorgfalt geboten. Dem Bericht von 404 Media zufolge warnte ein internes Dokument davor, KI-Erkennungstools einzusetzen, und bezeichnete sie als unzuverlässig. Das entspricht einem grundlegenden Managementprinzip: Zeichensetzung, Arbeitstempo oder ausgefeilte Formulierungen beweisen nicht, dass jemand ein Modell verwendet hat. Prüfer können untersuchen, ob eine Begründung auf das Quellenmaterial verweist, eine Person bitten, eine Entscheidung zu erläutern, wiederholte Einreichungen vergleichen und rechtmäßig erfasste Werkzeugprotokolle prüfen. Kein einzelner stilistischer Hinweis sollte über den Fall eines Arbeitenden entscheiden.

## Arbeitende brauchen eine anfechtbare Regel statt eines Ratespiels

Unabhängige Auftragnehmer können schnell den Zugang zu einem Projekt verlieren. Ein glaubwürdiges Verfahren sollte die Regel daher vor Beginn bezahlter Arbeit offenlegen, einen vermuteten Verstoß von einem bestätigten unterscheiden und Arbeitenden einen Weg bieten, relevante Belege zu erläutern. Das ist eine Empfehlung für ein faires Verfahren, keine Aussage zu Rechten aus einem Vertrag oder nach geltendem Recht.

Arbeitende sollten eine Vorgabe, ein Urteil ohne KI-Unterstützung abzugeben, als Teil der Auftragsbeschreibung behandeln. Wer ein genehmigtes Werkzeug für nötig hält, kann vor dessen Einsatz nachfragen oder den Auftrag ablehnen. Verheimlichte Unterstützung wird nicht dadurch zulässig, dass das Modell gut formuliert – so wenig, wie ein verbotener externer Helfer zulässig wäre, nur weil die Antwort stimmt.

## Die Quelle des Urteils festlegen

Mercors öffentliches Pilotprojekt beschreibt die Auftragsanforderung eindeutig: eine fachliche Einschätzung ohne KI-Unterstützung. Auftraggeber, die KI-gestützte Arbeit beauftragen, brauchen eine ebenso klare Beschreibung, welche Werkzeuge erlaubt sind und welches Urteil die beauftragte Person selbst liefern muss.

## Sources

- [404 Media: Personen, die OpenAIs KI trainieren, wegen eigener KI-Nutzung entlassen](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) — Der Originalbericht stützt sich auf Gespräche mit Auftragnehmern und Dokumente. Er beschreibt Regeln gegen den KI-Einsatz und berichtete Abzüge von Projekten. Uns liegen die privaten Dokumente nicht vor; die einzelnen Fälle haben wir nicht unabhängig geprüft. OpenAI wollte sich nicht äußern.
- [Mercor: Fachleute aus der Wirtschaft – Pilotprojekt zur Bewertung von KI-Modellen](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) — In der öffentlichen Ausschreibung heißt es, dass das fachliche Urteil die Messgröße bildet. KI-Assistenten sind beim Lösen, Einordnen, Bewerten und Verfassen der Begründung untersagt. Belegt ist damit die erklärte Konzeption dieses Pilotprojekts, nicht die Regeln oder ihre Durchsetzung bei allen Mercor-Projekten.
- [Shumailov et al.: KI-Modelle kollabieren, wenn sie mit rekursiv erzeugten Daten trainiert werden](https://www.nature.com/articles/s41586-024-07566-y) — Die Studie untersucht rekursive Trainingsverfahren, bei denen generierte Daten Material aus einer ursprünglichen Verteilung ersetzen. Sie bewertet weder die berichteten Auftragnehmerfälle noch belegt sie einen Schaden an einem eingesetzten OpenAI-Modell.
- [Gerstgrasser et al.: Ist der Modellkollaps unvermeidlich?](https://arxiv.org/abs/2404.01413) — Die Experimente unterscheiden zwischen dem Ersetzen ursprünglicher realer Daten und dem Hinzufügen synthetischer Daten bei gleichzeitigem Erhalt der Originaldaten. Die Ergebnisse zeigen, dass die Auswirkungen synthetischer Daten vom Datenverfahren abhängen; sie bescheinigen nicht jeder Mischung aus realen und synthetischen Daten Sicherheit.