DUNIA TERUS BERGERAK.RSS
BIG CHANGE.

Edisi Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Saat pelatih AI menggunakan AI, produk yang hilang adalah penilaian manusia

> Laporan mengenai kontraktor yang dikeluarkan dari proyek karena diduga melanggar larangan penggunaan AI menyingkap masalah bisnis yang lebih luas: perusahaan perlu membedakan produksi berbantuan AI dari penilaian manusia independen yang ingin mereka beli.

By BIG CHANGE Editorial

Published: 2026-09-22T17:43:18.226Z
Updated: 2026-09-22T23:32:55.869Z
Canonical: https://bigchange.ai/blog/ai-trainers-human-judgment-independent-evaluation

![Three inspection chambers show a machine lens, a human profile alone, and a machine lens beside a human profile.](https://bigchange.ai/api/media/file/ai-trainers-human-judgment-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE. AI-assisted production, independent human judgment and disclosed assisted review can all be useful, but they provide different kinds of evidence. This conceptual apparatus shows those distinct roles; it is not a product interface, detector or claim that synthetic feedback is always harmful.

Perusahaan mempekerjakan orang untuk membandingkan jawaban model, menjelaskan kekurangannya, dan memberikan contoh pekerjaan yang lebih baik. Dalam situasi ini, jawaban yang tampak rapi hanya sebagian dari hasil yang dipesan. Pembeli mungkin membayar penilaian yang tidak berasal dari model yang sedang diuji.

[404 Media melaporkan](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) bahwa tiga kontraktor yang bekerja pada proyek terkait OpenAI menjelaskan adanya aturan yang melarang penggunaan AI, dan dua di antaranya mengatakan kontraktor telah dikeluarkan dari proyek karena melakukannya. Mercor, yang menyediakan dua orang yang diwawancarai, mengatakan kepada publikasi itu bahwa kontraknya melarang penggunaan model bahasa besar untuk menyelesaikan pekerjaan proyek dan pelanggaran yang terkonfirmasi mengakibatkan pemutusan akses. OpenAI menolak berkomentar. Kami belum melihat dokumen proyek privat atau memverifikasi kasus perorangan secara independen.

Pertanyaan yang relevan melampaui satu platform kontraktor: ketika perusahaan meminta pemeriksaan manusia yang independen, bagaimana perusahaan membedakan pekerjaan tersebut dari tugas yang boleh dibantu AI?

## Perubahan besar

- **Yang berubah:** Sengketa kontraktor yang dilaporkan menyingkap konflik mengenai apa yang seharusnya dihasilkan pekerjaan pelatihan AI: jawaban yang telah diselesaikan atau penilaian manusia yang independen.
- **Mengapa ini penting:** Program percontohan publik Mercor menjadikan penilaian profesional sebagai ukuran. Mengganti pemeringkatan tersebut dengan hasil buatan model mengubah apa yang diukur oleh evaluasi itu, sekalipun kirimannya ditulis dengan baik.
- **Yang perlu dipantau:** Keputusan penting bagi pembeli jasa evaluasi adalah tahap mana yang memerlukan penilaian tanpa bantuan AI. Ketentuan itu harus tercantum dalam instruksi tugas agar pekerja dapat melihatnya sebelum menerima pekerjaan.

## Independensi bisa menjadi hal yang dibeli

Asisten AI berguna ketika tugasnya adalah menghasilkan draf pertama dengan cepat. Asisten menjadi masalah ketika tugasnya menyediakan jawaban rujukan atau perbandingan independen, tetapi perbedaan itu tidak diungkapkan.

Daftar publik Mercor untuk [pilot evaluasi model domain bisnis](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) menjelaskan persyaratannya dengan sangat jelas. Para ahli menyelesaikan tugas profesional, memeringkat lima upaya model, memberi skor, dan menulis alasan berbasis bukti. Daftar itu menyatakan tidak ada rubrik atau jawaban baku karena penilaian profesional adalah ukuran yang dinilai. Penggunaan asisten AI dilarang saat menyelesaikan tugas, memeringkat, memberi skor, dan menulis alasan.

Ketentuan tersebut menjelaskan satu program percontohan. Perbandingannya bergantung pada penilaian profesional itu sendiri; menyerahkan penilaian tersebut kepada model akan mengubah eksperimennya.

## Umpan balik sintetis tidak otomatis merupakan data buruk

Kita mungkin tergoda mengaitkan setiap respons pelatihan yang dihasilkan AI dengan “keruntuhan model”. Kesimpulan itu akan melampaui bukti yang tersedia di sini. [Penelitian yang diterbitkan di Nature](https://www.nature.com/articles/s41586-024-07566-y) menelaah proses pelatihan rekursif ketika data buatan menggantikan data yang diambil dari distribusi awal. Dalam eksperimen tersebut, model berturut-turut kehilangan informasi tentang distribusi yang mendasarinya. Rancangan itu bukan penelitian terhadap pekerjaan kontraktor yang dilaporkan, dan makalah tersebut tidak dapat memberi tahu kita apakah penilaian tertentu memengaruhi model OpenAI yang telah diterapkan.

Studi lain tentang [keruntuhan model](https://arxiv.org/abs/2404.01413) menunjukkan mengapa pembedaan ini penting. Para penulis menemukan keruntuhan ketika data sintetis dari setiap generasi menggantikan data nyata asli, tetapi dalam eksperimen mereka berhasil menghindarinya ketika data nyata tetap digunakan dan data sintetis dari generasi berikutnya ditambahkan di sampingnya. Hasil tersebut tidak membuktikan bahwa setiap campuran aman. Namun, hasil itu menunjukkan bahwa “dihasilkan AI” saja bukan diagnosis yang memadai; asal-usul data, pemilihan, dan proses pelatihan juga penting.

## Jelaskan alur kerja yang diizinkan secara tegas

Instruksi kerja perlu menyebutkan alat yang diizinkan, tahap yang membutuhkan penilaian tanpa bantuan AI, dan cara pekerja harus mengungkapkan bantuan yang digunakan. Program percontohan Mercor menetapkan independensi saat menyelesaikan tugas maupun mengevaluasinya. Pembeli yang memesan pekerjaan berbantuan AI perlu menjelaskan penilaian profesional apa yang tetap diharapkan dari pekerja.

Proses peninjauan juga memerlukan kehati-hatian. Laporan 404 Media menyebutkan bahwa satu dokumen internal memperingatkan peninjau agar tidak menggunakan alat deteksi AI dan menyebut alat tersebut tidak andal. Hal itu sejalan dengan prinsip manajemen dasar: tanda baca, kecepatan, atau gaya bahasa yang rapi bukan bukti bahwa seseorang menggunakan model. Peninjau dapat memeriksa apakah alasan yang diberikan merujuk pada bahan sumber, meminta pekerja menjelaskan keputusan, membandingkan kiriman berulang, dan menyelidiki catatan alat yang dikumpulkan proyek secara sah. Jangan biarkan satu petunjuk gaya saja menentukan nasib pekerja.

## Pekerja membutuhkan aturan yang bisa dipersoalkan, bukan permainan tebak-tebakan

Kontraktor independen dapat kehilangan akses proyek dengan cepat. Karena itu, sistem yang kredibel perlu menampilkan aturan sebelum pekerjaan berbayar dimulai, membedakan dugaan pelanggaran dari pelanggaran yang terkonfirmasi, dan menyediakan jalur bagi pekerja untuk menjelaskan bukti yang relevan. Ini adalah rekomendasi untuk proses yang adil, bukan klaim mengenai hak berdasarkan kontrak atau hukum tertentu.

Sementara itu, pekerja perlu memperlakukan kewajiban memberikan penilaian tanpa bantuan AI sebagai bagian dari spesifikasi produk. Siapa pun yang meyakini bahwa alat yang telah disetujui diperlukan dapat bertanya sebelum menggunakannya atau menolak tugas tersebut. Bantuan yang disembunyikan tidak menjadi dapat diterima hanya karena model menulis dengan baik, sebagaimana kolaborator luar yang dilarang tidak menjadi dapat diterima hanya karena jawabannya benar.

## Tentukan sumber penilaian

Program percontohan publik Mercor menyatakan spesifikasi produknya dengan jelas: penilaian profesional tanpa bantuan AI. Pembeli yang memesan pekerjaan berbantuan AI juga memerlukan uraian yang sama jelasnya tentang alat yang diizinkan dan penilaian yang harus diberikan pekerja.

## Sources

- [404 Media: Orang yang melatih AI OpenAI dikeluarkan karena menggunakan AI untuk melatih AI tersebut](https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai) — Laporan asli berdasarkan wawancara dan dokumen kontraktor menjelaskan aturan yang melarang penggunaan AI serta laporan tentang pekerja yang dikeluarkan dari proyek. Kami belum melihat dokumen privat atau memverifikasi kasus perorangan secara independen; OpenAI menolak berkomentar.
- [Mercor: Pakar Domain Bisnis — Program Percontohan Evaluasi Model AI](https://work.mercor.com/jobs/list_AAABoBbYguDNWJDFwNRJ6Z0n/business-domain-expert-ai-model-evaluation-pilot-admin-marketing-hr-accounting) — Daftar publik menyatakan bahwa penilaian profesional adalah ukuran dan melarang asisten AI saat menyelesaikan tugas, memeringkat, memberi skor, dan menulis alasan. Sumber ini menetapkan rancangan yang dinyatakan untuk program percontohan tersebut, bukan aturan atau penegakan di setiap proyek Mercor.
- [Shumailov dkk.: Model AI mengalami keruntuhan saat dilatih dengan data yang dihasilkan secara rekursif](https://www.nature.com/articles/s41586-024-07566-y) — Makalah ini meneliti pengaturan pelatihan rekursif ketika data buatan menggantikan data dari distribusi awal. Makalah ini tidak mengevaluasi kasus kontraktor yang dilaporkan atau membuktikan adanya kerugian pada model OpenAI yang telah diterapkan.
- [Gerstgrasser dkk.: Apakah Keruntuhan Model Tak Terhindarkan?](https://arxiv.org/abs/2404.01413) — Eksperimen ini membedakan penggantian data nyata asli dari penambahan data sintetis di sampingnya. Hasilnya menunjukkan bahwa dampak data sintetis bergantung pada proses pengolahan data; hasil tersebut tidak menjamin keamanan setiap campuran data nyata dan sintetis.