AI-translated from English; not yet reviewed by a fluent editor.

# Dalam satu proyek model AI, agen mengusulkan metode, sementara peneliti membuat keputusan akhir

> Tim Atria Dawn mempelajari 769 catatan tugas dari pengembangan model mereka sendiri. Agen sering mengusulkan metode dan merevisi keluaran, sementara peserta melaporkan bahwa mereka membuat sebagian besar keputusan akhir. Temuan ini menggambarkan satu proyek.

By BIG CHANGE Editorial

Published: 2026-09-27T17:05:31.968Z
Updated: 2026-09-27T17:05:31.968Z
Canonical: https://bigchange.ai/blog/atria-dawn-ai-agents-human-research-decisions

![Conceptual charcoal illustration of an anonymous researcher in profile considering code-like marks on a desktop monitor, with one hand on a mouse.](https://bigchange.ai/api/media/file/atria-dawn-research-choice-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Tim yang mengembangkan Atria Dawn Preview menggunakan AI dalam 713 dari 739 tugas yang pesertanya memberikan jawaban jelas mengenai penggunaan AI. Dalam [studi tentang pekerjaan pengembangan mereka sendiri](https://arxiv.org/html/2609.15818v2), manusia tetap membuat keputusan akhir dalam 85,5% keputusan tercatat tentang metode atau parameter. Judul makalah menyebut “superinteligensi agenik”, tetapi catatan tugasnya menggambarkan kisah yang lebih spesifik tentang pembagian kerja tim tersebut.

Pracetak [itu dikirim pada 14 September dan direvisi pada 17 September 2026](https://arxiv.org/abs/2609.15818). Makalah itu bersumber dari 769 catatan tugas oleh 56 peserta, ditambah log agen, dalam satu proyek pengembangan model. Penulis menggambarkan catatan tersebut sebagai studi kasus penggunaan agen oleh tim mereka untuk membangun Atria Dawn Preview.

## Perubahan besar

- **Yang berubah:** Tim mencatat pembagian keputusan riset tertentu antara agen dan manusia selama proyek pengembangan model, dengan membedakan usulan dari keputusan akhir.
- **Mengapa penting:** Agen dapat menghasilkan metode dan menjalankan revisi sementara peneliti tetap memilih tujuan, menyetujui metode, dan memutuskan apakah hasil memenuhi kriteria tugas. Menghitung tindakan agen saja melewatkan perbedaan peran tersebut.
- **Yang perlu dipantau:** Ini adalah pengamatan dari pekerjaan satu tim, dengan sebagian besar bukti keputusan diberikan oleh peserta. Temuan ini tidak menetapkan bagaimana laboratorium AI lain membagi keputusan atau apakah agen dapat mengembangkan penerusnya secara otonom.

## Agen menyediakan banyak metode; manusia memilih sebagian besarnya

Pembedaan paling jelas terlihat dalam 567 keputusan tercatat mengenai metode atau parameter oleh peserta dalam peran pelaksanaan. Makalah itu melaporkan AI mengusulkan suatu opsi dalam 64,6% keputusan tersebut. Kategori tunggal terbesar, 55,4%, adalah “AI mengusulkan, manusia memilih”. Manusia membuat keputusan akhir dalam 85,5%; AI melakukannya dalam 9,2%. Keputusan yang tersisa diatribusikan pada kendala eksternal.

Pembagian itu berbeda menurut jenis pertanyaan. Manusia membuat keputusan akhir dalam 93,4% dari 603 keputusan mengenai sasaran atau cakupan, dan 81,9% dari 542 keputusan mengenai kriteria penerimaan. Usulan AI jauh lebih umum untuk metode daripada untuk sasaran. Gambar dalam makalah juga mencatat manusia memilih sasaran akhir dalam 144 dari 151 tugas yang dinilai peserta mustahil diselesaikan tanpa AI.

Persentase tersebut menggambarkan peran keputusan sebagaimana dilaporkan. Persentase itu tidak mengukur apakah setiap pilihan manusia dibuat dengan informasi yang memadai. Penulis menafsirkan pola tersebut sebagai peneliti yang mengarahkan pekerjaan, sementara agen menghasilkan opsi dalam arahan yang telah ditetapkan manusia. Studi kasus ini mendokumentasikan pelaksanaan tugas yang didelegasikan sambil mempertahankan wewenang akhir pada proyek tersebut.

## Umpan balik manusia sering mengirim agen kembali bekerja

Peserta mengingat kesulitan paling berdampak untuk tiap tugas. Di antara 588 tugas yang memiliki catatan kesulitan dan tanggapan, 447 atau 76,0% dilanjutkan dengan bantuan manusia; agen pulih sendiri dalam 135 tugas atau 23,0%. Bentuk bantuan utama adalah konteks tambahan atau persyaratan yang diperjelas (207 tugas) dan diagnosis atau perubahan metode (204 tugas). Dalam empat tugas, manusia mengambil alih pekerjaan utama.

Catatan keluaran menunjukkan pembagian serupa. Dari 627 tugas dengan disposisi keluaran utama AI yang diketahui, 354 memerlukan revisi substantif. Dalam subset yang direvisi itu, agen membuat perubahan setelah menerima umpan balik manusia pada 75,4% kasus, sementara seseorang menyunting langsung pada 19,2%. Peneliti dapat mengarahkan perubahan tanpa mengedit sendiri.

Satu ukuran log juga meningkat selama pengembangan: pada kelompok 22 peserta, median harian jumlah tindakan agen tercatat per prompt manusia naik dari 11,0 pada 7 Agustus menjadi 28,5 pada 4 September. Ukuran itu memakai jendela tujuh hari sebelumnya dan memiliki rasio sah untuk 21 atau 22 orang setiap hari. Ukuran ini menghitung aktivitas, sehingga tidak dapat membuktikan agen memperoleh wewenang atau keluarannya membaik.

## Hal yang dapat ditetapkan catatan tugas

Peserta memperkirakan apakah mereka dapat menyelesaikan bagian tugasnya sendiri tanpa AI dengan cakupan, kualitas, dan sumber daya lain yang sama. Mereka menilai 151 dari 455 tugas berbantuan AI yang selesai dengan jawaban layak pakai, atau 33,2%, mustahil dilakukan tanpa AI. Itu adalah kontrafaktual yang dilaporkan sendiri, bukan eksperimen ketika tim mengulang tugas-tugas tersebut tanpa agen. Hal itu tidak dapat membuktikan bahwa pekerjaan tersebut tidak akan pernah dicoba dalam kondisi berbeda.

Makalah tidak memberikan prosedur pemilihan 56 peserta atau 769 catatan tugas, dan tautan publiknya tidak menyediakan tanggapan tugas yang mendasari atau log agen untuk dianalisis ulang secara independen. Hasil tolok ukurnya mengevaluasi Atria Dawn Preview sebagai model. Hasil tersebut tidak menunjukkan sistem AI secara otonom memperbaiki penerusnya. Bagi tim yang menentukan pekerjaan apa yang didelegasikan, batas yang dilaporkan bersifat spesifik: agen kerap mengusulkan dan merevisi pekerjaan dalam proyek ini, sementara peserta melaporkan tetap memegang sebagian besar keputusan mengenai sasaran, metode, dan kriteria penerimaan.

## Sources

- [Atria Team, Atria Dawn: Fajar Superinteligensi Agenik, arXiv v2](https://arxiv.org/html/2609.15818v2) — Studi kasus utama. Bagian 4 dan Gambar 6–10 mencantumkan ukuran tugas, keputusan, intervensi, revisi, dan log. Catatan berasal dari proyek pengembangan model penulis sendiri; makalah tidak menjelaskan pengambilan sampel representatif atau menyediakan tanggapan peserta dan log agen yang mendasarinya.
- [Catatan arXiv Atria Dawn dan riwayat versi](https://arxiv.org/abs/2609.15818) — Mengonfirmasi pengiriman pracetak pada 14 September, revisi v2 pada 17 September, dan tautan ke PDF lengkap. Judul makalah bukan bukti bahwa superinteligensi otonom telah tercapai.
- [Repositori publik Atria Dawn Preview](https://github.com/atria-asi/Atria-Dawn-Preview) — Repositori publik yang ditautkan menyediakan materi rilis model dan PDF makalah. Saat diperiksa, repositori itu tidak memuat tanggapan studi tingkat tugas, log agen, atau skrip untuk menganalisis ulang angka keputusan manusia-agen.
- [The Decoder: Agen AI mengerjakan lebih banyak dalam pengembangan model, tetapi manusia masih membuat keputusan](https://the-decoder.com/ai-agents-do-more-of-the-work-in-model-development-but-humans-still-make-the-decisions/) — Laporan sekunder yang memicu penugasan ini. BIG CHANGE memeriksa klaim studi terhadap makalah utama dan memperlakukan temuan kelayakan tanpa AI sebagai penilaian peserta, bukan bukti bahwa pekerjaan tersebut sama sekali tidak akan pernah dimulai.
