DUNIA TERUS BERGERAK.RSS
BIG CHANGE.

Edisi Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Studi di perusahaan menemukan agen coding AI meningkatkan keluaran kode, tetapi pekerjaan yang selesai tertinggal

> Makalah kerja Harvard mengaitkan penggunaan agen coding di 718 perusahaan dengan lebih banyak kode dan peninjauan pull request yang lebih lama, tanpa kenaikan signifikan pada pekerjaan yang terselesaikan.

By BIG CHANGE Editorial

Published: 2026-10-10T00:19:01.727Z
Updated: 2026-10-10T00:19:01.727Z
Canonical: https://bigchange.ai/blog/ai-coding-agents-review-output-study

![Two colleagues discuss a software change beside a monitor turned away from view.](https://bigchange.ai/api/media/file/hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE

Sebuah [makalah kerja Harvard](https://fion.ac/jellyfish.pdf) menawarkan pemeriksaan yang berguna atas klaim produktivitas yang umum: lebih banyak kode yang ditulis dengan AI seharusnya berarti lebih banyak perangkat lunak yang dikirimkan. Di 718 perusahaan yang memakai platform analitik rekayasa Jellyfish, Fiona Chen dan James Stratton memperkirakan bahwa setelah agen coding diadopsi, jumlah baris kode per pekerja aktif naik 30%, commit naik 20%, dan pull request naik 23%. Ukuran mereka untuk issue Jira dan epik yang selesai tidak menunjukkan kenaikan yang signifikan secara statistik. Versi terbaru makalah ini bertanggal 4 Agustus 2026; data peristiwa kerja berakhir pada Maret 2026.

Ketimpangan ini penting bagi pemimpin rekayasa karena pull request masuk ke antrean untuk ditinjau, diuji, dan mungkin direvisi. Dalam studi yang sama, waktu yang berlalu dari pengajuan hingga penggabungan pull request diperkirakan naik 49% setelah agen diadopsi. Permintaan perubahan menjadi lebih umum, dan komentar per pull request meningkat. Temuan ini menunjukkan beban peninjauan yang lebih berat, tetapi tidak membuktikan bahwa setiap perubahan yang ditulis agen buruk atau mengukur tingkat cacat.

## Perubahan utama

- **Apa yang berubah:**Dalam studi di tingkat perusahaan ini, adopsi agen coding beriringan dengan aktivitas coding yang jauh lebih tinggi dan peninjauan pull request yang lebih menuntut, tanpa kenaikan yang signifikan secara statistik pada issue atau epik yang terselesaikan.
- **Mengapa penting:**Baris kode, commit, dan pull request mengukur pekerjaan yang masuk ke proses produksi. Pekerjaan yang terselesaikan adalah ukuran tahap berikutnya. Tim yang menilai agen hanya dari volume kode dapat melewatkan beban yang tiba di tahap peninjauan.
- **Apa yang perlu dipantau:**Apakah perusahaan dapat meningkatkan kapasitas peninjauan dan apakah data berikutnya menunjukkan kenaikan pekerjaan yang selesai. Makalah kerja ini mengikuti adopsi awal hingga Maret 2026 dan tidak dapat memastikan dampak jangka panjang.

## Asisten dan agen menghasilkan estimasi yang berbeda

Para penulis membedakan *asisten*yang merespons dengan saran kode saat pengembang bekerja, dari *agen*yang dapat menerima tugas tingkat lebih tinggi dan menjalankan beberapa langkah sebelum pengembang menyetujui hasilnya. Adopsi asisten diukur melalui aktivasi lisensi bisnis GitHub Copilot dan Cursor. Untuk agen, mereka menggabungkan data penggunaan Claude Code dengan sinyal seperti akun bot dan tanda tangan alat dalam commit atau pull request. Sebagian penggunaan perorangan atau alat yang tidak terintegrasi mungkin tidak tertangkap oleh ukuran tersebut. Estimasi agen adalah hubungan tambahan di sekitar adopsi agen dibandingkan periode adopsi asisten sebelumnya; ini bukan estimasi untuk setiap orang yang memakai agen.

Hasil untuk asisten lebih kecil: estimasi kenaikan 12% pada baris kode, 9% pada commit, dan 5% pada pull request. Dalam estimasi utama makalah, hanya hasil commit yang signifikan secara statistik. Adopsi agen menunjukkan kenaikan signifikan pada ketiga ukuran aktivitas coding. Commit mencatat pembaruan kode; pull request mengajukan perubahan untuk ditinjau. Keduanya tidak membuktikan bahwa fitur telah sampai ke pengguna. Makalah ini memakai issue Jira yang terselesaikan dan epik yang lebih besar sebagai ukuran keluaran tahap lanjut, berdasarkan alur kerja tercatat ketika tim menandai pekerjaan selesai setelah peninjauan, pengujian, dan penerapan. Status Jira tetap merupakan proksi untuk pengiriman, bukan pengukuran independen atas apa yang diterima pengguna.

Untuk agen, kenaikan issue terselesaikan diperkirakan sebesar 0,12 per pekerja-bulan, dibandingkan baseline 3,67, dengan galat baku 0,17. Hasilnya secara statistik tidak dapat dibedakan dari nol. Penyelesaian epik juga tidak menunjukkan perubahan signifikan. Para penulis melaporkan bahwa interval kepercayaan mereka menyingkirkan kenaikan penyelesaian issue di atas 12% dari rata-rata baseline selama periode yang diteliti. Temuan ini lebih terbatas daripada mengatakan bahwa agen tidak menghasilkan perangkat lunak yang berguna: peningkatan kecil masih mungkin, dan jumlah issue tidak menangkap semua perubahan nilai atau mutu. Para penulis menguji apakah ukuran issue bergeser dengan memakai ukuran perkiraan durasi tugas dan tidak menemukan bukti pergeseran semacam itu dalam sampel mereka.

## Lebih banyak pekerjaan sampai ke peninjau

Ukuran peninjauan memberi mekanisme yang masuk akal untuk menjelaskan kesenjangan keluaran. Setelah adopsi agen, makalah memperkirakan tambahan 3,45 hari dari pengajuan hingga penggabungan pull request, dibanding baseline 7,03 hari, atau kenaikan 49%. Ini adalah waktu kalender dalam proses peninjauan, bukan pengukuran dengan stopwatch atas menit aktif seseorang untuk meninjau. Porsi pull request yang menerima permintaan perubahan formal naik sekitar 12 poin persentase dari baseline 13%, sedangkan komentar per permintaan naik 0,58 dari baseline 1,66, atau 35%. Porsi pekerja yang meninjau setidaknya satu pull request dalam sebulan naik sekitar empat poin persentase dari baseline 29%, yaitu kenaikan relatif 14%. Estimasi asisten yang sebanding tidak menunjukkan kenaikan signifikan dalam durasi peninjauan, permintaan perubahan, atau komentar.

Makalah ini tidak dapat mengetahui dari metadata tersebut saja mengapa peninjau meminta perubahan. Lebih banyak pengajuan dapat membebani antrean peninjauan berkapasitas tetap; perubahan mutu kode atau standar peninjauan juga dapat meningkatkan pemeriksaan. Para penulis tidak menemukan kenaikan signifikan pada ukuran rata-rata pull request, sehingga satu penjelasan sederhana untuk komentar tambahan menjadi kurang kuat. Mereka tidak memeriksa isi kode atau menghitung langsung cacat dalam pekerjaan yang dihasilkan agen. Model produksi dua tahap mereka menjelaskan bagaimana penulisan kode yang lebih cepat dan perubahan kebutuhan peninjauan per draf dapat bersama-sama membatasi keluaran yang selesai. Model tersebut menafsirkan pengamatan, bukan uji terpisah yang mengisolasi salah satu mekanisme.

Alat peninjauan AI juga telah menyebar di antara sampel: hampir 80% perusahaan pernah menggunakannya pada Maret 2026. Namun, makalah mengaitkan 23,3% komentar peninjauan dengan AI dan menemukan setidaknya satu komentar AI pada 10,8% pull request. Jadi, penggunaan alat peninjauan tidak berarti proses peninjauan di perusahaan-perusahaan ini sudah otomatis.

## Apa yang dapat dibuktikan oleh rancangan studi

Para peneliti menganalisis sekitar 300 juta peristiwa kerja dari Januari 2021 hingga Maret 2026 di 718 perusahaan klien Jellyfish yang menyetujui partisipasi, mencakup 725.938 pekerja. Dengan rancangan difference-in-differences bertahap, mereka membandingkan hasil sebelum dan sesudah perusahaan mengadopsi asisten atau agen dengan hasil di perusahaan yang mengadopsi belakangan atau belum mengadopsinya. Kontrol perusahaan dan bulan kalender menangani sebagian perbedaan stabil dan tren waktu bersama. Kesimpulan tetap bergantung pada seberapa sebanding jalur perusahaan-perusahaan tersebut jika tidak ada adopsi. Perusahaan besar mengadopsi lebih awal, dan perubahan yang tidak terukur dapat memengaruhi adopsi sekaligus pekerjaan rekayasa. Studi ini bersifat observasional; estimasinya tidak boleh dibaca sebagai uji acak atau ramalan untuk semua tim perangkat lunak.

Hasil ketenagakerjaan memerlukan kehati-hatian yang sama. Dengan memakai total tenaga kerja yang ditautkan ke LinkedIn dan pekerja aktif di Jellyfish untuk mengukur tenaga kerja bidang rekayasa, para penulis tidak dapat mengaitkan perubahan signifikan dengan adopsi agen selama periode pengamatan. Itu tidak menunjukkan bagaimana perekrutan akan berubah setelah penyesuaian yang lebih lama atau di pasar tenaga kerja yang lebih luas.

[Liputan BIG CHANGE sebelumnya](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery) menelaah kisah rekayasa lain tentang coding AI dan pengiriman yang andal. Studi ini menambah sudut pandang lintas perusahaan serta ukuran terpisah untuk aktivitas coding, peninjauan, dan pekerjaan yang terselesaikan. Pelajaran praktisnya adalah melacak semua tahap itu bersama-sama saat menilai agen: draf pertama yang lebih cepat mengubah jumlah pekerjaan yang menunggu di tahap berikutnya, dan makalah ini belum menunjukkan kenaikan sepadan pada issue atau proyek yang selesai.

## Sumber dan bacaan lanjutan

- [Fiona Chen dan James Stratton, *Artificial Intelligence in the Firm: Bottlenecks in Software Production*](https://fion.ac/jellyfish.pdf): makalah kerja utama, versi saat ini bertanggal 4 Agustus 2026. Metode, gambar, dan lampiran mendukung estimasi yang dilaporkan beserta batasannya; data tingkat perusahaan yang mendasarinya bersifat eksklusif dan telah diagregasi.
- [laporan Ars Technica tanggal 9 Oktober](https://arstechnica.com/ai/2026/10/ai-coding-agents-generate-more-code-but-not-more-software/): liputan independen pada saat itu yang menarik perhatian pada makalah tersebut. Klaim angka dan metode di atas diperiksa terhadap makalah itu sendiri.
- [artikel BIG CHANGE sebelumnya tentang coding AI dan CI](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery): liputan terkait tentang kisah rekayasa yang berbeda. Ini memberi konteks untuk persoalan pengiriman, bukan kelanjutan dari studi ini.

## Sources

- [Artificial Intelligence in the Firm: Bottlenecks in Software Production](https://fion.ac/jellyfish.pdf) — Makalah kerja Harvard 78 halaman untuk pasar kerja akademik; peristiwa kerja hingga Maret 2026, metode, dan estimasi angka. Data eksklusif diagregasi dan dianonimkan.
- [Ars Technica: agen coding AI menghasilkan lebih banyak kode, tetapi bukan lebih banyak perangkat lunak](https://arstechnica.com/ai/2026/10/ai-coding-agents-generate-more-code-but-not-more-software/) — Liputan independen pada saat itu; informasi dan konteks, dengan klaim studi diperiksa terhadap makalah.
- [BIG CHANGE: coding AI menjadikan pengiriman yang andal tantangan rekayasa berikutnya](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery) — Liputan BIG CHANGE sebelumnya mengenai kisah rekayasa Linear yang terpisah tentang coding AI dan pengiriman yang andal.