Isang working paper ng Harvard ang nagbibigay ng kapaki-pakinabang na pagsusuri sa karaniwang pahayag tungkol sa pagiging produktibo: dapat mangahulugan ang mas maraming code na isinulat gamit ang AI ng mas maraming software na naihahatid. Sa 718 kumpanyang gumagamit ng platform ng analytics sa engineering na Jellyfish, tinataya nina Fiona Chen at James Stratton na matapos gamitin ang mga coding agent, tumaas nang 30% ang mga linya ng code, 20% ang mga commit at 23% ang mga pull request kada aktibong manggagawa. Hindi nagpakita ng makabuluhang pagtaas sa istatistika ang kanilang mga sukatan sa natapos na Jira issue at epic. May petsang Agosto 4, 2026 ang kasalukuyang bersyon ng papel; nagtatapos sa Marso 2026 ang datos nito tungkol sa mga kaganapan sa trabaho.

Mahalaga ang hindi pagtutugmang ito sa mga pinuno ng engineering dahil pumapasok ang pull request sa pila para sa pagsusuri, pagsubok at posibleng pagbabago. Sa parehong pag-aaral, tinaya na tumaas nang 49% matapos gamitin ang agent ang lumipas na oras mula sa pagsusumite ng pull request hanggang sa pagsasanib nito. Mas naging karaniwan ang mga kahilingan ng pagbabago, at dumami ang mga komento kada pull request. Ipinahihiwatig ng mga natuklasang ito ang mas mabigat na gawain sa pagsusuri, bagaman hindi nito ipinakikitang mahina ang bawat pagbabagong isinulat ng agent o sinusukat ang antas ng depekto.

Ang malaking pagbabago

  • Ano ang nagbago: Sa pag-aaral na ito sa antas ng kumpanya, kasabay ng paggamit ng coding agent ang malaking pagdami ng aktibidad sa coding at mas masusing pagsusuri ng pull request, nang walang makabuluhang pagtaas sa istatistika sa mga nalutas na isyu o epic.
  • Bakit mahalaga: Sinusukat ng mga linya, commit at pull request ang trabahong pumapasok sa proseso ng paggawa. Sukat naman sa mas huling yugto ang nalutas na trabaho. Maaaring hindi mapansin ng pangkat na ang dami lang ng code ang batayan sa pagsusuri ng mga agent ang bigat na dumarating sa yugto ng pagsusuri.
  • Ano ang dapat bantayan: Kung mapalalawak ng mga kumpanya ang kapasidad sa pagsusuri at kung magpapakita ang susunod na datos ng pagtaas sa natapos na trabaho. Sinusubaybayan ng working paper na ito ang maagang paggamit hanggang Marso 2026 at hindi nito matitiyak ang mga pangmatagalang epekto.

Magkaiba ang mga pagtataya para sa assistant at agent

Pinaghihiwalay ng mga may-akda ang assistant, na nagbibigay ng mungkahi sa code habang nagtatrabaho ang developer, at ang agent, na maaaring tumanggap ng mas mataas na antas ng gawain at gumawa ng ilang hakbang bago aprubahan ng developer ang resulta. Sinusukat nila ang paggamit ng assistant sa pamamagitan ng pag-activate ng lisensyang pangnegosyo ng GitHub Copilot at Cursor. Para sa mga agent, pinagsasama nila ang datos sa paggamit ng Claude Code at mga senyas gaya ng mga bot account at lagda ng tool sa mga commit o pull request. Maaaring hindi masaklaw ng mga panukat na ito ang ilang indibidwal na paggamit o mga tool na hindi isinama sa mga sistema. Ang pagtataya para sa agent ay ang dagdag na ugnayan sa paggamit ng agent kumpara sa naunang panahon ng paggamit ng assistant; hindi ito pagtataya para sa bawat indibidwal na gumagamit ng agent.

Mas maliit ang mga resulta para sa assistant: tinatayang 12% na pagtaas sa mga linya, 9% sa mga commit at 5% sa mga pull request. Ang resulta lamang sa commit ang makabuluhan sa istatistika sa pangunahing mga pagtataya ng papel. Nagpakita ang paggamit ng agent ng makabuluhang pagtaas sa tatlong sukat ng aktibidad sa coding. Tinatala ng commit ang isang pag-update sa code; nagsusumite naman ang pull request ng pagbabago para sa pagsusuri. Hindi pinatutunayan ng alinman na nakarating na sa mga gumagamit ang isang tampok. Ginagamit ng papel ang mga nalutas na Jira issue at mas malalaking epic bilang mga panukat sa kinalabasang nasa mas huling yugto, batay sa sinusubaybayang daloy ng trabaho kung saan minamarkahan ng mga pangkat na tapos na ang gawain matapos ang pagsusuri, pagsubok at pag-deploy. Proxy lamang ang katayuan sa Jira para sa paghahatid, hindi hiwalay na sukat sa natanggap ng mga gumagamit.

Para sa mga agent, ang tinatayang pagtaas sa nalutas na isyu ay 0.12 kada manggagawa-buwan kumpara sa batayang 3.67, na may standard error na 0.17. Hindi naiiba sa sero sa istatistika ang resulta. Wala ring makabuluhang pagbabago sa pagkumpleto ng epic. Iniulat ng mga may-akda na inaalis ng kanilang confidence interval ang posibilidad ng pagtaas sa pagkumpleto ng isyu na lampas sa 12% ng karaniwang batayang halaga sa panahong pinag-aralan. Mas tiyak ito kaysa sa pagsasabing walang kapaki-pakinabang na software na nalilikha ang mga agent: posible pa rin ang katamtamang pagbuti, at hindi nasasaklaw ng bilang ng isyu ang bawat pagbabago sa halaga o kalidad. Sinubukan ng mga may-akda kung nagbago ang laki ng isyu gamit ang mga hinulaang sukatan ng haba ng gawain at wala silang nakitang katibayan ng gayong pagbabago sa kanilang sample.

Mas maraming trabaho ang nakarating sa mga reviewer

Nagbibigay ng kapani-paniwalang mekanismo para sa agwat sa kinalabasan ang mga panukat sa pagsusuri. Matapos gamitin ang agent, tinaya ng papel na nadagdagan nang 3.45 araw ang pagitan ng pagsusumite ng pull request at pagsasanib nito kumpara sa batayang 7.03 araw, o 49% na pagtaas. Panahong kalendaryo ito sa proseso ng pagsusuri, hindi pagsukat sa aktuwal na minutong ginugol ng isang tao sa pagsusuri. Tumaas nang humigit-kumulang 12 percentage point mula sa batayang 13% ang bahagi ng mga pull request na nakatanggap ng pormal na kahilingan ng pagbabago; samantala, tumaas nang 0.58 mula sa batayang 1.66 ang mga komento kada kahilingan, o 35%. Tumaas nang humigit-kumulang apat na percentage point mula sa batayang 29% ang bahagi ng mga manggagawang nagsuri ng kahit isang pull request sa loob ng isang buwan, katumbas ng 14% na relatibong pagtaas. Hindi nagpakita ang maihahambing na mga pagtataya para sa assistant ng makabuluhang pagtaas sa tagal ng pagsusuri, kahilingan ng pagbabago o komento.

Hindi matukoy ng papel mula sa metadata lamang kung bakit humiling ng pagbabago ang reviewer. Maaaring magpahirap sa nakapirming pila ng pagsusuri ang mas maraming isinumite; maaari ring magdulot ng mas masusing pagsusuri ang pagbabago sa kalidad ng code o pamantayan sa pagsusuri. Walang nakitang makabuluhang pagtaas ang mga may-akda sa karaniwang laki ng pull request, kaya humihina ang isang payak na paliwanag sa dagdag na komento. Hindi nila sinuri ang nilalaman ng code o direktang binilang ang mga depekto sa gawa ng agent. Ipinapaliwanag ng kanilang modelong may dalawang yugto sa produksyon kung paanong maaaring maglimita sa natapos na kinalabasan ang mas mabilis na pagsulat ng code kasabay ng pagbabago sa kinakailangang pagsusuri sa bawat draft. Interpretasyon ito ng mga obserbasyon, hindi hiwalay na pagsubok na sumusukat sa alinman sa dalawang mekanismo.

Lumaganap din sa sample ang mga AI review tool: halos 80% ng mga kumpanya ang nakagamit na ng isa pagsapit ng Marso 2026. Gayunman, iniugnay ng papel sa AI ang 23.3% ng mga komento sa pagsusuri at nakakita ito ng kahit isang AI comment sa 10.8% ng mga pull request. Kaya hindi nangangahulugan ang paggamit ng review tool na naging awtomatiko na ang pagsusuri sa mga kumpanyang ito.

Ano ang maitatatag ng disenyo

Sinuri ng mga mananaliksik ang humigit-kumulang 300 milyong kaganapan sa trabaho mula Enero 2021 hanggang Marso 2026 sa 718 kumpanyang kliyente ng Jellyfish na pumayag, na sumasaklaw sa 725,938 manggagawa. Inihambing nila ang mga kinalabasan bago at matapos gumamit ang mga kumpanya ng assistant o agent sa mga kinalabasan sa mga kumpanyang gumamit kalaunan o hindi pa gumagamit, sa pamamagitan ng staggered difference-in-differences na disenyo. Tinutugunan ng mga kontrol para sa kumpanya at buwan sa kalendaryo ang ilang matatag na pagkakaiba at magkakatulad na takbo sa paglipas ng panahon. Nakadepende pa rin ang hinuha sa kung gaano sana kapagtutulad ang takbo ng mga kumpanyang iyon kung walang paggamit. Mas maagang gumamit ang malalaking kumpanya, at maaaring nakaapekto sa paggamit at gawain sa engineering ang mga pagbabagong hindi nasukat. Obserbasyonal ang pag-aaral; hindi dapat ituring ang mga pagtataya nito bilang randomized na pagsubok o prediksiyon para sa lahat ng pangkat ng software.

Kailangan ding maging maingat sa resulta tungkol sa trabaho. Gamit ang kabuuang trabaho na iniugnay sa LinkedIn at mga aktibong manggagawa sa Jellyfish para sa trabaho sa engineering, hindi maiugnay ng mga may-akda sa paggamit ng agent ang anumang makabuluhang pagbabago sa panahong naobserbahan. Hindi nito ipinakikita kung ano ang mangyayari sa pagkuha ng empleyado matapos ang mas mahabang pag-aangkop o sa mas malawak na merkado ng paggawa.

Naunang coverage ng BIG CHANGE ay nagsuri sa hiwalay na salaysay ng engineering tungkol sa AI coding at maaasahang paghahatid. Nagdaragdag ang pag-aaral na ito ng pananaw mula sa maraming kumpanya at magkakahiwalay na panukat sa aktibidad sa coding, pagsusuri at nalutas na trabaho. Praktikal na aral nito na subaybayan nang magkakasama ang mga yugtong iyon sa pagtatasa ng mga agent: binabago ng mas mabilis na unang draft ang dami ng trabahong naghihintay sa susunod na mga yugto, at hindi pa nagpapakita ang papel na ito ng katumbas na pagtaas sa mga natapos na isyu o proyekto.

Mga mapagkukunan at karagdagang babasahin