Um artigo de trabalho de Harvard oferece uma verificação útil de uma afirmação comum sobre produtividade: escrever mais código com IA deveria significar entregar mais software. Em 718 empresas que usam a plataforma de análise de engenharia Jellyfish, Fiona Chen e James Stratton estimam que a adoção de agentes de programação foi seguida por 30% mais linhas de código, 20% mais commits e 23% mais pull requests por trabalhador ativo. As medidas de questões Jira e épicos concluídos não mostraram aumento estatisticamente significativo. A versão atual do artigo é datada de 4 de agosto de 2026; os dados de eventos de trabalho terminam em março de 2026.
A diferença importa para líderes de engenharia porque um pull request entra em uma fila para revisão, testes e possíveis alterações. No mesmo estudo, o tempo decorrido entre o envio de um pull request e sua integração aumentou, segundo a estimativa, 49% após a adoção de agentes. Pedidos de alteração ficaram mais comuns, e os comentários por pull request aumentaram. Esses resultados apontam para uma carga maior de revisão, mas não mostram que toda alteração escrita por um agente seja ruim nem identificam uma taxa medida de defeitos.
A grande mudança
- O que mudou: Neste estudo no nível das empresas, a adoção de agentes de programação coincidiu com uma atividade de programação substancialmente maior e revisões de pull requests mais exigentes, sem aumento estatisticamente significativo de questões resolvidas ou épicos.
- Por que importa: Linhas, commits e pull requests medem o trabalho que entra no processo de produção. O trabalho resolvido é uma medida posterior. Uma equipe que avalia agentes apenas pelo volume de código pode deixar passar a carga que chega à revisão.
- O que acompanhar: Se as empresas conseguem ampliar a capacidade de revisão e se dados posteriores mostram ganhos no trabalho concluído. Este artigo de trabalho acompanha a adoção inicial até março de 2026 e não pode determinar os efeitos de longo prazo.
Assistentes e agentes produziram estimativas diferentes
Os autores distinguem assistentes, que respondem com sugestões de código enquanto o desenvolvedor trabalha, de agentes, que podem receber uma tarefa de nível mais alto e executar várias etapas antes de o desenvolvedor aprovar o resultado. Eles medem a adoção de assistentes pela ativação de licenças empresariais do GitHub Copilot e Cursor. Para agentes, combinam dados de uso do Claude Code com sinais como contas de bots e assinaturas de ferramentas em commits ou pull requests. Alguns usos individuais ou ferramentas não integradas podem escapar dessas medidas. A estimativa de agentes representa a associação adicional em torno da adoção de agentes, em comparação com o período anterior de adoção de assistentes; não é uma estimativa para cada pessoa que usa um agente.
Os resultados dos assistentes foram menores: aumento estimado de 12% nas linhas, 9% nos commits e 5% nos pull requests. Apenas o resultado dos commits foi estatisticamente significativo nas estimativas principais do artigo. A adoção de agentes mostrou aumentos significativos nas três medidas de atividade de programação. Um commit registra uma atualização de código; um pull request envia uma alteração para revisão. Nenhum dos dois comprova que um recurso chegou aos usuários. O artigo usa questões Jira resolvidas e épicos maiores como medidas de produção em estágio posterior, com base no fluxo acompanhado em que as equipes marcam o trabalho como concluído após revisão, testes e implantação. O status do Jira continua sendo uma aproximação da entrega, e não uma medição independente do que os usuários receberam.
Para agentes, o aumento estimado de questões resolvidas foi de 0,12 por trabalhador-mês, diante de uma linha de base de 3,67, com erro-padrão de 0,17. O resultado é estatisticamente indistinguível de zero. A conclusão de épicos também não mostrou mudança significativa. Os autores relatam que o intervalo de confiança descarta um aumento na conclusão de questões superior a 12% da média de referência no período estudado. Essa é uma conclusão mais restrita do que dizer que agentes não produzem software útil: ganhos modestos continuam possíveis, e a contagem de questões não captura toda mudança de valor ou qualidade. Os autores testaram se o tamanho das questões mudou usando medidas previstas de duração das tarefas e não encontraram evidência dessa mudança na amostra.
Mais trabalho chegou aos revisores
As medidas de revisão oferecem um mecanismo plausível para a diferença de produção. Após a adoção de agentes, o artigo estima 3,45 dias adicionais entre o envio e a integração de um pull request, em relação à linha de base de 7,03 dias, um aumento de 49%. Esse é o tempo de calendário no processo de revisão, não uma cronometragem dos minutos de revisão ativa de uma pessoa. A parcela de pull requests que recebeu um pedido formal de alterações aumentou cerca de 12 pontos percentuais, partindo de uma linha de base de 13%; os comentários por pedido subiram 0,58 em relação à linha de base de 1,66, ou 35%. A parcela de trabalhadores que revisou ao menos um pull request em um mês aumentou cerca de quatro pontos percentuais em relação à base de 29%, um aumento relativo de 14%. As estimativas comparáveis dos assistentes não mostraram aumentos significativos na duração da revisão, nos pedidos de alteração ou nos comentários.
Somente com esses metadados, o artigo não consegue dizer por que um revisor pediu alterações. Mais envios podem sobrecarregar uma fila de revisão de capacidade fixa; uma mudança na qualidade do código ou nos padrões de revisão também pode aumentar o escrutínio. Os autores não encontraram aumento significativo no tamanho médio dos pull requests, o que enfraquece uma explicação simples para os comentários adicionais. Eles não inspecionaram o conteúdo do código nem contaram diretamente defeitos no trabalho gerado por agentes. O modelo de produção em duas etapas explica como escrever código mais rápido e alterar a revisão necessária por rascunho poderiam, juntos, limitar a produção concluída. O modelo interpreta as observações; não é um teste separado que isola qualquer um dos mecanismos.
As ferramentas de revisão por IA também se disseminaram na amostra: quase 80% das empresas haviam usado uma até março de 2026. Ainda assim, o artigo atribui 23,3% dos comentários de revisão à IA e encontra pelo menos um comentário de IA em 10,8% dos pull requests. Portanto, adotar uma ferramenta de revisão não significa que a revisão tenha se tornado automática nessas empresas.
O que o desenho pode estabelecer
Os pesquisadores analisam cerca de 300 milhões de eventos de trabalho de janeiro de 2021 a março de 2026 em 718 empresas clientes da Jellyfish que consentiram, abrangendo 725.938 trabalhadores. Eles comparam resultados antes e depois de as empresas adotarem assistentes ou agentes com resultados em empresas que adotaram mais tarde ou ainda não haviam adotado, usando um desenho escalonado de diferenças em diferenças. Controles por empresa e mês-calendário tratam algumas diferenças estáveis e tendências temporais compartilhadas. A inferência ainda depende de quão comparáveis seriam as trajetórias dessas empresas sem a adoção. Empresas maiores adotaram antes, e mudanças não medidas podem ter afetado tanto a adoção quanto o trabalho de engenharia. O estudo é observacional, e suas estimativas não devem ser interpretadas como um teste randomizado nem como uma previsão para todas as equipes de software.
O resultado de emprego exige a mesma cautela. Usando o emprego total associado ao LinkedIn e os trabalhadores ativos na Jellyfish para medir o emprego em engenharia, os autores não conseguiram atribuir uma mudança significativa à adoção de agentes durante o período observado. Isso não mostra o que acontecerá com as contratações após um ajuste mais longo nem em todo o mercado de trabalho.
Cobertura anterior da BIG CHANGE examinou um relato de engenharia distinto sobre programação com IA e entregas confiáveis. Este estudo acrescenta uma visão entre empresas e medidas distintas de atividade de programação, revisão e trabalho resolvido. Sua lição prática é acompanhar essas etapas em conjunto ao avaliar agentes: um primeiro rascunho mais rápido muda a quantidade de trabalho aguardando nas etapas seguintes, e o artigo ainda não mostra um aumento correspondente em questões ou projetos concluídos.
Fontes e leituras adicionais
- Fiona Chen e James Stratton, Artificial Intelligence in the Firm: Bottlenecks in Software Production : artigo de trabalho principal, versão atual de 4 de agosto de 2026. Métodos, figuras e apêndices sustentam as estimativas relatadas e seus limites; os dados subjacentes por empresa são proprietários e agregados.
- A reportagem da Ars Technica de 9 de outubro : relato independente e contemporâneo que chamou atenção para o artigo. As afirmações numéricas e metodológicas acima foram verificadas no próprio artigo.
- O artigo anterior da BIG CHANGE sobre programação com IA e CI : cobertura relacionada de um relato de engenharia distinto. Ele contextualiza a questão da entrega, mas não é uma continuação deste estudo.



