A equipe que desenvolve a Atria Dawn Preview usou IA em 713 das 739 tarefas para as quais os participantes deram uma resposta clara sobre o uso de IA. No estudo do próprio trabalho de desenvolvimento, as pessoas ainda fizeram a escolha final em 85,5% das decisões registradas sobre métodos ou parâmetros. O título do artigo menciona “superinteligência agêntica”, mas os registros de tarefas contam uma história mais específica sobre a divisão do trabalho na equipe.
O preprint foi submetido em 14 de setembro e revisado em 17 de setembro de 2026. Reúne 769 registros de tarefas de 56 participantes, além de registros de agentes, em um projeto de desenvolvimento de modelo. Os autores descrevem os dados como um estudo de caso sobre como sua equipe usou agentes para desenvolver a Atria Dawn Preview.
A grande mudança
- O que mudou: A equipe registrou como agentes e pessoas dividiram decisões específicas de pesquisa durante um projeto de desenvolvimento de modelo, distinguindo uma proposta da escolha final.
- Por que isso importa: Um agente pode gerar um método e realizar uma revisão, enquanto um pesquisador ainda escolhe o objetivo, aprova o método e decide se o resultado atende aos critérios da tarefa. Contar apenas as ações do agente ignora esses papéis distintos.
- O que acompanhar: São observações do trabalho de uma equipe, e grande parte das evidências sobre decisões foi fornecida pelos próprios participantes. Os achados não estabelecem como outros laboratórios de IA dividem as decisões nem se agentes conseguem desenvolver seus sucessores de forma autônoma.
Agentes propuseram muitos métodos; pessoas escolheram a maioria
A distinção mais clara vem de 567 decisões registradas sobre métodos ou parâmetros tomadas por participantes em funções de execução. O artigo informa que a IA propôs uma opção em 64,6% dessas decisões. A maior categoria individual, com 55,4%, foi “IA propõe, pessoa escolhe”. As pessoas fizeram a escolha final em 85,5% dos casos; a IA, em 9,2%. As demais decisões foram atribuídas a uma restrição externa.
A divisão variou conforme a pergunta. As pessoas fizeram a escolha final em 93,4% das 603 decisões sobre objetivos ou escopo e em 81,9% das 542 decisões sobre critérios de aceitação. Propostas da IA foram muito mais comuns para métodos do que para objetivos. A figura do artigo também registra que as pessoas escolheram o objetivo final em 144 das 151 tarefas que os participantes consideraram inviáveis sem IA.
Essas porcentagens descrevem os papéis declarados nas decisões. Não medem se cada escolha humana foi bem informada. Os autores interpretam o padrão como pesquisadores orientando o trabalho enquanto agentes geravam opções dentro das diretrizes definidas pelas pessoas. O estudo de caso documenta, nesse projeto, execução delegada com a autoridade final mantida por pessoas.
Feedback humano frequentemente fez os agentes voltarem ao trabalho
Os participantes recordaram a dificuldade mais significativa de cada tarefa. Entre 588 tarefas com dificuldade e resposta registradas, 447, ou 76,0%, avançaram com ajuda humana; os agentes se recuperaram por conta própria em 135 casos, ou 23,0%. As principais formas de ajuda foram contexto adicional ou requisitos esclarecidos (207 tarefas) e diagnóstico ou mudança de método (204). Em quatro tarefas, uma pessoa assumiu a maior parte do trabalho.
Os registros dos resultados mostram uma divisão semelhante. Das 627 tarefas com destino conhecido para o principal resultado da IA, 354 exigiram uma revisão substancial. Nesse subconjunto revisado, o agente fez as alterações após feedback humano em 75,4% dos casos, enquanto uma pessoa editou diretamente em 19,2%. Pesquisadores podiam orientar uma mudança sem fazer a edição por conta própria.
Uma medida dos registros também aumentou durante o desenvolvimento: para um grupo de 22 participantes, a mediana diária de ações registradas do agente por solicitação humana passou de 11,0 em 7 de agosto para 28,5 em 4 de setembro. A medida usa uma janela móvel dos sete dias anteriores e tinha proporções válidas para 21 ou 22 pessoas em cada dia. Ela conta atividade; portanto, não demonstra que os agentes tenham ganhado autoridade ou melhorado seus resultados.
O que os registros de tarefas podem demonstrar
Os participantes estimaram se poderiam ter concluído sua parte de uma tarefa sem IA, mantendo o mesmo escopo, qualidade e demais recursos. Consideraram inviáveis sem IA 151 das 455 tarefas concluídas com auxílio de IA que tiveram respostas utilizáveis, ou 33,2%. Trata-se de um contrafactual autorrelatado, não de um experimento em que a equipe repetiu as tarefas sem um agente. Isso não demonstra que nenhum trabalho teria sido tentado em outras condições.
O artigo não informa como foram selecionados os 56 participantes ou os 769 registros de tarefas, e seus links públicos não fornecem as respostas subjacentes nem os registros dos agentes para uma reanálise independente. Os resultados de benchmark avaliam a Atria Dawn Preview como modelo. Não demonstram que um sistema de IA tenha aprimorado autonomamente seu sucessor. Para equipes que decidem o que delegar, o limite relatado é específico: agentes frequentemente propuseram e revisaram trabalho nesse projeto, enquanto os participantes relataram manter a maioria das escolhas sobre objetivos, métodos e critérios de aceitação.



