A equipa que desenvolve o Atria Dawn Preview usou IA em 713 das 739 tarefas para as quais os participantes deram uma resposta clara sobre a utilização de IA. No estudo do próprio trabalho de desenvolvimento, as pessoas continuaram a fazer a escolha final em 85,5% das decisões registadas sobre métodos ou parâmetros. O título do artigo menciona «superinteligência agêntica», mas os registos de tarefas contam uma história mais específica sobre a divisão do trabalho na equipa.
O preprint foi submetido a 14 de setembro e revisto a 17 de setembro de 2026. Reúne 769 registos de tarefas de 56 participantes, além de registos dos agentes, num projeto de desenvolvimento de um modelo. Os autores descrevem os dados como um estudo de caso sobre a forma como a sua equipa usou agentes para desenvolver o Atria Dawn Preview.
A grande mudança
- O que mudou: A equipa registou como os agentes e as pessoas dividiram decisões específicas de investigação durante um projeto de desenvolvimento de um modelo, distinguindo uma proposta da escolha final.
- Porque é importante: Um agente pode gerar um método e rever um resultado, enquanto um investigador continua a escolher o objetivo, a aprovar o método e a decidir se o resultado satisfaz os critérios da tarefa. Contar apenas as ações do agente ignora estes papéis distintos.
- O que acompanhar:São observações do trabalho de uma equipa, e grande parte das provas sobre as decisões foi fornecida pelos próprios participantes. As conclusões não estabelecem como outros laboratórios de IA dividem as decisões nem se os agentes conseguem desenvolver os seus sucessores autonomamente.
Os agentes propuseram muitos métodos; as pessoas escolheram a maioria
A distinção mais clara decorre de 567 decisões registadas sobre métodos ou parâmetros, tomadas por participantes em funções de execução. O artigo indica que a IA propôs uma opção em 64,6% dessas decisões. A maior categoria individual, com 55,4%, foi «a IA propõe, a pessoa escolhe». As pessoas fizeram a escolha final em 85,5% dos casos; a IA, em 9,2%. As restantes decisões foram atribuídas a uma restrição externa.
A divisão variou consoante a pergunta. As pessoas fizeram a escolha final em 93,4% das 603 decisões sobre objetivos ou âmbito e em 81,9% das 542 decisões sobre critérios de aceitação. As propostas da IA foram muito mais comuns para métodos do que para objetivos. A figura do artigo também regista que as pessoas escolheram o objetivo final em 144 das 151 tarefas que os participantes consideraram inviáveis sem IA.
Estas percentagens descrevem os papéis declarados nas decisões. Não medem se cada escolha humana foi bem informada. Os autores interpretam o padrão como investigadores a orientar o trabalho enquanto os agentes geravam opções dentro das diretrizes definidas pelas pessoas. O estudo de caso documenta a execução delegada neste projeto, mantendo a autoridade final nas mãos das pessoas.
A orientação humana levou frequentemente os agentes a retomar o trabalho
Os participantes recordaram a dificuldade mais significativa de cada tarefa. Entre 588 tarefas com dificuldade e resposta registadas, 447, ou 76,0%, avançaram com ajuda humana; os agentes recuperaram autonomamente em 135 casos, ou 23,0%. As principais formas de ajuda foram contexto adicional ou requisitos esclarecidos (207 tarefas) e diagnóstico ou alteração do método (204). Em quatro tarefas, uma pessoa assumiu a maior parte do trabalho.
Os registos dos resultados mostram uma divisão semelhante. Das 627 tarefas com destino conhecido para o principal resultado da IA, 354 exigiram uma revisão substancial. Neste subconjunto revisto, o agente fez as alterações após orientação humana em 75,4% dos casos, enquanto uma pessoa editou diretamente em 19,2%. Os investigadores podiam orientar uma alteração sem fazer eles próprios a edição.
Uma medida dos registos também aumentou durante o desenvolvimento: para um grupo de 22 participantes, a mediana diária de ações registadas do agente por pedido humano passou de 11,0 a 7 de agosto para 28,5 a 4 de setembro. A medida usa uma janela móvel dos sete dias anteriores e tinha proporções válidas para 21 ou 22 pessoas em cada dia. Conta atividade; por isso, não demonstra que os agentes tenham ganho autoridade ou melhorado os seus resultados.
O que os registos de tarefas podem demonstrar
Os participantes estimaram se poderiam ter concluído a sua parte de uma tarefa sem IA, mantendo o mesmo âmbito, qualidade e restantes recursos. Consideraram inviáveis sem IA 151 das 455 tarefas concluídas com apoio de IA que tiveram respostas utilizáveis, ou 33,2%. Trata-se de um contrafactual relatado pelos próprios participantes, não de uma experiência em que a equipa repetiu as tarefas sem um agente. Não demonstra que nenhum trabalho teria sido tentado em condições diferentes.
O artigo não explica como foram selecionados os 56 participantes ou os 769 registos de tarefas, e as ligações públicas não disponibilizam as respostas subjacentes nem os registos dos agentes para uma reanálise independente. Os resultados dos testes de desempenho avaliam o Atria Dawn Preview como modelo. Não demonstram que um sistema de IA tenha aperfeiçoado autonomamente o seu sucessor. Para as equipas que decidem o que delegar, o limite relatado é específico: neste projeto, os agentes propuseram e reviram frequentemente trabalho, enquanto os participantes afirmaram ter mantido a maioria das escolhas sobre objetivos, métodos e critérios de aceitação.



