A Anthropic diz que o Claude agora lidera 26% do trabalho de pesquisa e desenvolvimento em IA que a empresa mede internamente. Isso significa que um sistema pode concluir a maior parte de uma tarefa a partir de uma instrução de alto nível, enquanto uma pessoa supervisiona. A Anthropic também diz que nenhuma atividade de P&D medida é totalmente autônoma. Essa distinção importa em um novo artigo de trabalho do Cambridge Programme on AI Science & Policy, que pergunta se a IA fazendo cada vez mais de sua própria P&D poderia, no futuro, acelerar bruscamente o avanço da inteligência artificial.
O artigo, datado de setembro de 2026, reúne 22 autores de universidades, empresas de IA e organizações da sociedade civil. Ele argumenta que um ciclo rápido de retroalimentação é possível: sistemas capazes ajudam a produzir sistemas melhores, que então fazem mais pesquisa. Sua conclusão central é um alerta sobre uma trajetória plausível e sobre a necessidade de medi-la. O artigo não afirma que essa aceleração já tenha começado.
A grande mudança
- O que mudou: Um artigo de trabalho interinstitucional reuniu as evidências sobre P&D conduzida por IA, as condições em que ela poderia acelerar o avanço da IA e medidas específicas que pede aos governos para obter dos laboratórios de ponta.
- Por que isso importa: Mais tarefas de pesquisa estão sendo delegadas a sistemas de IA dentro das empresas que os desenvolvem. As medidas públicas dessa delegação ainda são parciais, o que dificulta saber quanto o processo de pesquisa como um todo está acelerando.
- O que acompanhar: Medidas verificadas de forma independente sobre quanto trabalho a IA conclui, se suas contribuições melhoram modelos posteriores e se computação, experimentos e revisão humana desaceleram o ciclo de retroalimentação.
As evidências são reais, mas as medidas respondem a perguntas diferentes
O relatório de medição da Anthropic, de setembro, diz que a parcela de trabalho de P&D classificada no nível “IA lidera” chegou a 26% em agosto de 2026, ante menos de 1% em fevereiro. A escala ainda coloca um supervisor humano nessa categoria. A Anthropic diz que o índice é um protótipo, que seus próprios modelos ajudam a avaliar o trabalho e que não há um método comum para comparar esses números entre empresas. A declaração de que nenhum trabalho medido é totalmente autônomo deve ser considerada junto do índice de 26%.
O relato da OpenAI em setembro descreve pesquisadores usando mais agentes de programação, contribuindo com código mais rapidamente e executando mais experimentos. A OpenAI afirma que o volume de experimentos está correlacionado com o maior uso de agentes, embora a capacidade computacional disponível também tenha aumentado. Segundo a empresa, as pessoas ainda escolhem as prioridades de pesquisa e decidem quais resultados seguir. Mais código e experimentos podem ajudar a pesquisa sem demonstrar um aumento equivalente na velocidade de produção de modelos mais capazes.
Avaliações independentes ajudam a medir uma parte do processo. A atualização Time Horizon 1.1 da METR constatou que os modelos conseguem concluir tarefas de pesquisa e engenharia de software mais longas do que sistemas anteriores em seu conjunto de testes. A METR também relata grande incerteza para tarefas longas, cujos tempos de conclusão por humanos foram, em muitos casos, estimados. Um benchmark de tarefas mede a capacidade nas tarefas selecionadas; não mede a produtividade total de pesquisa de um laboratório de IA. Em um estudo aleatorizado separado, com 16 desenvolvedores experientes de código aberto trabalhando em 246 tarefas, a METR constatou que o acesso a ferramentas de IA do início de 2025 aumentou o tempo de conclusão em 19%. Esse contexto de desenvolvimento de software, anterior, não representa um laboratório de ponta em setembro de 2026, mas mostra por que o uso de ferramentas e os benchmarks de tarefas, sozinhos, não resolvem a questão da produtividade.
Um possível ciclo de retroalimentação tem vários freios
O artigo do CASP se concentra em um ciclo impulsionado por software. Sistemas de IA ampliariam a força de trabalho efetiva de pesquisa ao realizar tarefas em paralelo. Melhorias bem-sucedidas tornariam os sistemas seguintes pesquisadores melhores, permitindo novas melhorias. Os autores dizem que evidências preliminares são compatíveis com esse mecanismo e consideram provável uma automação substancial de P&D nos próximos anos. A possibilidade mais extrema de uma “explosão de inteligência”, que comprimiria anos de avanço em meses ou menos, depende de o ciclo superar suas restrições. Trata-se de um cenário condicional, não de uma previsão medida do que ocorrerá.
O artigo aponta quatro restrições importantes: retornos decrescentes de esforços adicionais de pesquisa, capacidade computacional e dados limitados, tarefas que continuam difíceis de automatizar e processos como longos ciclos de treinamento, que não podem ser acelerados à vontade. Os autores dizem que as evidências sobre alguns desses fatores são mistas ou indiretas e que faltam evidências diretas sobre a força dos gargalos que dependem de tempo. O exemplo de uma aceleração de dez vezes no avanço em cerca de 1,5 ano é um cálculo de modelo posterior à automação completa de P&D, condicionado à persistência dos retornos estimados do esforço de pesquisa e à ausência de novos gargalos. Não é uma aceleração observada nem uma data garantida, independentemente das condições.
Outros trabalhos tornam a incerteza mais clara. Em um estudo de 2025 com quatro laboratórios de IA, Parker Whitfill e Cheryl Wu chegaram a respostas diferentes conforme a forma como modelaram a computação para pesquisa. Em uma especificação, trabalho cognitivo e capacidade computacional pareciam substituíveis; em um modelo que levava em conta as exigências crescentes dos experimentos de ponta, pareciam complementares. Os autores alertam que os dados e o modelo são limitados. A análise de Toby Ord, de agosto de 2026 identifica o tempo necessário para concluir cada ciclo de melhoria como outro parâmetro crítico. Essas análises não descartam uma aceleração rápida. Elas mostram que a velocidade do ciclo não pode ser inferida diretamente do número de agentes nem da quantidade de código que escrevem.
O que os autores querem que seja medido
Os autores de Cambridge propõem três prioridades de política pública: obter visibilidade sobre a automação de P&D em IA, desenvolver maneiras de direcionar e restringir uma possível aceleração e preparar-se para seus efeitos potenciais. A prioridade mais imediata e testável é medir. Eles sugerem informar a parcela das contribuições de pesquisa produzida por IA, o ritmo de melhoria algorítmica, como os laboratórios distribuem os gastos entre pessoas e computação, quais decisões de pesquisa os sistemas de IA influenciam e incidentes envolvendo agentes internos. Também propõem auditorias independentes, com requisitos mais rigorosos para sistemas na fronteira da capacidade de P&D em IA.
Algumas propostas posteriores, como requisitos antes de novas implantações, formas de pausar determinadas cargas de trabalho de P&D e verificação internacional, exigiriam escolhas de projeto e envolveriam concessões importantes. O próprio artigo alerta que poderes mal concebidos poderiam favorecer uma empresa e atrasar trabalhos benéficos. A discussão de possíveis benefícios e danos graves depende da hipótese condicional de aceleração apresentada anteriormente. Formuladores de políticas podem analisar a proposta imediata de divulgação de dados sem presumir que o cenário mais extremo já ocorreu.
A pergunta útil depois deste relatório é mais restrita do que saber se a IA se tornará subitamente superinteligente. É se os laboratórios conseguem mostrar, em termos comparáveis, quais partes da pesquisa a IA lidera hoje, quais melhorias resistem à avaliação humana e com que rapidez essas melhorias alimentam a geração seguinte de sistemas. As evidências públicas ainda não bastam para responder a essa pergunta entre empresas.
Fontes e leituras complementares
- Cambridge Programme on AI Science & Policy, artigo de trabalho completo (setembro de 2026): O argumento dos autores, a revisão das evidências, as premissas do modelo, os limites e as propostas de política pública. O documento é identificado como artigo de trabalho; os materiais públicos não comprovam revisão externa por pares.
- Resumo executivo do CASP: Uma síntese mais curta do cenário condicional dos autores e das respostas propostas. Foi redigida por um subconjunto dos autores.
- Anthropic, medições de P&D conduzida por IA: Fonte primária do índice de 26% “IA lidera”, do nível de supervisão e dos limites metodológicos.
- OpenAI, aceleração da pesquisa dentro da OpenAI: Medidas relatadas pela empresa sobre o uso de agentes, o volume de experimentos, a direção humana e as ressalvas para medir o avanço da pesquisa.
- METR, Time Horizon 1.1: Avaliação independente de tarefas e incerteza sobre como os horizontes dos benchmarks são estimados.
- Whitfill e Wu, gargalos de computação, e Ord, dinâmica das explosões de inteligência: Análises distintas das condições que poderiam desacelerar ou alterar um ciclo recursivo de pesquisa.



