A Anthropic afirma que, atualmente, o Claude lidera 26% do trabalho de investigação e desenvolvimento em IA que a empresa mede internamente. Isto significa que um sistema consegue concluir a maior parte de uma tarefa a partir de uma instrução geral, sob supervisão humana. A Anthropic afirma também que nenhuma das atividades de I&D medidas é totalmente autónoma. Esta distinção é importante para um novo artigo de trabalho do Cambridge Programme on AI Science & Policy, que pergunta se a IA, ao realizar uma parte crescente da sua própria I&D, poderá vir a acelerar acentuadamente o progresso da IA.
O documento, datado de setembro de 2026, reúne 22 autores de universidades, empresas de IA e organizações da sociedade civil. Defende que é possível um ciclo rápido de retroação: sistemas competentes ajudam a criar sistemas melhores, que, por sua vez, realizam mais investigação. A conclusão central é um alerta para uma trajetória plausível e para a necessidade de a medir. O documento não afirma que essa aceleração já tenha começado.
A grande mudança
- O que mudou: Um documento de trabalho interinstitucional apresenta as provas sobre investigação e desenvolvimento conduzidos por IA, as condições em que estes poderão acelerar o progresso e as medidas concretas que propõe aos governos para obter junto dos principais laboratórios.
- Por que isso importa: Dentro das empresas que desenvolvem sistemas de IA, estão a ser delegadas mais tarefas de investigação nesses sistemas. As medidas públicas desta delegação continuam incompletas, o que dificulta perceber quanto está a acelerar o processo de investigação no seu conjunto.
- O que acompanhar: Medidas verificadas de forma independente sobre a quantidade de trabalho concluída pela IA, se os seus contributos melhoram modelos posteriores e se a capacidade computacional, as experiências e a revisão humana travam o ciclo de retroação.
As provas são reais, mas as medidas respondem a perguntas diferentes
O relatório de medição da Anthropic, publicado em setembro, refere que a percentagem de trabalho de I&D classificada no nível «a IA lidera» atingiu 26% em agosto de 2026, contra menos de 1% em fevereiro. A escala continua a incluir um supervisor humano nessa categoria. A Anthropic diz que o índice é um protótipo, que os seus próprios modelos ajudam a avaliar o trabalho e que não existe um método comum para comparar estes números entre empresas. A afirmação de que nenhum trabalho medido é totalmente autónomo deve ser considerada juntamente com a percentagem de 26%.
O relato da OpenAI, publicado em setembro, descreve investigadores que utilizam mais agentes de programação, contribuem com código mais rapidamente e realizam mais experiências. A OpenAI afirma que o volume de experiências está correlacionado com uma maior utilização de agentes, embora a capacidade computacional disponível também tenha aumentado. Segundo a empresa, as pessoas continuam a definir prioridades de investigação e a decidir que resultados devem ser prosseguidos. Mais código e mais experiências podem ajudar a investigação sem demonstrar um aumento equivalente na velocidade de produção de modelos mais competentes.
Avaliações independentes ajudam a medir uma parte do processo. A atualização Time Horizon 1.1 da METR concluiu que, no conjunto de testes da METR, os modelos conseguem completar tarefas de investigação e engenharia de software mais longas do que os sistemas anteriores. A METR refere também uma grande incerteza para tarefas longas, cujos tempos de conclusão por humanos foram muitas vezes estimados. Um benchmark de tarefas mede a capacidade nas tarefas selecionadas; não mede a produtividade total de investigação de um laboratório de IA. Num estudo aleatorizado distinto, com 16 programadores experientes de projetos de código aberto a trabalhar em 246 tarefas, a METR concluiu que o acesso a ferramentas de IA do início de 2025 aumentou o tempo de conclusão em 19%. Esse contexto mais antigo de desenvolvimento de software não representa um laboratório de ponta em setembro de 2026, mas mostra por que razão a utilização de ferramentas e os benchmarks de tarefas, por si só, não resolvem a questão da produtividade.
Um possível ciclo de retroação tem vários travões
O documento do CASP centra-se num ciclo impulsionado por software. Os sistemas de IA poderiam alargar a força de trabalho efetiva na investigação, realizando tarefas em paralelo. As melhorias bem-sucedidas tornariam os sistemas seguintes melhores investigadores, permitindo novas melhorias. Os autores afirmam que as provas preliminares são compatíveis com este mecanismo e consideram provável uma automatização substancial da I&D nos próximos anos. A possibilidade mais extrema de uma «explosão de inteligência», que comprimiria anos de progresso em meses ou menos, depende de o ciclo ultrapassar as suas limitações. É um cenário condicional, não uma previsão quantificada do que irá acontecer.
O documento identifica quatro limitações importantes: rendimentos decrescentes do esforço adicional de investigação, capacidade computacional e dados limitados, tarefas que continuam difíceis de automatizar e processos como longos ciclos de treino que não podem ser acelerados à vontade. Os autores dizem que as provas sobre alguns destes fatores são mistas ou indiretas e que faltam provas diretas sobre a intensidade dos estrangulamentos que dependem do tempo. O exemplo de uma aceleração de dez vezes no progresso em cerca de 1,5 anos é um cálculo do modelo, posterior à automatização total da I&D e condicionado à manutenção dos rendimentos estimados do esforço de investigação e à inexistência de novos estrangulamentos. Não é uma aceleração observada nem uma data garantida.
Outros trabalhos tornam a incerteza mais explícita. Num estudo de 2025 com quatro laboratórios de IA, Parker Whitfill e Cheryl Wu chegaram a conclusões diferentes consoante a forma como modelaram a capacidade computacional para investigação. Numa especificação, o trabalho cognitivo e a capacidade computacional pareciam substituíveis; num modelo que teve em conta as exigências crescentes das experiências de ponta, pareciam complementares. Os autores alertam para as limitações dos dados e do modelo. A análise de Toby Ord, de agosto de 2026 identifica o tempo necessário para concluir cada ciclo de melhoria como outro parâmetro crítico. Estas análises não excluem uma aceleração rápida. Mostram que não se pode inferir a velocidade do ciclo diretamente do número de agentes nem da quantidade de código que estes escrevem.
O que os autores propõem medir
Os autores de Cambridge propõem três prioridades de política pública: obter visibilidade sobre a automatização da I&D em IA, desenvolver formas de orientar e restringir uma eventual aceleração e preparar-se para os seus possíveis efeitos. A prioridade mais imediata e suscetível de ser testada é a medição. Sugerem que se divulgue a percentagem de contributos de investigação produzidos por IA, o ritmo de melhoria algorítmica, a distribuição das despesas dos laboratórios entre pessoas e capacidade computacional, as decisões de investigação influenciadas por sistemas de IA e os incidentes com agentes internos. Propõem também auditorias independentes, com requisitos mais rigorosos para sistemas na vanguarda da capacidade de I&D em IA.
Algumas propostas posteriores, incluindo requisitos prévios a novas implementações, formas de suspender cargas de trabalho específicas de I&D e verificação internacional, exigiriam escolhas de conceção e envolveriam compromissos significativos. O próprio documento alerta que poderes mal concebidos poderiam favorecer uma empresa e atrasar trabalho benéfico. A análise de possíveis benefícios e danos graves depende do cenário condicional de aceleração apresentado anteriormente. Os decisores políticos podem avaliar a proposta imediata de divulgação de dados sem presumir que o cenário mais extremo já ocorreu.
A pergunta útil após este relatório é mais restrita do que saber se a IA se tornará subitamente superinteligente. É saber se os laboratórios conseguem mostrar, em termos comparáveis, que partes da investigação são atualmente lideradas pela IA, que melhorias resistem à avaliação humana e com que rapidez alimentam a geração seguinte de sistemas. As provas públicas ainda não são suficientes para responder a esta pergunta em várias empresas.
Fontes e leituras complementares
- Cambridge Programme on AI Science & Policy, documento de trabalho completo (setembro de 2026): O argumento dos autores, a revisão das provas, os pressupostos do modelo, as limitações e as propostas de política pública. Está identificado como documento de trabalho; os materiais públicos não comprovam uma revisão externa por pares.
- Resumo executivo do CASP: Uma síntese mais curta do cenário condicional dos autores e das respostas propostas. Foi redigida por um subconjunto dos autores.
- Anthropic, medições da I&D liderada por IA: Fonte primária da percentagem de 26% no nível «a IA lidera», do nível de supervisão e das limitações metodológicas.
- OpenAI, aceleração da investigação na OpenAI: Medidas divulgadas pela empresa sobre utilização de agentes, volume de experiências e orientação humana, bem como ressalvas sobre a medição do progresso da investigação.
- METR, Time Horizon 1.1: Avaliação independente de tarefas e incerteza sobre como os horizontes dos benchmarks são estimados.
- Whitfill e Wu, estrangulamentos de capacidade computacional, e Ord, dinâmica das explosões de inteligência: Análises distintas das condições que poderiam desacelerar ou alterar um ciclo recursivo de investigação.



