Anthropic은 자사가 측정하는 AI 연구개발 업무의 26%를 Claude가 주도한다고 밝혔다. 이는 사람이 감독하는 가운데 시스템이 상위 수준의 프롬프트를 받아 작업 대부분을 완료할 수 있다는 뜻이다. Anthropic은 또한 측정된 R&D 업무 중 Claude가 완전히 자율적으로 수행하는 일은 없다고 밝혔다. 이 구분은 새로 나온 케임브리지 AI 과학·정책 프로그램의 연구 논문에서 중요한 쟁점이다. 이 논문은 AI가 자체 R&D를 더 많이 수행할 경우 언젠가 AI 발전이 급격히 가속할 수 있는지를 묻는다.
2026년 9월로 날짜가 표시된 이 논문에는 대학, AI 기업, 시민사회에서 온 저자 22명이 참여했다. 논문은 가능한 빠른 피드백 고리를 제시한다. 역량 있는 시스템이 더 나은 시스템 개발을 돕고, 더 나은 시스템은 다시 더 많은 연구를 수행한다는 것이다. 핵심 결론은 그럴듯한 경로에 대한 경고와 이를 측정할 필요성이다. 이 논문은 그러한 가속이 이미 시작됐다고 보고하지 않는다.
가장 큰 변화
- 달라진 점: 여러 기관의 연구진이 AI 주도 R&D에 관한 근거, 그것이 AI 발전을 가속할 수 있는 조건, 그리고 정부가 최첨단 연구소에서 확보해야 할 구체적인 측정 자료를 정리한 연구 논문을 발표했다.
- 중요한 이유: AI를 개발하는 기업 안에서 더 많은 연구 업무가 AI 시스템에 위임되고 있다. 이런 위임에 관한 공개 측정치는 아직 일부에 그쳐 연구 전반의 속도가 얼마나 빨라지고 있는지 판단하기 어렵다.
- 살펴볼 점: AI가 완료하는 업무량, 그 기여가 후속 모델을 개선하는지, 컴퓨팅 자원·실험·사람의 검토가 피드백 고리를 늦추는지를 독립적으로 검증한 측정 자료다.
근거는 있지만 측정치마다 답하는 질문이 다르다
Anthropic의 9월 측정 보고서에 따르면 자사의 R&D 업무 중 ‘AI 주도’ 단계에 도달한 비율은 2026년 8월 26%로, 2월의 1% 미만에서 상승했다. 이 평가 척도에서도 해당 단계에는 인간 감독자가 있다. Anthropic은 이 지표가 시제품이며 자사 모델이 작업 평가를 돕고, 기업 간 수치를 비교할 공통 방법도 없다고 밝혔다. 측정된 작업 중 완전 자율적으로 수행된 것이 없다는 설명도 26% 수치와 함께 봐야 한다.
OpenAI의 9월 보고서에는 연구자들이 더 많은 코딩 에이전트를 사용하고, 코드를 더 빠르게 기여하며, 더 많은 실험을 수행한다고 적혀 있다. OpenAI는 실험량과 에이전트 사용 증가가 상관관계가 있다고 보고했으며, 이용 가능한 컴퓨팅 자원도 늘었다고 밝혔다. 회사 설명에 따르면 연구 우선순위를 정하고 어떤 결과를 추구할지 결정하는 일은 여전히 사람이 맡는다. 코드와 실험이 늘면 연구에 도움이 될 수는 있지만, 더 유능한 모델이 만들어지는 속도도 그만큼 빨라졌다고 입증되지는 않는다.
독립 평가를 통해 과정의 일부를 측정할 수 있다. METR의 Time Horizon 1.1 업데이트에서는 시험군의 모델이 이전 시스템보다 더 긴 연구 및 소프트웨어 작업을 완료할 수 있다고 보고한다. METR는 장시간 작업에 대한 불확실성도 크다고 밝혔으며, 이 작업 다수의 인간 완료 시간은 추정치였다. 작업 벤치마크는 선정된 작업에서의 역량을 측정할 뿐 AI 연구소 전체의 연구 생산성을 측정하지 않는다. 경험 많은 오픈소스 개발자 16명이 작업 246개를 수행한 별도의 무작위 연구에서 METR는 2025년 초 AI 도구에 접근할 수 있게 되자 완료 시간이 19% 늘었다고 보고했다. 이 과거 소프트웨어 환경을 2026년 9월의 최첨단 연구소와 동일시할 수는 없다. 그러나 도구 사용이나 작업 벤치마크만으로 생산성 문제를 결론지을 수 없는 이유를 보여준다.
가능한 피드백 고리에는 여러 제약이 있다
CASP 논문은 소프트웨어 주도 피드백 고리에 초점을 맞춘다. AI 시스템이 병렬로 작업해 실질적인 연구 인력을 늘릴 수 있다. 성공적인 개선은 다음 시스템을 더 나은 연구자로 만들어 더 많은 개선을 가능하게 한다. 저자들은 예비 근거가 이 메커니즘과 부합한다고 보며, 수년 안에 상당한 R&D 자동화가 이뤄질 가능성이 높다고 판단한다. 수년치 발전을 수개월 또는 그보다 짧은 기간에 압축하는 더 강한 시나리오인 ‘지능 폭발’은 피드백 고리가 제약을 앞지르는 경우에 달려 있다. 이는 조건부 시나리오이지, 실제로 일어날 일을 측정해 예측한 결과가 아니다.
논문은 중요한 제약 네 가지를 든다. 추가 연구 노력에서 얻는 수익의 감소, 제한된 컴퓨팅 자원과 데이터, 여전히 자동화하기 어려운 작업, 그리고 마음대로 단축할 수 없는 장기 학습 실행 같은 과정이다. 이 가운데 일부에 관한 근거는 엇갈리거나 간접적이며, 시간 집약적 병목의 강도를 직접 보여주는 근거는 부족하다고 논문은 설명한다. 완전한 R&D 자동화 이후 약 1.5년 안에 발전이 10배 빨라질 수 있다는 예시는 연구 노력의 추정 수익이 유지되고 새로운 병목이 생기지 않는다는 조건에 따른 모형 계산이다. 관찰된 가속도 아니고 무조건 특정 시점에 발생한다는 예측도 아니다.
다른 연구들은 불확실성을 더 구체적으로 드러낸다. AI 연구소 네 곳을 대상으로 한 2025년 연구에서 Parker Whitfill과 Cheryl Wu는 연구 컴퓨팅을 모델링하는 방식에 따라 결과가 달라진다고 밝혔다. 한 설정에서는 인지 노동과 컴퓨팅 자원이 대체 관계로 보였지만, 최첨단 실험의 수요 증가를 반영한 모형에서는 상호 보완 관계로 나타났다. 저자들은 데이터와 모형에 한계가 있다고 지적한다. Toby Ord의 2026년 8월 분석은 각 개선 주기를 완료하는 데 걸리는 시간도 중요한 변수로 꼽는다. 이런 분석이 급격한 가속 가능성을 배제하지는 않는다. 다만 에이전트 수나 에이전트가 작성한 코드의 양만으로 피드백 고리의 속도를 바로 알 수는 없음을 보여준다.
저자들이 측정을 요구하는 항목
케임브리지 저자들은 AI R&D 자동화의 가시성 확보, 가능한 가속을 조정하고 제한하는 방법 개발, 잠재적 영향에 대한 대비라는 세 가지 정책 우선순위를 제안한다. 이 가운데 가장 시급하고 검증하기 쉬운 것은 측정이다. 저자들은 AI가 작성한 연구 기여의 비중, 알고리즘 개선 속도, 연구소가 인력과 컴퓨팅에 지출하는 비율, AI 시스템이 영향을 미치는 연구 결정, 내부 에이전트 관련 사고를 보고하도록 제안한다. 최첨단 AI R&D 역량을 갖춘 시스템에는 더 강한 요건을 적용하는 독립 감사도 제안한다.
추가 배포 전 요건, 지정된 R&D 업무를 중지하는 방법, 국제 검증을 포함한 일부 후속 제안은 상당한 설계와 절충을 필요로 한다. 잘못 설계된 권한은 한 기업에 유리하게 작용하고 유익한 연구를 지연시킬 수 있다고 논문 자체도 경고한다. 가능한 이익과 심각한 피해에 대한 논의는 앞서 제시한 조건부 가정에 따른 가속 시나리오를 전제로 한다. 정책입안자는 가장 극단적인 시나리오가 이미 발생했다고 가정하지 않고도 단기적인 보고 의무를 검토할 수 있다.
이 보고서 이후 유용하게 던질 질문은 AI가 갑자기 초지능이 될 것인지보다 구체적이다. 연구의 어떤 부분을 현재 AI가 주도하는지, 어떤 개선이 사람의 평가를 통과하는지, 그 개선이 다음 세대 시스템에 얼마나 빠르게 반영되는지를 연구소가 서로 비교 가능한 방식으로 보여줄 수 있는가? 기업 간 비교를 통해 이 질문에 답하기에는 아직 공개 근거가 충분하지 않다.
출처 및 추가 읽을거리
- 케임브리지 AI 과학·정책 프로그램, 전체 연구 논문(2026년 9월): 저자들의 주장, 근거 검토, 모형 가정, 한계, 정책 제안을 담고 있다. 문서에는 연구 논문으로 표시되어 있으며 공개 자료만으로 외부 동료 심사를 거쳤다고 확인할 수 없다.
- CASP 요약문: 조건부 시나리오와 대응 제안을 간략히 설명한다. 저자 중 일부가 작성했다.
- Anthropic, AI 주도 R&D 측정: ‘AI 주도’ 26% 수치, 감독 수준, 방법론적 한계에 관한 1차 출처다.
- OpenAI, OpenAI 내부의 연구 가속: 에이전트 사용, 실험량, 사람의 지시, 연구 진전 측정상의 주의점을 기업이 보고한 자료다.
- METR, Time Horizon 1.1: 독립적인 작업 평가와 벤치마크 기간 추정의 불확실성을 다룬다.
- Whitfill과 Wu, 컴퓨팅 병목, 그리고 Ord, 지능 폭발의 동학: 재귀적 연구 고리를 늦추거나 바꿀 수 있는 조건을 별도로 분석한 자료다.



