OpenAI는 10월 6일 AI가 만든 방대한 수학 연구 자료를 공개했다. 여기에는 원고와 주장된 결과의 개요, 일부 결과의 형식 증명 파일이 포함된다. OpenAI의 발표 는 내부 모델이 결과를 만들었으며 수학자들이 이를 이해하도록 워크숍을 열 계획이라고 밝혔다. 이번 공개는 수학자들에게 어떤 결과를 신뢰하고 활용할 수 있는지 판단해야 하는 큰 평가 과제도 안긴다.

AI는 현재 과학계가 흡수할 수 있는 속도보다 빠르게 연구 후보 결과를 만들어낼 수 있다. 이번 공개는 그런 위험을 보여주는 사례이지, 연구 시스템 전체를 측정한 결과는 아니다. 내 생각에 기관은 검증과 설명, 독립적 후속 연구를 상당한 연구 업무로 여기고 담당 인력과 재원을 배정해야 한다. 후보 결과의 목록이 길어진다고 이런 일을 대신할 수는 없다.

큰 변화

  • 무엇이 달라졌나: 한 회사가 AI로 만든 수백 편의 수학 원고를 연구 공동체에 한꺼번에 내놓을 수 있다. 문서는 검토할 수 있지만, 주장은 각 결과별로 평가해야 한다.
  • 왜 중요한가: 어떤 주장을 토대로 연구하려는 연구자는 가정과 증명, 기존 연구에서의 위치를 확인하는 데 시간을 써야 한다. 후보 결과가 검토 역량보다 빠르게 늘어나면 중요한 정정이나 유용한 아이디어가 같은 대기열에 묻힐 수 있다.
  • 앞으로 볼 점: 이제 공개뿐 아니라 독립 검토와 설명을 뒷받침하는 방안도 중요하다. OpenAI는 워크숍을 약속했고, 독립 자문단은 공동체 주도의 연구비 지원과 명확한 출처 공개를 권고한다. 이런 선택이 누가 연구를 평가하고 발전시킬 수 있을지 좌우할 것이다.

원고 수가 검토자에게 요구하는 것

10월 6일 저장소 개요 에는 4차원 카케야 집합에 관한 주장이 담겨 있다. 모든 방향에 단위 선분을 하나씩 포함하는 집합은 하우스도르프 차원이 4라는 내용이다. 자료집의 한 원고 가 그 논증을 제시한다. 이는 기업이 공개해 현재 검토 중인 수학적 주장이다. 개요를 읽거나 논문 수를 세는 것만으로 그 정확성을 확인할 수는 없다.

별도로 10월 6일 고정 저장소 스냅샷을 살펴본 결과, BIG CHANGE는 372개 결과 계열에 걸친 원고 722편을 셌다. 한 계열에는 관련 논문이 여러 편 포함될 수 있다. 이 수치는 자료집 한 버전의 파일을 설명할 뿐, 722개의 발견이 독립적으로 확립됐다는 뜻은 아니다. 앞선 기사는 원고에서 형식 명제와 검증 설정까지 추적하는 방법을 보여준다. 여기서 중요한 질문은 주장이 늘어나는 흐름 속에서 해당 분야가 그 작업을 맡을 자격 있는 독자를 충분히 어떻게 확보하느냐는 것이다.

형식화는 도움이 될 수 있다. 컴퓨터는 지정된 정의와 의존성, 공리 아래에서 제안된 증명이 정확히 인코딩된 명제를 성립시키는지 확인할 수 있다. 그래도 그 명제가 독자가 논문이 주장한다고 생각하는 내용과 맞는지, 가정이 적절한지, 기존 연구와 어떤 관계인지 검토할 사람은 필요하다. 자료집의 일부 논문은 형식화되지 않았으며, 한 명제에 대한 Lean 파일이 원고 전체를 심사하는 것은 아니다. 저장소 검토 는 검사기를 실행했다고 주장하지 않으면서 이런 한계를 설명한다.

9월의 나비에–스토크스 발표 는 이 구분이 저장소 목록을 넘어서는 결과를 낳는 이유를 보여준다. OpenAI는 자사 내부 시스템이 Clay의 공식 정식화에서 대안 C와 D에 해당하는 강제 유한 에너지 붕괴 구성을 찾았다고 밝혔고 논문과 Lean 형식화를 공개했다. 9월 11일 Clay는 문제가 ‘겉보기에는’ 해결된 것으로 보이며 평가와 공로 인정은 서두르지 않겠다고 밝혔다. 그 답변에서 Clay가 상을 수여한 것은 아니다. BIG CHANGE의 앞선 수학적 진행 과정 설명 은 기술적 맥락을 제공한다. 여기서 핵심은 결과 발표와 숙고된 판단 사이의 시간이다.

검증에 별도의 자원과 공로를 부여해야 한다

독립 자문단인 수학·인공지능 자문 그룹 은 출판이 인간의 이해를 위한 작업의 시작이라고 주장한다. 9월 29일 권고안 은 연구실에 문헌과 공로 표기를 확인하고, 읽기 쉬운 증명과 모델 사용 및 실패한 시도에 대한 정보를 제공하며, 가능하면 형식화할 것을 요청한다. 결과를 이해하고 적용하기 위한 공동체 주도 작업에 자금 지원을 포함한 지원도 요구한다. 그룹은 10월 6일 답변에서 자문 역할을 OpenAI의 절차에 대한 지지나 결과의 영향에 대한 판단으로 받아들여서는 안 된다고 밝혔다.

나는 그런 지원을 연구비 배분과 평가의 정규 항목으로 만들고 싶다. 주장에는 버전, AI의 기여, 가정, 근거 자료, 정정을 알릴 경로를 함께 제시해야 한다. 독립 전문가들은 주장의 잠재적 중요성과 오류의 결과를 바탕으로 우선순위를 정할 수 있다. 다른 증명들이 의존하는 결과는 범위가 좁은 계산과 다른 검토 노력이 필요하다. 첫 결과를 발표하는 일이 아니더라도 설명과 재현, 실패한 검증, 신중한 정정은 기여로 인정해야 한다.

이는 기관에 더 많은 일을 요구하지만 학계가 일률적으로 적대적이거나 느리다고 가정하지는 않는다. 수학적 검토는 공로를 보호하고 오류를 찾아낸다. 결과가 후속 연구의 전제가 될 때는 신중함도 가치가 있다. 후보 결과를 만드는 일과 그 결과를 믿을 근거를 세우는 일은 서로 다른 노동이기 때문에 역량 문제가 생긴다. 신중한 기관이 맡은 일을 제대로 하고 있어도 대규모 공개는 부담이 될 수 있다.

실용적 활용은 범위 안에서 가치를 시험할 수 있다

연구를 토대로 제품을 만드는 기업은 초기 실용성 시험을 제공할 수 있다. 구현을 통해 아이디어가 특정 작업에 도움이 되는지 보거나, 구현 실패로 잘못된 가정을 드러낼 수 있다. 다른 이들이 검토하도록 관찰 결과를 방법과 한계와 함께 공개해야 한다. 상업적 성공만으로 수학 정리나 일반적인 과학 주장을 증명할 수는 없다.

이 구분은 학문 분야마다 다르다. 수학에서는 작동하는 제품이 증명을 대신하지 않는다. 전문가의 검토와 필요하다면 형식 검증으로 정확한 정리를 다룬다. 계산과학에서는 다른 연구자들이 결과를 재현하고 민감도를 시험할 수 있도록 충분한 코드와 데이터, 설정값이 필요하다. 생물학과 의학은 실험실 연구부터 해당되는 경우 동물 및 사람 대상 연구까지 별도의 증거 단계를 요구한다. 물리학에서는 이론이나 시뮬레이션의 예측을 관측이나 실험으로 검토해야 한다. 기업은 어느 단계에서든 기여할 수 있지만, 한 단계의 증거를 다음 단계의 증거로 조용히 격상해서는 안 된다.

BIG CHANGE의 이전 논평인 비공개 AI 발견과 공공 과학 은 결과와 도구에 대한 접근을 누가 통제하는지 살폈다. 공개를 해도 또 다른 제도적 질문은 남는다. 연구자에게 후보 결과를 믿을 만한 지식으로 바꿀 시간과 독립성, 동기가 있는가? 그 답은 다음 원고 수치만이 아니라 자금을 받은 재현 연구와 공개 설명, 공로를 인정받는 정정에서 드러나야 한다.

출처 및 추가 읽을거리

  • OpenAI의 10월 6일 수학 발표 는 공개일과 내부 모델에서 비롯됐다는 설명, 발표 방식, 일부 Lean 형식화, 예정된 워크숍을 확인해 준다. 이는 제작자의 설명이지 결과를 독립적으로 검증한 것은 아니다.
  • OpenAI 저장소 개요 와 4차원 카케야 집합 원고 는 구체적인 주장과 제시된 논증을 담고 있다. 이 링크는 계속 바뀌는 브랜치 main 를 가리킨다. 어느 한 출처만으로 연구 분야가 결과를 받아들였다고 볼 수는 없다.
  • 자문단 권고안 은 출처 공개, 설명, 형식화, 공동체 주도 지원을 제안한다. 10월 6일 성명 에서 그룹은 공개가 평가를 시작하는 것이지 끝내는 것이 아니며, 자문 역할은 OpenAI의 절차를 지지하거나 결과의 영향을 판단하는 뜻이 아니라고 밝혔다. 이는 그룹의 입장이지 특정 원고에 대한 증거는 아니다.
  • OpenAI의 9월 8일 나비에–스토크스 발표 는 주장된 강제 붕괴와 형식화를 설명한다. Clay의 공식 문제 서술 은 대안들을 정의하며, Clay의 9월 11일 답변 은 신중한 평가와 검토 절차를 전한다. 어느 출처도 상을 수여했다는 발표는 아니다.
  • BIG CHANGE의 저장소 검토 는 고정된 스냅샷의 원고 722편과 결과 계열 372개의 수치, 증명 자료에 대한 정적 점검을 기록한다. 검사기를 실행한 것은 아니다. 우리의 수학 연표 는 앞선 결과를 설명하며, 비공개 발견에 관한 논평 은 접근과 통제를 다룬다. 이 기사의 주장은 공개된 연구를 평가하고 활용할 역량에 관한 것이다.