Oxford는 OpenAI와의 협력을 공개 도서관 자료를 스캔해 연구자가 더 쉽게 찾도록 하는 작업으로 소개했다. The Guardian의 9월 26일 보도에 따르면 대학 내부 문서는 디지털화된 자료가 OpenAI의 학습 세트를 채우는 데 도움이 된다고 설명한다. Oxford 대변인은 직원들이 프로젝트가 학습 데이터에 기여한다는 점을 공개적으로 밝혀 왔다고 신문에 말했다. 공개된 사업 설명은 스캔과 전사 연구를 상세히 다루지만, 그 두 번째 용도는 구체적으로 밝히지 않는다.

큰 변화: 디지털화 자료가 AI 학습에도 쓰인다

  • 달라진 점: Oxford는 공개 디지털화 시범 사업과 함께 학습 데이터 제공 목적도 인정했다. 이는 The Guardian이 내부 문서에 관해 보도한 뒤 나온 설명이다. 공개 기록에는 Bodleian 자료로 학습한 모델이 무엇인지 여전히 나와 있지 않다.
  • 중요한 이유: 도서관은 검색 가능한 디지털 컬렉션을 얻고 기술 파트너는 AI 개발에 쓸 자료를 얻을 수 있다. 이러한 교환을 평가하려면 연구자와 대중이 어떤 컬렉션이 각각의 용도로 쓰이는지 알아야 한다.
  • 지켜볼 점: Oxford는 스캔의 권리를 보유하고 디지털화한 자료를 공개할 계획이라고 밝혔다. OpenAI와 공유한 자료가 무엇인지, 어떤 학습 용도로 제공됐는지 컬렉션별로 설명하는 기록이 공개되면 협력 관계를 더 쉽게 평가할 수 있다.

공개된 프로젝트는 스캔과 전사가 목적이다

Oxford가 2025년 3월 발표한 협력 계획은 온라인에서 이용할 수 없었던 공개 저작물인 Bodleian 자료를 디지털화하는 시범 사업을 설명했다. 계획 대상 컬렉션에 1498년부터 1884년까지의 세계 각국 학위논문 3,500편을 명시하고, 결과물을 전 세계 학생과 연구자가 검색하고 이용할 수 있게 하겠다고 밝혔다. OpenAI의 학습 세트로 자료를 넘기는 내용은 담지 않았다.

공개된 Bodleian 프로젝트 페이지는 시범 사업이 2025년 2월 OpenAI의 자금 지원으로 시작됐다고 설명한다. 작업 분야에는 스캔 장비와 방법 시험, 광학문자인식(OCR)과 필기 인식(HTR)이 스캔에서 문자를 추출하는 방식 연구, AI를 활용한 메타데이터와 컬렉션 검색 탐색이 포함된다. 이러한 작업으로 디지털 이미지와 전사문, 목록 기록이 만들어질 수 있다. 시스템이 스캔한 페이지를 읽을 수 있는지 시험했다는 사실만으로 그 페이지나 전사문이 모델 학습 데이터셋에 들어갔다고 단정할 수는 없다.

Bodleian은 세계 학위논문 컬렉션에서 약 12만 5천 장의 이미지를 촬영했고, 손으로 쓴 목록 카드에서 파일 42만 9천 건을 추가로 만들었다고 밝혔다. 프로젝트 페이지는 학위논문 표본을 19~20세기의 유럽 및 미국 박사학위 논문으로 설명한다. 반면 2025년 발표는 1498~1884년의 논문 3,500편을 대상으로 명시했다. 공개 페이지는 이러한 설명이 실제 스캔 또는 이전된 자료와 어떻게 대응하는지 밝히지 않는다. 수치는 디지털화 결과를 나타내며 OpenAI 학습 데이터의 공개 목록은 아니다.

새 보도가 확인해 준 내용

The Guardian은 OpenAI가 디지털화한 Bodleian 자료에 대해 내부 문서가 ‘OpenAI 학습 세트를 채운다’는 표현을 썼다고 전했다. 또한 2025년 6월까지 역사적 학위논문 이미지 12만 5천 장이 OpenAI와 공유됐다고 보도했으며, 스캔된 다른 문헌에는 16세기 브로드사이드 발라드 1만 편이 포함됐다고 밝혔다. 보고서는 스캔한 발라드가 모두 학습 데이터가 됐다고 입증하지 않는다. 신문은 정보공개 청구로 확보한 대학 회의록에 협력 관계의 평판 및 환경 위험에 대한 직원들의 우려가 기록되어 있다고 보도했다. 우리가 확인할 수 있었던 자료에는 해당 내부 문서가 공개되지 않았으므로 The Guardian의 설명을 넘어서는 정확한 표현과 날짜, 범위는 여기서 검증되지 않았다.

대학 대변인은 The Guardian에 디지털화 자료는 규모가 작고 저작권 보호 기간이 끝났으며 OpenAI가 비독점적으로 이용할 수 있다고 말했다. Bodleian은 스캔 자료의 권리를 보유하고 있으며 몇 달 안에 온라인으로 공개할 계획이라고 밝혔다. 대변인은 기계 학습 요소를 숨겼다는 주장도 부인했다. 직원들은 프로젝트가 학습 데이터에 기여한다는 점을 공개적으로 밝혀 왔다고 신문에 말했다. OpenAI는 역사 지식이 AI 모델에 반영되도록 돕게 되어 자랑스럽다고 The Guardian에 전했다. OpenAI가 공개한 NextGenAI 발표는 Bodleian의 희귀 문헌 디지털화와 API를 이용한 전사를 설명한다.

보도 내용과 Oxford의 답변을 종합하면 학습 데이터 제공이 이 협력의 일부라고 말할 수 있다. 하지만 어떤 컬렉션 자료가 어떤 데이터셋에 포함됐는지, 이미지와 전사문 중 무엇이 사용됐는지, 특정 공개 모델이 그 자료로 학습됐는지, OpenAI가 이를 재사용하는 조건이 무엇인지는 확인되지 않았다. 특정 모델을 학습하기 전에 학습 세트를 만들 수도 있다. Oxford의 공개 디지털화 설명과 OpenAI의 2025년 발표만으로는 이 공백이 메워지지 않는다.

학습 용도를 파악하는 데 필요한 기록

Oxford 프로젝트 페이지는 다섯 작업 분야 각각에 관한 공개 보고서를 낼 계획이라고 밝힌다. OpenAI에 제공한 자료와 허용된 학습 용도를 명시한 보고서나 컬렉션 목록이 있으면 학자들은 대중의 접근성 혜택과 기업에 제공된 데이터를 비교할 수 있다. 그때까지 두 번째 용도에 관한 가장 명확한 설명은 The Guardian의 문서 기반 보도와 이에 대한 Oxford 및 OpenAI의 답변이다.

출처 및 더 읽을거리

The Guardian의 2026년 9월 26일 탐사 보도는 내부 문서 관련 주장과 학위논문 이미지의 공유, 회의록에 기록된 우려, Oxford와 OpenAI의 답변을 다룬 출처다. 근거가 된 내부 문서는 우리가 독립적으로 검토할 수 없었다.

Oxford의 2025년 3월 4일 협력 발표에는 공개 저작물 디지털화 시범 사업과 연구자의 이용 계획이 담겨 있다. OpenAI 모델 학습 용도는 구체적으로 명시하지 않았다.

보들리언 도서관 디지털화 연구 프로젝트 페이지는 시범 사업의 작업 분야와 이미지 수를 상세히 설명한다. 수치는 스캔 결과를 나타내며, 페이지는 학습 데이터셋이나 이를 이용해 학습한 모델을 밝히지 않는다.

OpenAI의 2025년 3월 4일 NextGenAI 발표는 Bodleian의 디지털화와 API를 이용한 전사를 설명한다. 학습 세트의 구성이나 스캔 자료로 학습한 모델은 밝히지 않는다.