牛津將與 OpenAI 合作的計畫定位為掃描公有領域館藏,並讓研究人員更容易查找。《衛報》於 9 月 26 日報導,牛津大學內部文件指出,數位化資料有助於充實 OpenAI 的訓練資料集。牛津發言人告訴該報,校方人員一直公開說明此計畫會提供訓練資料。公開專案說明詳述掃描與轉錄研究,卻未交代這項額外用途。

重大變化:數位化也用於 AI 訓練

  • 有哪些改變:《衛報》報導內部文件後,牛津承認除了公共數位化試辦計畫外,這項合作也有提供訓練資料的用途。不過,公開資料仍未指出有哪些模型曾以博德利圖書館資料訓練。
  • 為何重要:圖書館能建立可搜尋的數位館藏,科技合作夥伴則取得 AI 開發所需的資料。研究人員與公眾需要知道哪些館藏各自用於何種目的,才能評估這項交換是否合理。
  • 接下來觀察什麼:牛津表示,掃描檔的權利仍由校方保有,並計畫公開數位化資料。若能逐項列出交給 OpenAI 的館藏,以及允許的訓練用途,就更容易評估這項安排。

公開專案聚焦於掃描與轉錄

牛津於 2025 年 3 月發布的公告介紹一項試辦計畫,將尚未在線上公開的博德利圖書館公有領域資料數位化。公告列出預定納入的館藏之一為 3,500 篇全球各地、年代介於 1498 至 1884 年的學位論文,並表示成果將可供全球學生與研究人員搜尋及取用。公告未提及把資料轉入 OpenAI 訓練集。

依據博德利圖書館的專案頁面所述,這項試辦計畫於 2025 年 2 月啟動,資金由 OpenAI 提供。工作項目包括測試掃描設備與方法、研究光學字元辨識及手寫文字辨識如何從掃描影像擷取文字,以及探索 AI 輔助中繼資料與館藏搜尋。這些工作可產生數位影像、轉錄文字與目錄紀錄。測試系統能否讀取掃描頁面,本身並不能證明頁面或其轉錄內容已納入模型訓練資料集。

博德利圖書館表示,團隊已從全球學位論文館藏擷取約 12.5 萬張影像,並從手寫目錄卡另建 42.9 萬個檔案。專案頁面稱,論文樣本為 19 至 20 世紀的歐洲與美國博士論文;2025 年公告則提到 1498 至 1884 年間的 3,500 篇論文。公開頁面未說明這些描述如何對應到已掃描或移交的資料。這些數字呈現的是數位化成果,並非 OpenAI 訓練資料的公開清冊。

新報導證實了什麼

《衛報》指出,內部文件以「充實 OpenAI 訓練集」形容由 OpenAI 數位化的博德利圖書館資料。報導也稱,截至 2025 年 6 月,已有 12.5 萬張歷史學位論文影像分享給 OpenAI,並提到其他掃描資料包括一萬首 16 世紀的單張民謠印刷品。但報導並未證明每一首掃描民謠都成為訓練資料。該報還表示,透過資訊公開申請取得的大學會議紀錄記載了校方人員對合作可能造成聲譽及環境風險的疑慮。我們查閱的資料未包含這些內部文件,因此除《衛報》的描述外,其確切措辭、日期與範圍仍無法獨立核實。

牛津大學發言人告訴《衛報》,數位化資料規模有限、已不受著作權保護,且以非專屬方式提供 OpenAI 使用。發言人表示,博德利圖書館保有掃描檔權利,並計畫在數月內於網路公開。發言人也否認機器學習部分遭到隱瞞,並告訴該報,校方人員一直公開說明專案會提供訓練資料。OpenAI 則告訴《衛報》,很高興能協助 AI 模型呈現歷史知識;其已發布的NextGenAI 公告將博德利圖書館的工作描述為數位化珍稀文本,並使用 OpenAI API 進行轉錄。

綜合《衛報》的報導與牛津的回應,可以確認提供訓練資料是這項合作的一部分。但目前無法確認哪些館藏項目被放入哪些資料集、使用的是影像還是轉錄文字、任何已發布模型是否曾以這些資料訓練,或 OpenAI 可依什麼條件再利用資料。訓練集可能先行整理完成,之後才用來訓練特定模型。牛津的公開數位化說明與 OpenAI 2025 年公告都沒有補上這些資訊缺口。

釐清訓練用途仍需更多紀錄

牛津的專案頁面表示,團隊原計畫為五個工作項目各發布一份公開報告。若報告或館藏清冊能列出提供給 OpenAI 的資料,並說明允許的訓練用途,學者就能比較公共取用的益處與交給公司的資料內容。在此之前,對第二項用途最清楚的說明,仍是《衛報》根據文件所作的報導,以及牛津與 OpenAI 的回應。

資料來源與延伸閱讀

參見《衛報》於 2026 年 9 月 26 日發布的調查報導,其內容涉及內部文件的說法、據報分享論文影像、會議紀錄中的疑慮,以及牛津與 OpenAI 的回應。報導提及的內部文件未提供給我們獨立查閱。

牛津於 2025 年 3 月 4 日發布的合作公告說明公有領域試辦計畫及預定提供研究人員取用的內容,但未提及用於訓練 OpenAI 模型。

資料詳見博德利圖書館數位化研究專案頁面詳述試辦計畫的工作項目與影像數量。頁面數據描述的是掃描成果,未指出任何訓練資料集或以這些資料訓練的模型。

OpenAI 於 2025 年 3 月 4 日發布的 NextGenAI 公告說明博德利圖書館數位化工作及使用 API 轉錄的方式,但未指出訓練集內容或以掃描資料訓練的模型。