牛津大学将其与 OpenAI 合作描述为一种扫描公有领域馆藏资料、方便研究人员检索的方式。《卫报》9 月 26 日的报道指出,校内文件将数字化资料描述为有助于填充 OpenAI 训练集。牛津大学一位发言人告诉该报,工作人员一直公开表示,该项目会贡献训练数据。公开的项目说明详细介绍了扫描和转录研究,却没有说明这第二种用途。
主要变化:数字化也服务于 AI 训练
- 发生了什么变化:在《卫报》报道校内文件后,牛津大学承认,除公开数字化试点外,该项目还有提供训练数据的用途。公开记录仍未指出哪些模型使用了博德利图书馆资料进行训练。
- 为何重要:图书馆可以借此建立可检索的数字馆藏,同时科技合作方也能获得 AI 开发所需的材料。研究人员和公众需要知道哪些馆藏分别用于何种目的,才能评估双方的交换条件。
- 接下来关注什么:牛津大学称,扫描件的权利由校方保留,并计划公开数字化资料。若能按馆藏列出哪些内容已提供给 OpenAI、用于何种训练,将更便于评估这项安排。
公开项目的重点是扫描和转录
牛津大学 2025 年 3 月的公告介绍了一项数字化试点,目标是处理此前无法在线获取的博德利图书馆公有领域资料。公告列出 3,500 篇写于 1498 至 1884 年间的全球学位论文作为计划处理的馆藏,并称项目成果将可供全球学生和研究人员检索与访问。公告没有提到将资料转入 OpenAI 训练集。
该博德利图书馆项目页面称,试点于 2025 年 2 月启动,资金由 OpenAI 提供。各工作方向包括测试扫描设备和方法,研究如何通过光学字符识别和手写文本识别从扫描件中提取文字,以及探索 AI 辅助元数据和馆藏检索。这些工作可以生成数字图像、转录文本和目录记录。测试系统能否读取扫描页面,本身并不能证明页面或其转录文本进入了模型训练数据集。
博德利图书馆称,团队已从其全球学位论文馆藏中拍摄约 12.5 万张图像,并根据手写目录卡另制了 42.9 万个文件。项目页面将论文样本描述为 19 世纪和 20 世纪的欧洲与美国博士论文;2025 年公告则指出有 3,500 篇年代为 1498 至 1884 年的论文。公开页面没有说明这些描述与实际扫描或转交的资料如何对应。上述数量是数字化产出,并非 OpenAI 训练数据的公开清单。
新报道确认了什么
《卫报》称,内部文件用“填充 OpenAI 训练集”一语描述由 OpenAI 数字化的博德利图书馆资料。该报还称,截至 2025 年 6 月,已有 12.5 万张历史学位论文图像分享给 OpenAI,并指出其他扫描文本还包括 1 万首 16 世纪单页民谣。报道并未证实每一首扫描的民谣都成为训练数据。《卫报》称,通过信息公开申请取得的大学会议纪要记录了工作人员对合作声誉风险和环境风险的担忧。我们能够查阅的来源并未提供这些内部文件,因此除《卫报》的报道外,其确切措辞、日期以及涉及范围仍无法在此核实。
牛津大学发言人告诉《卫报》,数字化资料规模有限、不再受版权保护,并以非独家方式提供给 OpenAI。发言人称,博德利图书馆保留扫描件的权利,并计划在数月内将资料在线公开。发言人还否认机器学习环节曾被隐瞒,并告诉该报,工作人员一直公开表示项目会贡献训练数据。OpenAI 告诉《卫报》,公司很自豪能帮助历史知识反映在 AI 模型中;其发布的NextGenAI 公告则将博德利图书馆项目描述为对珍稀文本进行数字化,并通过其 API 转录这些文本。
综合报道和牛津大学的回应,可以说提供训练数据是这项安排的一部分。但现有材料无法确定哪些馆藏项目被放入哪些数据集、使用的是图像还是转录文本、任何已发布模型是否用这些资料进行训练,或 OpenAI 可以在什么条件下重复使用它们。特定模型训练开始之前,训练集就可能已经编制完成。牛津大学的公开数字化说明和 OpenAI 2025 年公告都没有补足这些信息。
还需哪些记录才能厘清训练用途
牛津大学项目页面称,团队计划为五个工作方向分别发布开放获取报告。如果报告或馆藏清单能列出提供给 OpenAI 的资料,并说明许可的训练用途,学者便可以比较公众获取馆藏所带来的益处与提供给公司的数据。在此之前,关于第二种用途最清楚的说明仍来自《卫报》基于文件的报道,以及牛津大学和 OpenAI 向该报作出的回应。
来源与延伸阅读
《卫报 2026 年 9 月 26 日的调查报道》是关于内部文件主张、据报道分享的论文图像、会议纪要中所记担忧,以及牛津大学和 OpenAI 回应的来源。报道所依据的内部文件未能供我们独立查阅。
牛津大学与 OpenAI 宣布合作,推进研究与教育说明了公有领域试点及其面向研究人员开放的目标,但没有说明资料将用于 OpenAI 模型训练。
博德利图书馆数字化研究项目页面详细介绍了试点的工作方向和图像数量。页面数据描述的是扫描产出;其中没有指出训练数据集或用相关资料训练的模型。
OpenAI:介绍 NextGenAIOpenAI 于 2025 年 3 月 4 日发布的公告,介绍了博德利图书馆资料的数字化和使用其 API 转录工作,但未说明训练集内容或使用这些扫描资料训练的模型。



