オックスフォード大は、パブリックドメインの図書館資料をスキャンし、研究者が見つけやすくする取り組みとしてOpenAIとの事業を紹介してきた。9月26日、ガーディアン紙が報じたところ、大学内部文書はデジタル化資料がOpenAIの学習データセットの構築に役立つと記していた。オックスフォード大の広報担当者は、同紙に対し、事業が訓練データの提供にもつながることを職員は以前から明確に説明していたと述べた。公開プロジェクトの説明はスキャンと文字起こし研究の詳細を示す一方、その二次的な利用目的は明らかにしていない。

大きな変化:デジタル化資料はAIの訓練にも活用

  • 何が変わったか:内部文書に関するガーディアン紙の報道を受け、オックスフォード大は公開デジタル化試験事業に学習データ提供の目的もあると認めた。公開記録からは、ボドリアン資料で訓練されたモデルを特定できない。
  • なぜ重要か:図書館は検索可能なデジタル資料を得られる一方、技術パートナーはAI開発に使う素材を得る。交換の内容を評価するため、研究者や一般市民には、どの資料群がどの目的に使われるのかを知る必要がある。
  • 注目点:オックスフォード大はスキャンの権利を保持し、デジタル化資料を公開する計画だと述べている。OpenAIに何の資料群を共有し、どのような学習目的に用いるのかを資料群ごとに示せば、取り決めをより評価しやすくなる。

公開事業の目的はスキャンと文字起こし

オックスフォード大の2025年3月の発表は、オンラインで利用できなかったパブリックドメインのボドリアン資料をデジタル化する試験事業について説明した。対象候補には1498年から1884年までの世界各地の学位論文3,500点を挙げ、成果を検索可能にし、世界中の学生と研究者が利用できるようにするとした。OpenAIの学習データセットへの提供には触れていない。

このボドリアンの事業ページによると、試験事業はOpenAIの資金提供を受けて2025年2月に始まった。作業ではスキャン機器と手法を検証し、光学文字認識と手書き文字認識がスキャン画像から文字を抽出する方法を調べ、AIを用いたメタデータ付与と資料検索も試している。これらの作業からデジタル画像、文字起こし、目録データが生まれる。スキャンしたページをシステムが読み取れるかを試すだけでは、そのページや文字起こしがモデルの訓練データに入ったことを意味しない。

ボドリアンによると、Global Dissertationsコレクションから約12万5,000点の画像を取り込み、手書きの目録カードからさらに42万9,000件のファイルを作成した。同ページは論文のサンプルを19世紀・20世紀の欧米の博士論文と説明する一方、2025年の発表は1498~1884年の論文3,500点を挙げている。公開ページでは、これらの説明が実際にスキャンまたは移管された資料とどう対応するのか示されていない。数値はデジタル化の成果を表すもので、OpenAIの学習データの公開目録ではない。

新たな報道が明らかにしたこと

ガーディアン紙によると、大学内部文書はOpenAIがデジタル化したボドリアン資料について「OpenAIの学習データセットを構築する」と記していた。また、歴史的な学位論文の画像12万5,000点が2025年6月までにOpenAIと共有されたと報じ、スキャンされたほかの資料には16世紀のブロードサイド・バラッド1万点も含まれていたという。ただし、スキャンしたバラッドすべてが訓練データになったと確認したわけではない。同紙は、情報公開請求で入手した大学の会議議事録に、提携による評判と環境へのリスクを職員が懸念していたと記されていたとも報じた。確認できた資料には内部文書そのものが含まれていないため、正確な文言や日付、ガーディアン紙の説明を超える範囲は未検証だ。

大学の広報担当者はガーディアン紙に、デジタル化する資料は規模が小さく、著作権保護期間が終了しており、非独占的にOpenAIが利用できると述べた。ボドリアンはスキャン画像の権利を保持し、数か月以内にオンラインで公開する計画だという。機械学習の要素を隠していたとの指摘も否定し、事業が訓練データの提供につながることを職員は明確にしていたと説明した。OpenAIも歴史的知識をAIモデルに反映させる支援を誇りに思うと同紙に述べている。同社が公開したNextGenAIの発表では、ボドリアンの希少資料をデジタル化し、自社APIで文字起こしすると説明している。

報道とオックスフォード大の回答を合わせると、訓練データの提供がこの取り決めの一部であるとは言える。しかし、どの資料がどのデータセットに含まれたのか、画像と文字起こしのどちらが使われたのか、特定の公開モデルがそれらで訓練されたのか、OpenAIがどの条件で再利用できるのかは分からない。特定モデルの訓練前に学習データセットを組み立てることもできる。オックスフォード大の公開デジタル化説明とOpenAIの2025年発表も、これらの空白を埋めていない。

学習への利用を特定するために必要な記録

オックスフォード大の事業ページによると、チームは5つの作業領域それぞれについて、オープンアクセスの報告書を公開する計画だった。OpenAIに提供した資料を特定し、許可された訓練用途を説明する報告書や資料目録があれば、研究者は一般公開の便益と企業に渡されたデータを比較できる。それまでは、この二次的な利用について最も明確なのは、ガーディアン紙による文書に基づく報道と、同紙に寄せられたオックスフォード大およびOpenAIの回答だ。

出典・関連資料

ガーディアン紙の2026年9月26日の調査記事は、内部文書の主張、学位論文画像の共有、会議議事録に記された懸念、オックスフォード大とOpenAIの回答を報じている。内部文書そのものは独立検証のために入手できなかった。

オックスフォード大の2025年3月4日の協業発表は、パブリックドメイン資料のデジタル化試験事業と研究者向けアクセスを説明する。OpenAIのモデル訓練への利用は明記していない。

ボドリアンのデジタル化研究プロジェクトページは、試験事業の作業領域と画像数を詳述する。数値が示すのはスキャンの成果であり、訓練データセットや、それで訓練したモデルではない。

OpenAIの2025年3月4日のNextGenAI発表は、ボドリアン資料のデジタル化とAPIによる文字起こしを説明する。訓練データセットの内容や、資料で訓練したモデルは特定していない。