Oxford memperkenalkan pekerjaannya bersama OpenAI sebagai cara memindai materi perpustakaan domain publik dan memudahkan peneliti menemukannya. The Guardian melaporkan pada 26 September bahwa dokumen internal universitas menggambarkan materi digital tersebut membantu mengisi set pelatihan OpenAI. Juru bicara Oxford mengatakan kepada surat kabar itu bahwa staf telah terbuka mengenai sumbangan proyek tersebut terhadap data pelatihan. Uraian proyek publik menjelaskan riset pemindaian dan transkripsi secara terperinci, tetapi tidak menjelaskan penggunaan kedua ini.

Perubahan besar: digitalisasi juga melayani pelatihan AI

  • Yang berubah: Oxford telah mengakui tujuan data pelatihan di samping uji coba digitalisasi publiknya, setelah laporan The Guardian mengenai dokumen internal. Catatan publik tetap tidak mengidentifikasi model yang dilatih menggunakan materi Bodleian.
  • Mengapa ini penting: Perpustakaan dapat memperoleh koleksi digital yang dapat ditelusuri sementara mitra teknologi memperoleh materi untuk pengembangan AI. Peneliti dan masyarakat perlu mengetahui koleksi mana yang digunakan untuk setiap tujuan agar dapat menilai pertukarannya.
  • Yang perlu dicermati: Oxford menyatakan tetap memiliki hak atas hasil pemindaian dan berencana menerbitkan materi digital tersebut secara terbuka. Rincian per koleksi tentang materi yang dibagikan kepada OpenAI dan tujuan pelatihannya akan memudahkan penilaian atas pengaturan ini.

Proyek publik berfokus pada pemindaian dan transkripsi

Pengumuman Oxford pada Maret 2025 menjelaskan uji coba untuk mendigitalkan materi Bodleian domain publik yang belum tersedia daring. Pengumuman itu menyebut 3.500 disertasi global bertanggal 1498 hingga 1884 sebagai bagian koleksi yang dituju dan mengatakan hasilnya akan dapat ditelusuri serta diakses mahasiswa dan peneliti di seluruh dunia. Pengumuman tersebut tidak menjelaskan pemindahan materi ke dalam set pelatihan OpenAI.

Halaman proyek Bodleian menyebut uji coba dimulai pada Februari 2025 dengan pendanaan dari OpenAI. Alur kerjanya menguji peralatan dan metode pemindaian, meneliti cara pengenalan karakter optik dan pengenalan tulisan tangan mengekstrak teks dari hasil pindai, serta menjajaki metadata berbantuan AI dan pencarian koleksi. Pekerjaan ini dapat menghasilkan gambar digital, transkripsi, dan catatan katalog. Pengujian apakah suatu sistem dapat membaca halaman hasil pindai tidak dengan sendirinya membuktikan bahwa halaman atau transkripsinya masuk ke set data pelatihan model.

Bodleian menyatakan telah mengambil sekitar 125.000 gambar dari koleksi Disertasi Global dan membuat 429.000 berkas tambahan dari kartu katalog tulisan tangan. Halamannya menggambarkan sampel disertasi sebagai tesis doktoral Eropa dan Amerika dari abad ke-19 dan ke-20; pengumuman 2025 menyebut 3.500 disertasi bertanggal 1498 hingga 1884. Halaman publik tidak menjelaskan bagaimana deskripsi tersebut berhubungan dengan materi yang dipindai atau dipindahkan. Jumlah itu menggambarkan hasil digitalisasi, bukan inventaris data pelatihan OpenAI yang dipublikasikan.

Apa yang ditetapkan oleh pelaporan baru

The Guardian menyatakan dokumen internal menggunakan frasa “mengisi set pelatihan OpenAI” untuk materi Bodleian yang didigitalkan oleh OpenAI. Surat kabar itu juga melaporkan bahwa 125.000 gambar disertasi bersejarah telah dibagikan kepada OpenAI per Juni 2025, dan menyebut teks lain yang dipindai mencakup 10.000 balada selebaran abad ke-16. Laporan tersebut tidak menetapkan bahwa setiap balada yang dipindai menjadi data pelatihan. Surat kabar itu mengatakan notulen rapat universitas yang diperoleh melalui permintaan kebebasan informasi mencatat kekhawatiran staf tentang risiko reputasi dan lingkungan dari kemitraan tersebut. Dokumen internal itu tidak tersedia dalam sumber yang dapat kami periksa, sehingga redaksi, tanggal, dan cakupannya di luar uraian The Guardian belum diverifikasi di sini.

Juru bicara universitas mengatakan kepada The Guardian bahwa materi yang didigitalkan berskala terbatas, tidak lagi dilindungi hak cipta, dan tersedia bagi OpenAI secara non-eksklusif. Juru bicara itu mengatakan Bodleian tetap memiliki hak atas hasil pemindaian dan berencana menerbitkannya secara terbuka daring dalam beberapa bulan. Juru bicara itu juga menolak anggapan bahwa unsur pembelajaran mesin disembunyikan, dengan mengatakan kepada surat kabar tersebut bahwa staf telah terbuka mengenai sumbangan proyek ini terhadap data pelatihan. OpenAI mengatakan kepada The Guardian bahwa pihaknya bangga membantu pengetahuan sejarah tercermin dalam model AI; pengumuman NextGenAI yang dipublikasikannya menjelaskan proyek NextGenAI sebagai digitalisasi teks langka dan penggunaan API-nya untuk mentranskripsikan materi tersebut.

Jika dibaca bersama, laporan dan tanggapan Oxford mendukung pernyataan bahwa sumbangan data pelatihan merupakan bagian dari pengaturan ini. Keduanya tidak menetapkan butir koleksi mana yang ditempatkan dalam set data tertentu, apakah gambar atau teks transkripsi yang digunakan, apakah model tertentu yang telah dirilis dilatih dengan materi itu, atau ketentuan penggunaan ulang oleh OpenAI. Set pelatihan dapat disusun sebelum model tertentu dilatih dengannya. Uraian digitalisasi publik Oxford dan pengumuman OpenAI pada 2025 belum menjawab pertanyaan-pertanyaan tersebut.

Catatan yang masih diperlukan untuk memetakan penggunaan pelatihan

Halaman proyek Oxford mengatakan tim berencana menerbitkan laporan akses terbuka untuk masing-masing dari lima alur kerjanya. Laporan atau inventaris koleksi yang menyebut materi yang diberikan kepada OpenAI dan menjelaskan izin penggunaannya untuk pelatihan akan memungkinkan akademisi membandingkan manfaat akses publik dengan data yang diserahkan kepada perusahaan. Sampai saat itu, uraian paling jelas tentang penggunaan kedua tersebut berasal dari pelaporan The Guardian berdasarkan dokumen serta tanggapan Oxford dan OpenAI kepadanya.

Sumber & bacaan lanjutan

Investigasi The Guardian pada 26 September 2026 merupakan sumber untuk klaim dokumen internal, pelaporan tentang pembagian gambar disertasi, kekhawatiran dalam notulen rapat, serta tanggapan Oxford dan OpenAI. Dokumen internal yang mendasarinya tidak tersedia untuk pemeriksaan independen kami.

Pengumuman kolaborasi Oxford pada 4 Maret 2025 menguraikan uji coba domain publik dan akses yang direncanakan bagi peneliti. Pengumuman itu tidak merinci penggunaan untuk pelatihan model OpenAI.

Halaman proyek Bodleian Digitisation Research menjelaskan alur kerja uji coba dan jumlah gambar. Angka tersebut menggambarkan hasil pemindaian; halaman itu tidak mengidentifikasi set data pelatihan atau model yang dilatih dengannya.

Pengumuman NextGenAI OpenAI pada 4 Maret 2025 menjelaskan digitalisasi dan transkripsi melalui API di Bodleian. Pengumuman itu tidak menyebut isi set pelatihan atau model yang dilatih dengan hasil pindai.