Oxford apresentou seu trabalho com a OpenAI como uma iniciativa para digitalizar materiais de domínio público da biblioteca e facilitar sua localização por pesquisadores. O Guardian noticiou em 26 de setembro que documentos internos da universidade descrevem o material digitalizado como parte do preenchimento de um conjunto de dados de treinamento da OpenAI. Um porta-voz de Oxford disse ao jornal que a equipe havia sido transparente sobre a contribuição do projeto para dados de treinamento. A descrição pública do projeto explica em detalhes a pesquisa em digitalização e transcrição, mas não define esse segundo uso.
A grande mudança: a digitalização também serve ao treinamento de IA
- O que mudou: Oxford reconheceu uma finalidade de fornecimento de dados de treinamento junto ao seu projeto-piloto de digitalização pública, depois da reportagem do Guardian sobre documentos internos. Os registros públicos ainda não identificam um modelo treinado com material da Bodleian.
- Por que isso importa: Bibliotecas podem obter coleções digitais pesquisáveis, enquanto um parceiro de tecnologia recebe materiais para desenvolver IA. Pesquisadores e o público precisam saber quais coleções servem a cada finalidade para avaliar essa troca.
- O que acompanhar: Oxford afirma manter os direitos sobre as digitalizações e planeja disponibilizar os materiais digitalizados abertamente. Um inventário, coleção por coleção, do que foi compartilhado com a OpenAI e para qual finalidade de treinamento facilitaria a avaliação do acordo.
O projeto público trata de digitalização e transcrição
O anúncio de Oxford, de março de 2025, descreveu um projeto-piloto para digitalizar materiais da Bodleian em domínio público que não estavam disponíveis on-line. Entre as coleções previstas, citou 3.500 dissertações globais, datadas de 1498 a 1884, e disse que o resultado poderia ser pesquisado e acessado por estudantes e pesquisadores do mundo todo. O anúncio não descreveu uma transferência para um conjunto de treinamento da OpenAI.
A página do projeto da Bodleian informa que o projeto-piloto começou em fevereiro de 2025 com financiamento da OpenAI. As frentes de trabalho testam equipamentos e métodos de digitalização, examinam como o reconhecimento óptico de caracteres e o reconhecimento de escrita manuscrita extraem texto das imagens digitalizadas, e exploram metadados assistidos por IA e a busca em coleções. Essas tarefas podem produzir imagens digitais, transcrições e registros de catálogo. Testar se um sistema consegue ler uma página digitalizada não demonstra, por si só, que a página ou sua transcrição tenha sido incluída em um conjunto de dados para treinamento de modelos.
A Bodleian afirma ter capturado cerca de 125.000 imagens de sua coleção de dissertações globais e criado outros 429.000 arquivos a partir de fichas de catálogo manuscritas. A página descreve a amostra de dissertações como teses de doutorado europeias e americanas dos séculos XIX e XX; o anúncio de 2025 identificava 3.500 dissertações datadas de 1498 a 1884. As páginas públicas não explicam como essas descrições correspondem ao material digitalizado ou transferido. Esses números descrevem a produção da digitalização, não um inventário publicado dos dados de treinamento da OpenAI.
O que a nova reportagem estabelece
O Guardian afirma que documentos internos usam a expressão “preencher o conjunto de treinamento da OpenAI” para se referir a material da Bodleian digitalizado pela OpenAI. Também relata que, até junho de 2025, 125.000 imagens de dissertações históricas haviam sido compartilhadas com a OpenAI e diz que outros textos digitalizados incluíam 10.000 baladas impressas do século XVI. A reportagem não estabelece que todas as baladas digitalizadas tenham virado dados de treinamento. O jornal afirma que atas de reuniões universitárias, obtidas por meio de um pedido de acesso à informação, registram preocupações da equipe com riscos à reputação e ao meio ambiente associados à parceria. Os documentos internos não estão disponíveis nas fontes que conseguimos consultar; portanto, suas palavras exatas, datas e escopo além do relato do Guardian permanecem sem verificação independente.
Um porta-voz de Oxford disse ao Guardian que o material digitalizado era modesto em escala, estava fora de direitos autorais e ficaria disponível à OpenAI de forma não exclusiva. Afirmou que a Bodleian manteria os direitos sobre as digitalizações e planejava publicá-las abertamente on-line em poucos meses. O porta-voz também rejeitou a sugestão de que o componente de aprendizado de máquina tivesse sido ocultado e disse ao jornal que a equipe fora transparente sobre a contribuição do projeto para dados de treinamento. A OpenAI disse ao Guardian que tinha orgulho de ajudar o conhecimento histórico a se refletir em modelos de IA; seu comunicado publicado sobre o NextGenAI descreve o trabalho da Bodleian como digitalização de textos raros e uso de sua API para transcrevê-los.
Em conjunto, a reportagem e a resposta de Oxford sustentam a afirmação de que uma contribuição de dados para treinamento faz parte desse acordo. Não estabelecem quais itens de cada coleção foram incluídos em quais conjuntos de dados, se foram usados imagens ou textos transcritos, se algum modelo específico já lançado foi treinado com eles nem quais condições regem a reutilização pela OpenAI. Um conjunto de treinamento pode ser montado antes de um modelo específico ser treinado. A descrição pública da digitalização de Oxford e o anúncio da OpenAI de 2025 não esclarecem essas lacunas.
Ainda faltam registros para mapear o uso no treinamento
A página do projeto de Oxford informa que a equipe planejava publicar relatórios de acesso aberto sobre cada uma das cinco frentes de trabalho. Um relatório ou inventário de coleções que identificasse os materiais fornecidos à OpenAI e descrevesse seus usos permitidos em treinamento permitiria aos pesquisadores comparar o benefício de acesso público com os dados fornecidos à empresa. Até lá, o relato mais claro desse segundo uso é a apuração do Guardian baseada em documentos e as respostas que Oxford e OpenAI deram ao jornal.
Fontes e leitura complementar
A investigação do Guardian, publicada em 26 de setembro de 2026, é a fonte da alegação baseada em documentos internos, do compartilhamento relatado de imagens de dissertações, das preocupações registradas em atas e das respostas de Oxford e da OpenAI. Os documentos internos subjacentes não estavam disponíveis para nossa inspeção independente.
Anúncio de colaboração de Oxford e OpenAI, de 4 de março de 2025, descreve o projeto-piloto com materiais de domínio público e o acesso previsto para pesquisadores. Não especifica o uso em treinamento de modelos da OpenAI.
A página do projeto de pesquisa em digitalização da Bodleian detalha as frentes de trabalho do projeto-piloto e a quantidade de imagens. Os números descrevem a produção da digitalização; a página não identifica um conjunto de dados de treinamento nem um modelo treinado com esses materiais.
Anúncio da OpenAI sobre o NextGenAI, de 4 de março de 2025, descreve a digitalização e a transcrição pela API na Bodleian. Não identifica o conteúdo de um conjunto de treinamento nem um modelo treinado com as imagens.



