AI-translated from English; not yet reviewed by a fluent editor.
# Oxford afirma que a digitalização da Bodleian também fornece dados para o treino da OpenAI
> Oxford afirma que o seu projeto-piloto de digitalização da Bodleian fornece dados para o treino da OpenAI. Registos públicos descrevem a digitalização e a transcrição, mas não identificam os materiais nem os modelos envolvidos.
By BIG CHANGE Editorial
Published: 2026-09-27T01:10:31.965Z
Updated: 2026-09-27T01:10:31.965Z
Canonical: https://bigchange.ai/blog/oxford-bodleian-digitisation-openai-training-data

AI-generated conceptual illustration by BIG CHANGE.
Oxford apresentou o seu trabalho com a OpenAI como uma iniciativa para digitalizar materiais da biblioteca em domínio público e facilitar a sua localização por investigadores. [O Guardian noticiou em 26 de setembro](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) que documentos internos da universidade descrevem o material digitalizado como parte do preenchimento de um conjunto de dados de treino da OpenAI. Um porta-voz de Oxford disse ao jornal que a equipa tinha sido transparente quanto ao contributo do projeto para os dados de treino. A descrição pública do projeto explica detalhadamente o trabalho de digitalização e transcrição, mas não define essa segunda utilização.
## A grande mudança: a digitalização também contribui para o treino de IA
- **O que mudou:** Oxford reconheceu que o seu projeto-piloto de digitalização de materiais públicos também se destina a fornecer dados de treino, na sequência da notícia do Guardian sobre documentos internos. Os registos públicos ainda não identificam qualquer modelo treinado com materiais da Bodleian.
- **Por que isso importa:** As bibliotecas podem disponibilizar coleções digitais pesquisáveis, enquanto um parceiro tecnológico recebe materiais para desenvolver IA. Os investigadores e o público precisam de saber que coleções são utilizadas para cada finalidade, para poderem avaliar esta troca.
- **O que acompanhar:** Oxford afirma que mantém os direitos sobre as digitalizações e planeia disponibilizar os materiais em acesso aberto. Um inventário, coleção a coleção, que identificasse o que foi partilhado com a OpenAI e para que finalidade de treino facilitaria a avaliação do acordo.
## O projeto público trata de digitalização e transcrição
[O anúncio de Oxford, de março de 2025,](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) descreveu um projeto-piloto para digitalizar materiais da Bodleian em domínio público que não estavam disponíveis na Internet. Entre as coleções previstas, mencionou 3 500 dissertações de todo o mundo, datadas de 1498 a 1884, e afirmou que os resultados poderiam ser pesquisados e consultados por estudantes e investigadores de todo o mundo. O anúncio não mencionava qualquer transferência para um conjunto de dados de treino da OpenAI.
A [página do projeto da Bodleian](https://www.bodleian.ox.ac.uk/node/4611321) indica que o projeto-piloto começou em fevereiro de 2025 com financiamento da OpenAI. As várias linhas de trabalho testam equipamentos e métodos de digitalização; analisam como o reconhecimento ótico de caracteres e o reconhecimento de escrita manuscrita extraem texto das imagens; e exploram metadados assistidos por IA e a pesquisa em coleções. Estas tarefas podem produzir imagens digitais, transcrições e registos de catálogo. Testar se um sistema consegue ler uma página digitalizada não demonstra, por si só, que a página ou a respetiva transcrição tenha sido incluída num conjunto de dados para treinar modelos.
A Bodleian afirma ter captado cerca de 125 000 imagens da sua coleção de dissertações de todo o mundo e criado outros 429 000 ficheiros a partir de fichas de catálogo manuscritas. A página descreve a amostra de dissertações como teses de doutoramento europeias e norte-americanas dos séculos XIX e XX; o anúncio de 2025 mencionava 3 500 dissertações datadas de 1498 a 1884. As páginas públicas não explicam como estas descrições correspondem ao material digitalizado ou transferido. Estes números descrevem a produção da digitalização, não um inventário publicado dos dados de treino da OpenAI.
## O que a nova reportagem estabelece
O Guardian afirma que documentos internos utilizam a expressão «preencher o conjunto de dados de treino da OpenAI» para se referirem a material da Bodleian digitalizado pela OpenAI. Relata também que, até junho de 2025, tinham sido partilhadas com a OpenAI 125 000 imagens de dissertações históricas e que outros textos digitalizados incluíam 10 000 baladas impressas do século XVI. A notícia não demonstra que todas as baladas digitalizadas tenham sido incluídas em dados de treino. O jornal afirma que atas de reuniões da universidade, obtidas através de um pedido de acesso à informação, registam preocupações da equipa quanto aos riscos reputacionais e ambientais associados à parceria. Os documentos internos não estão disponíveis nas fontes que conseguimos consultar; por isso, as palavras exatas, as datas e o âmbito além do relato do Guardian permanecem sem verificação independente.
Um porta-voz de Oxford disse ao Guardian que o volume de material digitalizado era modesto, que este estava fora do prazo de proteção por direitos de autor e que seria disponibilizado à OpenAI em regime não exclusivo. Afirmou que a Bodleian manteria os direitos sobre as digitalizações e planeava publicá-las em acesso aberto na Internet dentro de poucos meses. O porta-voz rejeitou também a sugestão de que a componente de aprendizagem automática tivesse sido ocultada e disse ao jornal que a equipa tinha sido transparente quanto ao contributo do projeto para os dados de treino. A OpenAI disse ao Guardian que se orgulhava de ajudar a refletir o conhecimento histórico nos modelos de IA; o seu comunicado publicado sobre o [NextGenAI](https://openai.com/index/introducing-nextgenai/) descreve o trabalho da Bodleian como a digitalização de textos raros e a utilização da sua API para os transcrever.
Em conjunto, a notícia e a resposta de Oxford sustentam a afirmação de que o fornecimento de dados para treino faz parte deste acordo. Não estabelecem que itens de cada coleção foram incluídos em que conjuntos de dados, se foram utilizadas imagens ou transcrições, se algum modelo específico já lançado foi treinado com esses materiais, nem que condições regem a sua reutilização pela OpenAI. Um conjunto de dados de treino pode ser compilado antes de se treinar um modelo específico. A descrição pública da digitalização de Oxford e o anúncio da OpenAI de 2025 não esclarecem estas lacunas.
## Ainda faltam registos para mapear o uso no treino
A página do projeto de Oxford indica que a equipa planeava publicar relatórios de acesso aberto sobre cada uma das cinco linhas de trabalho. Um relatório ou inventário de coleções que identificasse os materiais fornecidos à OpenAI e descrevesse as utilizações permitidas no treino permitiria aos investigadores comparar o benefício do acesso público com os dados fornecidos à empresa. Até lá, o relato mais claro desta segunda utilização continua a ser a investigação do Guardian, baseada em documentos, e as respostas que Oxford e a OpenAI deram ao jornal.
## Fontes e leitura complementar
A [investigação do Guardian, publicada em 26 de setembro de 2026,](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) é a fonte da alegação baseada em documentos internos, da partilha noticiada de imagens de dissertações, das preocupações registadas em atas e das respostas de Oxford e da OpenAI. Os documentos internos subjacentes não estavam disponíveis para verificação independente.
[Anúncio de colaboração de Oxford e OpenAI, de 4 de março de 2025,](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) descreve o projeto-piloto com materiais de domínio público e o acesso previsto para investigadores. Não especifica o uso em treino de modelos da OpenAI.
A [página do projeto de investigação em digitalização da Bodleian](https://www.bodleian.ox.ac.uk/node/4611321) detalha as linhas de trabalho do projeto-piloto e o número de imagens. Os números descrevem a produção da digitalização; a página não identifica um conjunto de dados de treino nem um modelo treinado com estes materiais.
[Anúncio da OpenAI sobre o NextGenAI, de 4 de março de 2025,](https://openai.com/index/introducing-nextgenai/) descreve a digitalização e a transcrição de materiais da Bodleian através da API. Não identifica o conteúdo de qualquer conjunto de dados de treino nem um modelo treinado com estas imagens.
## Sources
- [The Guardian: Oxford permite que a OpenAI treine os seus modelos de IA com materiais da Biblioteca Bodleian](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) — Investigação original, publicada a 26 de setembro de 2026, sobre documentos internos e atas de reuniões da universidade; inclui as respostas de Oxford e da OpenAI. Os documentos internos subjacentes não estavam disponíveis para verificação independente; por isso, a descrição do conjunto de dados de treino e os pormenores da partilha são atribuídos ao Guardian.
- [Oxford e OpenAI lançam colaboração para promover a investigação e a educação](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) — O anúncio de Oxford, de 4 de março de 2025, descreve um projeto-piloto público de digitalização de materiais da Bodleian em domínio público, o acesso previsto para investigadores e uma coleção inicial de dissertações. Não especifica a utilização de dados para treinar modelos.
- [Investigação sobre digitalização da Bodleian](https://www.bodleian.ox.ac.uk/node/4611321) — A página pública do projeto da Bodleian descreve linhas de trabalho sobre digitalização, OCR/HTR, metadados e pesquisa, e apresenta contagens de imagens. São resultados da digitalização, não um inventário publicado dos materiais de treino da OpenAI.
- [OpenAI: Apresentação do NextGenAI](https://openai.com/index/introducing-nextgenai/) — O anúncio da OpenAI, de 4 de março de 2025, descreve a digitalização de materiais da Bodleian e a sua transcrição através da API. Não identifica um conjunto de dados de treino nem um modelo treinado com estes materiais.
Newsletter BIG CHANGE
A perspetiva geral, ao seu ritmo.
Histórias recentes sobre IA e robótica, mudanças que vale a pena acompanhar e ideias práticas para utilizar. Escolha um briefing diário, um resumo semanal ou uma perspetiva mensal.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
A sua privacidade, a sua escolha.
O armazenamento necessário ajuda a proteger o site e a memorizar as suas escolhas. O Google Analytics opcional permanece desativado até que o autorize. Pode ler todos os artigos utilizando apenas o armazenamento necessário. Detalhes de privacidade