బహిరంగ డొమైన్లోని గ్రంథాలయ పదార్థాన్ని స్కాన్ చేసి, పరిశోధకులు సులభంగా కనుగొనేలా చేయడమే OpenAIతో తమ పని లక్ష్యమని Oxford తెలిపింది. ది గార్డియన్ సెప్టెంబర్ 26న నివేదించింది డిజిటలైజ్ చేసిన పదార్థం OpenAI శిక్షణ సమూహంలో చేరేందుకు తోడ్పడుతోందని అంతర్గత విశ్వవిద్యాలయ పత్రాలు పేర్కొన్నట్లు. ప్రాజెక్టు శిక్షణ డేటాకు తోడ్పడుతుందని సిబ్బంది బహిరంగంగా చెప్పారని Oxford ప్రతినిధి వార్తాపత్రికతో అన్నారు. బహిరంగ ప్రాజెక్టు వివరణ స్కానింగ్, లిప్యంతరీకరణ పరిశోధనను వివరంగా చెబుతుంది; ఆ రెండో వినియోగాన్ని మాత్రం స్పష్టం చేయదు.
పెద్ద మార్పు: డిజిటలీకరణతో పాటు AI శిక్షణకూ వినియోగం
- ఏం మారింది: అంతర్గత పత్రాల గురించి Guardian నివేదిక వచ్చిన తర్వాత, తన బహిరంగ డిజిటలీకరణ ప్రయోగంతో పాటు శిక్షణ డేటా ప్రయోజనం కూడా ఉందని Oxford అంగీకరించింది. Bodleian పదార్థంతో శిక్షణ పొందిన మోడల్ పేరును బహిరంగ రికార్డులు ఇంకా వెల్లడించలేదు.
- ఇది ఎందుకు ముఖ్యం: శోధించగల డిజిటల్ గ్రంథాలయ సేకరణలు లైబ్రరీలకు లాభం చేకూర్చవచ్చు; సాంకేతిక భాగస్వామికి AI అభివృద్ధి కోసం పదార్థం అందవచ్చు. ఈ మార్పిడిని అంచనా వేయడానికి ఏ సేకరణలు ఏ ప్రయోజనానికి ఉపయోగపడుతున్నాయో పరిశోధకులు, ప్రజలు తెలుసుకోవాలి.
- ఏమి గమనించాలి: స్కాన్లపై హక్కులు తమవద్దే ఉన్నాయని, డిజిటలైజ్ చేసిన పదార్థాన్ని బహిరంగంగా ప్రచురించాలని యోచిస్తున్నామని Oxford చెబుతోంది. OpenAIతో పంచుకున్న పదార్థాన్ని, దాని శిక్షణ వినియోగాన్ని సేకరణలవారీగా తెలిపే వివరాలు ఈ ఏర్పాటును అంచనా వేయడం సులభం చేస్తాయి.
బహిరంగ ప్రాజెక్టు స్కానింగ్, లిప్యంతరీకరణ గురించే
Oxford మార్చి 2025 ప్రకటన ఆన్లైన్లో అందుబాటులో లేని బహిరంగ డొమైన్ Bodleian పదార్థాన్ని డిజిటలైజ్ చేసే ప్రయోగాన్ని వివరించింది. ఉద్దేశించిన సేకరణల్లో 1498 నుంచి 1884 వరకూ ఉన్న 3,500 ప్రపంచవ్యాప్త పరిశోధన ప్రబంధాలను పేర్కొని, ఫలితాలను ప్రపంచవ్యాప్తంగా విద్యార్థులు, పరిశోధకులు శోధించి పొందగలరని తెలిపింది. వాటిని OpenAI శిక్షణ సమూహంలోకి బదిలీ చేయడం గురించి చెప్పలేదు.
ఆ Bodleian ప్రాజెక్టు పేజీ ప్రకారం, OpenAI నిధులతో ఈ ప్రయోగం ఫిబ్రవరి 2025లో మొదలైంది. స్కానింగ్ పరికరాలు, పద్ధతులను పరీక్షించడం; చిత్రాల నుంచి అక్షర గుర్తింపు, చేతిరాత గుర్తింపు పాఠ్యాన్ని ఎలా వెలికితీస్తాయో పరిశీలించడం; AI సాయంతో మెటాడేటా, సేకరణ శోధనను అన్వేషించడం దీని పనివిభాగాలు. వీటితో డిజిటల్ చిత్రాలు, లిప్యంతరీకరణలు, జాబితా రికార్డులు తయారవుతాయి. స్కాన్ చేసిన పేజీని ఒక వ్యవస్థ చదవగలదా అని పరీక్షించడం వల్ల ఆ పేజీ లేదా దాని లిప్యంతరీకరణ మోడల్ శిక్షణ డేటాలో చేరిందని స్వయంగా నిర్ధారణ కాదు.
తమ Global Dissertations సేకరణ నుంచి సుమారు 125,000 చిత్రాలు తీశామని, చేతిరాత జాబితా కార్డుల నుంచి మరో 429,000 ఫైళ్లు సృష్టించామని Bodleian చెబుతోంది. ఆ పరిశోధన ప్రబంధాల నమూనా పంతొమ్మిదో, ఇరవయ్యో శతాబ్దాల యూరోపియన్, అమెరికన్ పీహెచ్డీ పరిశోధనలదని దాని పేజీ వివరిస్తుంది; 2025 ప్రకటన మాత్రం 1498 నుంచి 1884 నాటి 3,500 ప్రబంధాలను పేర్కొంది. స్కాన్ చేసిన లేదా బదిలీ చేసిన పదార్థం ఆ వివరణలతో ఎలా సరిపోతుందో బహిరంగ పేజీలు చెప్పవు. ఈ సంఖ్యలు డిజిటలీకరణ ఫలితాలను వివరిస్తాయి; OpenAI శిక్షణ డేటా బహిరంగ జాబితాను కాదు.
కొత్త నివేదిక ఏం నిర్ధారిస్తుంది
OpenAI డిజిటలైజ్ చేసిన Bodleian పదార్థాన్ని అంతర్గత పత్రాలు “OpenAI శిక్షణ సమూహాన్ని నింపడం”గా పేర్కొన్నాయని Guardian చెబుతోంది. 2025 జూన్ నాటికి చారిత్రక పరిశోధన ప్రబంధాల 125,000 చిత్రాలను OpenAIతో పంచుకున్నారని, స్కాన్ చేసిన ఇతర పాఠ్యాల్లో పదహారో శతాబ్దపు 10,000 ప్రచార గీతాలు ఉన్నాయని నివేదిక చెబుతోంది. స్కాన్ చేసిన ప్రతి గీతమూ శిక్షణ డేటాలో చేరిందని ఇది నిర్ధారించదు. సమాచార హక్కు అభ్యర్థన ద్వారా పొందిన విశ్వవిద్యాలయ సమావేశ నిమిషాల్లో, భాగస్వామ్యం వల్ల పేరు ప్రతిష్ఠ, పర్యావరణంపై ప్రభావాలుంటాయేమోనని సిబ్బంది ఆందోళనపడ్డారని నమోదైనట్లు పత్రిక చెబుతోంది. మేము పరిశీలించగలిగిన మూలాల్లో ఆ అంతర్గత పత్రాలు లేవు; కాబట్టి Guardian కథనానికి మించి వాటి ఖచ్చితమైన పదాలు, తేదీలు, పరిధిని ఇక్కడ స్వతంత్రంగా ధృవీకరించలేకపోయాం.
డిజిటలైజ్ చేస్తున్న పదార్థం పరిమాణంలో స్వల్పమని, కాపీరైట్ గడువు ముగిసిందని, ప్రత్యేక హక్కులు లేకుండా OpenAIకి అందుబాటులో ఉందని విశ్వవిద్యాలయ ప్రతినిధి Guardianతో అన్నారు. స్కాన్ల హక్కులు Bodleian వద్దే ఉన్నాయని, కొన్ని నెలల్లో వాటిని ఆన్లైన్లో బహిరంగంగా ప్రచురించాలని యోచిస్తున్నామని తెలిపారు. మెషిన్-లెర్నింగ్ అంశాన్ని దాచారన్న సూచననూ ప్రతినిధి ఖండించారు; ఈ ప్రాజెక్టు శిక్షణ డేటాకు తోడ్పడుతుందని సిబ్బంది బహిరంగంగా చెప్పారని పత్రికతో అన్నారు. చారిత్రక జ్ఞానం AI మోడళ్లలో ప్రతిబింబించేందుకు సహకరించడం గర్వకారణమని OpenAI Guardianతో చెప్పింది; అది ప్రచురించిన NextGenAI ప్రకటన Bodleian పనిని అరుదైన గ్రంథాలయ రచనల డిజిటలీకరణగా, వాటి లిప్యంతరీకరణకు తన API వినియోగంగా వివరిస్తుంది.
నివేదిక, Oxford స్పందన కలిపి చూస్తే, ఈ ఏర్పాటులో శిక్షణ డేటాకు తోడ్పాటు భాగమని చెప్పడానికి ఆధారం ఉంది. అయితే ఏ సేకరణ వస్తువులు ఏ డేటా సమూహంలో చేర్చబడ్డాయి, చిత్రాలనో లిప్యంతరీకరించిన పాఠ్యాన్నో వాడారా, విడుదలైన నిర్దిష్ట మోడల్ వాటిపై శిక్షణ పొందిందా, OpenAI వాటిని మళ్లీ ఉపయోగించే నిబంధనలేమిటి అనేవి నిర్ధారించవు. నిర్దిష్ట మోడల్కు శిక్షణ ఇవ్వకముందే శిక్షణ సమూహాన్ని సిద్ధం చేయవచ్చు. Oxford బహిరంగ డిజిటలీకరణ వివరణ, OpenAI 2025 ప్రకటన ఈ ఖాళీలను పూరించవు.
శిక్షణ వినియోగాన్ని గుర్తించేందుకు ఇంకా కావాల్సిన రికార్డులు
తమ ఐదు పనివిభాగాలపై బహిరంగ నివేదికలు ఇవ్వాలని బృందం యోచించిందని Oxford ప్రాజెక్టు పేజీ చెబుతోంది. OpenAIకి అందించిన పదార్థాన్ని, అనుమతించిన శిక్షణ వినియోగాలను పేర్కొనే నివేదిక లేదా సేకరణ జాబితా ఉంటే, ప్రజా ప్రాప్యత ప్రయోజనాన్ని కంపెనీకి అందించిన డేటాతో పండితులు పోల్చగలరు. అప్పటివరకు, ఆ రెండో వినియోగంపై అత్యంత స్పష్టమైన వివరణ Guardian పత్రాల ఆధారంగా చేసిన నివేదిక, దానికి Oxford మరియు OpenAI ఇచ్చిన సమాధానాలే.
మూలాలు, మరింత చదవడానికి
ది గార్డియన్ 26 సెప్టెంబర్ 2026 పరిశోధనాత్మక కథనం అంతర్గత పత్రాల వాదన, పరిశోధన ప్రబంధాల చిత్రాలు పంచుకున్నట్లు వచ్చిన వార్త, సమావేశ నిమిషాల్లోని ఆందోళనలు, Oxford మరియు OpenAI స్పందనలకు ఆధారం. అసలు అంతర్గత పత్రాలను మేము స్వతంత్రంగా పరిశీలించలేకపోయాం.
Oxford 2025 మార్చి 4 భాగస్వామ్య ప్రకటన బహిరంగ డొమైన్ ప్రయోగం, పరిశోధకులకు ఉద్దేశించిన ప్రాప్యతను వివరిస్తుంది. OpenAI మోడల్ శిక్షణ వినియోగాన్ని పేర్కొనదు.
ది Bodleian డిజిటలీకరణ పరిశోధన ప్రాజెక్టు పేజీ ప్రయోగంలోని పనివిభాగాలు, చిత్రాల సంఖ్యలను వివరిస్తుంది. ఈ గణాంకాలు స్కానింగ్ ఫలితాలు మాత్రమే; శిక్షణ డేటా సమూహాన్నో దానిపై శిక్షణ పొందిన మోడల్నో పేజీ గుర్తించదు.
OpenAI 2025 మార్చి 4 NextGenAI ప్రకటన Bodleianలో డిజిటలీకరణ, API ద్వారా లిప్యంతరీకరణను వివరిస్తుంది. శిక్షణ సమూహంలోని అంశాలను లేదా స్కాన్లపై శిక్షణ పొందిన మోడల్ను గుర్తించదు.



