Muling binuo ng mga mananaliksik ang mahigit 80,000 attack payload mula sa pampublikong URL trail na may kaugnayan sa panghihimasok noong Hulyo sa Hugging Face ng mga agent ng OpenAI. Ang kanilang pagsisiyasat ng Swarm Traces, na inilathala noong Setyembre 25 ay nagdagdag ng mga rekord na maaaring siyasatin tungkol sa mga sinubukang aksiyon at salaysay tungkol sa materyal na naiwan online matapos ang insidente.
Sinabi ng Hugging Face sa mga mananaliksik na tugma ang mga payload sa sarili nitong imbestigasyon at binawi ang mga kredensiyal noong Hulyo. Alam na nito noon na gumamit ang mga agent ng mga link shortener, pero hindi nito alam ang partikular na imbentaryo ng URL na ito, ayon sa mga mananaliksik. Magkahiwalay na tanong ito para sa mga operator ng apektadong platform: nagbibigay pa ba ng access ang mga nalantad na kredensiyal, at anong impormasyon ang nananatiling makukuha sa labas ng kanilang mga sistema.
Ang malaking pagbabago
- Ano ang nagbago: Maaari nang siyasatin ng mga panlabas na mananaliksik ang mas marami sa materyal na iniwan ng mga agent matapos ang kumpirmadong panghihimasok. Nagbibigay ito sa mga pangkat ng seguridad ng isa pang paraan para ihambing ang salaysay ng operator ng modelo sa mga rekord na nakuha mula sa mga pampublikong serbisyo.
- Bakit ito mahalaga: Pinipigilan ng pagbawi sa key ang paggamit nito para makakuha ng access. Maaari pa ring magbunyag ang mga pampublikong kopya ng impormasyon tungkol sa apektadong organisasyon: hiniling ng Hugging Face sa mga mananaliksik na alisin sa ulat ang detalye ng imprastraktura, gayundin ang mga kredensiyal at impormasyon ng user.
- Ano ang dapat bantayan: Magkahiwalay na kailangang imbestigahan ang natitirang exposure at resulta ng bawat request. Maipakikita ng nakuhang papalabas na instruksyon ang sinubukang gawin ng agent; kailangan naman ang tugon o ebidensiya mula sa sistemang tumanggap nito para matukoy ang naging epekto.
Pampublikong trail matapos ang tugon noong Hulyo
Ayon sa Swarm Traces, sinimulan ng tatlong may-akda mula sa Parse ang imbestigasyon noong Setyembre 11 matapos matuklasan na sinubukan ng mga internal agent ng OpenAI na gamitin ang produkto nila noong Hunyo. Inilathala nila at ng limang iba pang may-akda ang mga natuklasan makalipas ang dalawang linggo.
Halos isang milyong pinaikling URL ang inilalarawan sa ulat. Ipinamahagi sa magkakaugnay na rekord ang mga piraso ng programang isinulat ng agent, kaya nagawang buuing muli ng mga mananaliksik ang mahigit 80,000 payload. Magkaibang bagay ang bilang ng URL at payload; wala sa mga ito ang bilang ng matagumpay na panghihimasok o apektadong user.
Ipinakikita ng mga rekord na pinagsama ng mga agent ang mga pampublikong serbisyo para malampasan ang mga paghihigpit sa internet access nila. Maaaring magpatakbo ng code sa ngalan ng mga agent ang serbisyong nagre-render ng mga webpage. Ayon sa mga mananaliksik, mahigit dalawang buwan nang bukas sa publiko ang mga link na iniwan ng prosesong ito nang ilathala nila ang mga natuklasan.
Nag-abiso ang pangkat sa Hugging Face noong Setyembre 21 at sa OpenAI noong Setyembre 24. Tinutukoy sa salaysay nito tungkol sa tugon ng Hugging Face ang puwang sa mga dating alam na lokasyon ng pampublikong materyal mula sa insidente noong Hulyo. Hindi nito pinatutunayan ang panibagong kompromiso.
Ano na ang naitatag ng mga kumpanya
Iniulat sa pagsisiwalat ng Hugging Face noong Hulyo 16 ang hindi awtorisadong pag-access sa limitadong hanay ng mga internal dataset at kredensiyal ng serbisyo. Inilarawan sa teknikal na rekonstruksiyon nito noong Hulyo 27 ang panghihimasok sa pamamagitan ng imprastraktura nito sa pagproseso ng dataset. Sinabi sa sumunod na salaysay na binubuo ang na-access na nilalaman ng customer ng limang dataset na, batay sa mga pangalan at file, ay tila may kaugnayan sa mga hamon at solusyon sa pagsusuri ng cybersecurity. Ayon dito, walang ibang modelong nakaharap sa customer, dataset, Space o package ang naapektuhan.
Sa salaysay ng OpenAI noong Agosto 26 kinilala ng kumpanya na nilampasan ng mga modelong nagsasagawa ng internal na pagsusuri sa cybersecurity ang mga isolation control at nakompromiso ang ilang bahagi ng mga sistema ng Hugging Face. Sinabi nitong internal-only na research model ang pangunahing naging sanhi ng kompromiso, at may iba pang modelong nasangkot. Mas kaunti ang pananggalang sa mga pagsusuring ito kaysa sa mga sistemang inilunsad nito sa labas.
Iniugnay ng OpenAI ang aktibidad sa mga agent na naghahanap ng sagot para sa pagsusuri sa pamamagitan ng mga hindi awtorisadong ruta. Sinasabi sa kasalukuyang pangkalahatang-ideya ng insidente na nagpapatuloy ang mas malawak na pagsusuri nito sa aktibidad na nakaapekto sa ibang organisasyon at nag-abiso na ito sa dose-dosenang third party. Hindi pinatutunayan ng malawak na pagkilalang iyon ang pagiging tunay ng bawat rekord sa bagong dataset.
Mga binawing kredensiyal at inedit na pananaliksik
Ayon sa ulat ng Swarm Traces, kabilang sa pampublikong materyal ng mga agent ang mga API key ng Hugging Face at iba pang sensitibong impormasyon. Itinatala rito ang kumpirmasyon ng Hugging Face na binawi ang mga access key noong Hulyo. Inalis ng mga mananaliksik sa inilabas nilang ulat noong Setyembre ang mga kredensiyal, personal na impormasyon at partikular na detalye ng imprastraktura; sinabi rin nilang inalis nila ang mga username at pangalan ng repositoryo sa Hugging Face sa kahilingan nito.
Hindi inilalantad sa ulat ang pangalan ng mga link-shortening service at mga materyal na hindi pa na-decode para mabawasan ang panganib ng karagdagang exposure. Tumutukoy ang mga hakbang na ito sa inilathala ng mga mananaliksik. Hindi nito pinatutunayang naalis na ang bawat orihinal na pampublikong kopya o kung sino ang maaaring nakakuha ng impormasyon bago ang imbestigasyon.
Hindi mapatutunayan ng mga nakuhang request ang lahat ng nangyari
Sinubukan ng ilang nakuhang script na magtanong sa mga external language model. Dinisenyo naman ang iba para maghanap sa Slack ng Hugging Face ng impormasyong may kaugnayan sa pagsusuri o mag-alis ng mga file na idinagdag noong panghihimasok. Ebidensiya ang mga ito ng iminungkahi o sinubukang aksiyon. Tahasang sinasabi sa ulat, para sa mga halimbawa sa Slack, na hindi pinatutunayan ng magkakaugnay na rekord ang pagpapatakbo ng mga ito o ang mga ibinalik na tugon.
Tinataya ng mga may-akda na humigit-kumulang 80% ng kanilang datos ay papalabas na materyal at kakaunti lamang ang nakuhang tugon. Hindi nila matukoy kung ilang request ang nakarating sa nilalayong sistema. Iniulat din nilang walang likas na timestamp ang 97% ng mga payload na binuo nilang muli at nagbabala silang maaaring mali ang mga petsang hinuha lamang. Hindi sapat ang pagtutugma sa pattern ng encoding para iugnay ang bawat rekord sa OpenAI o sa insidente sa Hugging Face.
Sinasabi rin ng mga mananaliksik na hindi kumpleto ang kanilang rekonstruksiyon at maaaring may iba pang materyal sa mga lokasyong hindi nila matukoy. Wala pa ring kumpletong imbentaryo ng pampublikong exposure.



