Troje bivših istraživača bezbednosti OpenAI-ja zatražilo je od nadzornih tela kompanije da sačuvaju nezavisan bezbednosni rad i razjasne kako zaposleni mogu da dele informacije sa spoljnim evaluatorima. U otvorenom pismu objavljenom 8. oktobra, Tomek Korbak, Jasmine Wang i Mikita Balesni osporavaju opis nedoličnog ponašanja koji je usledio nakon njihovog otpuštanja. OpenAI je rekao TechCrunch-u da je istraga utvrdila obrazac nepravilnog rukovanja istraživačkim informacijama koji je prevazilazio deljenje sa spoljnom grupom za evaluaciju. Pismo i izveštaj TechCrunch-a ne sadrže izvorni zapis istrage niti navode konkretna pravila o kojima je reč.

Pismo iznosi stav troje pogođenih ljudi. Kažu da su verovali da je njihov rad sa spoljnim grupama spadao u njihove poslove i uobičajenu praksu OpenAI-ja. Negiraju da su bili izvor curenja informacija u The Information o navodno slabije nadziranim arhitekturama modela. Te izjave opisuju njihov prikaz događaja, a ne nalaze utvrđene nezavisnom istragom.

Velika promena

  • Šta se promenilo:Istraživači traže da OpenAI-jevi Odbor za bezbednost i zaštitu, Savetodavna grupa za bezbednost i Savetodavni savet za misiju razmotre kako zaposleni mogu da rade sa nezavisnim evaluatorima uz poštovanje poverljivosti.
  • Zašto je važno:Pismo traži da se auditorima i dalje omogući pristup, da se zaštiti mogućnost nadzora modela i utvrde jasna pravila za spoljnu saradnju. Zahtevi obuhvataju informacije koje spoljni evaluatori mogu da dobiju i granice koje zaposleni moraju da poštuju kada ih dele.
  • Šta treba pratiti:Prema prijavljenom odgovoru OpenAI-ja, otpuštanja su usledila zbog kršenja pravila i nisu bila povezana sa iznošenjem bezbednosnih zabrinutosti. U odgovoru koji je preneo TechCrunch ne navode se konkretna pravila niti dokazi na kojima su odluke zasnovane.

Šta istraživači kažu da se dogodilo

Korbak kaže da je bio kontakt za spoljnog evaluatora METR tokom istrage incidenta sa OpenAI agentom u koji je bio uključen Hugging Face. U pismu se navodi da istraga nije imala utvrđen presedan i da su se tada razvijale interne procedure. Kaže da je pokušavao da postupa u skladu sa pravilima koja su važila dok je komunicirao sa spoljnim saradnicima.

Balesni kaže da je radio na međukompanijskim obavezama u vezi sa mogućnošću nadzora nad rezonovanjem modela. Prema pismu, o tom radu je razgovarao sa članovima odbora i rukovodiocima, proverio ga sa nadređenima i uklonio osetljive detalje pre deljenja materijala. Wang kaže da joj je pristup imejlu jednog rukovodioca bio dodeljen zbog zapošljavanja; nakon što je slučajno otvorila osetljivu poruku, odmah je to prijavila i ponovo zatražila od IT službe da joj ukloni pristup. Nijedan od ovih iskaza ne utvrđuje šta je OpenAI-jeva istraga zaključila.

Zahtevi i odgovor kompanije

Pismo iznosi tri preporuke. Prvo, OpenAI treba da ispuni javno obećanje koje istraživači pripisuju Sam Altmanu: da nezavisnim evaluatorima obezbedi stalan pristup. Strahuju da bi otpuštanja mogla da suze saradnju sa METR-om ili drugim auditorima. Drugo, traže od OpenAI-ja i drugih razvijača naprednih modela da izbegavaju promene koje dodatno smanjuju mogućnost nadzora dok bezbednosni rad zavisi od nje. Pismo posebno pominje nadzor nad rezonovanjem po lancu misli; ne dokazuje izmereni pad kod nekog imenovanog modela. Treće, traže od OpenAI-ja da ponovo potvrdi podršku otvorenoj raspravi o bezbednosti i objavi jasne procedure za rad sa spoljnim organizacijama.

OpenAI nije zvanično odgovorio na pismo, prema izveštaju TechCrunch-a od 8. oktobra. Taj medij navodi da je interni memorandum koji mu je dostavljen negirao da su otpuštanja bila odmazda zbog javnog istupanja i podržao preporuke istraživača. Zasebno je portparol rekao TechCrunch-u da je istraga utvrdila obrazac nedoličnog postupanja sa istraživačkim informacijama koji je prevazilazio njihovo deljenje izvan kompanije. TechCrunch kaže da OpenAI nije odgovorio na pitanja o konkretnim pravilima, okolnostima otpuštanja ili zaštiti zaposlenih koji rade sa spoljnim evaluatorima.

Javni zapisi pokazuju načelno slaganje o vrednosti spoljnog bezbednosnog rada, ali i spor oko toga kako su ga ovo troje zaposlenih sprovodili. Pismo ne potvrđuje dozvole ni namere svojih autora, a prijavljene izjave kompanije ne omogućavaju čitaocima da procene navodna kršenja. Nadzorna tela OpenAI-ja i dalje treba da utvrde koja pravila važe za takvu saradnju i kakav pristup će imati nezavisni auditori.

Izvori i dodatna literatura