Kompanije angažuju ljude da upoređuju odgovore modela, objasne šta nije u redu i daju primere boljeg rada. U takvim okolnostima, uglađen odgovor je samo deo onoga što se naručuje. Kupac možda plaća za procenu koju nije dao model koji se testira.

404 Media izveštava da su tri spoljna saradnika na projektima povezanim sa OpenAI-jem opisala pravila koja zabranjuju upotrebu AI-ja, a da su dvojica rekla da im je angažman prekinut zbog takve upotrebe. Mercor, koji je obezbedio dvoje intervjuisanih saradnika, rekao je toj publikaciji da ugovori zabranjuju korišćenje velikih jezičkih modela za obavljanje projektnog rada i da potvrđeno kršenje dovodi do uklanjanja sa projekta. OpenAI nije želeo da komentariše. Nismo videli interna projektna dokumenta ni nezavisno proverili pojedinačne slučajeve.

Korisno pitanje prevazilazi jednu platformu za angažovanje saradnika: kada firma traži nezavisnu ljudsku proveru, kako treba da je razlikuje od zadataka u kojima je pomoć AI-ja poželjna?

Šta se suštinski menja

  • Šta se promenilo: Izveštaji o sporu sa spoljnim saradnicima otkrivaju sukob oko toga šta bi rad na treniranju AI-ja trebalo da pruži: gotove odgovore ili nezavisnu ljudsku procenu.
  • Zašto je važno: Javni probni projekat kompanije Mercor zasniva merenje na stručnom sudu. Zamena rangiranja koje obavljaju ljudi rangiranjem koje generiše model menja ono što se procenjuje, čak i ako je rezultat dobro napisan.
  • Na šta treba obratiti pažnju: Kupci koji naručuju procenu treba da odrede u kojim fazama je potrebna samostalna procena bez pomoći alata. Tu odluku treba jasno navesti u uputstvima za zadatak, kako bi je saradnici videli pre nego što prihvate posao.

Nezavisna procena može biti ono za šta se plaća

AI asistent je koristan kada je zadatak da se brzo izradi prvi nacrt. Postaje problem kada treba dati referentni odgovor ili nezavisno poređenje, a ta razlika se prikriva.

Javni oglas kompanije Mercor za probni projekat procene AI modela u poslovnoj oblasti izuzetno je jasan po tom pitanju. Stručnjaci rešavaju profesionalni zadatak, rangiraju pet pokušaja modela, ocenjuju ih i pišu obrazloženja zasnovana na dokazima. U oglasu piše da nisu dati ni kriterijumi za ocenjivanje ni tačan odgovor, jer se meri stručna procena. Upotreba AI asistenata zabranjena je tokom rešavanja, rangiranja, ocenjivanja i pisanja obrazloženja.

Ovi uslovi opisuju jedan probni projekat. Poređenje zavisi od sopstvene procene stručnjaka; prepuštanje te procene modelu menja eksperiment.

Sintetičke povratne informacije nisu automatski loši podaci

Primamljivo je povezati svaki odgovor za obuku koji je generisao AI sa „kolapsom modela”. To bi prevazilazilo ovde dostupne dokaze. Istraživanje objavljeno u časopisu Nature proučavalo je ciklične režime obuke u kojima generisani podaci zamenjuju podatke iz izvorne raspodele. U tim eksperimentima modeli koji su se sukcesivno obučavali gubili su informacije o osnovnoj raspodeli. To nije istraživanje prijavljenog rada saradnika i ne može nam reći da li je neka konkretna ocena uticala na objavljeni model kompanije OpenAI.

Druga studija kolapsa modela pokazuje zašto je ta razlika važna. Njeni autori su utvrdili da dolazi do kolapsa kada sintetički podaci svake nove generacije zamene izvorne podatke iz stvarnog sveta, dok ga u njihovim eksperimentima nije bilo kada su stvarni podaci ostali, a sintetički podaci svake naredne generacije dodavani uz njih. Rezultat ne dokazuje da je svaka kombinacija bezbedna. Pokazuje da oznaka „generisano pomoću AI-ja” sama po sebi nije dovoljna za dijagnozu; važni su poreklo podataka, način izbora i postupak obuke.

Jasno definišite dozvoljeni način rada

U uputstvima treba navesti koji su alati dozvoljeni, koje faze zahtevaju samostalnu procenu i kako saradnici treba da prijave korišćenu pomoć. U probnom projektu kompanije Mercor nezavisnost se zahteva tokom rešavanja i procenjivanja. Kupci koji naručuju rad uz pomoć AI-ja treba da opišu kakvu stručnu procenu i dalje očekuju od saradnika.

Provera zahteva jednaku pažnju. U izveštaju 404 Media navodi se da je jedan interni dokument upozoravao recenzente da ne koriste alate za otkrivanje AI-ja i opisivao ih kao nepouzdane. To je u skladu sa osnovnim načelom upravljanja: interpunkcija, brzina ili uglađen stil ne dokazuju da je neko koristio model. Recenzent može da proveri da li se obrazloženje poziva na izvorni materijal, da zatraži od saradnika da objasni odluku, uporedi ponovljene prijave i pregleda evidenciju o alatima koju projekat prikuplja zakonito. Nijedan pojedinačni stilski znak ne bi smeo sam da odluči o slučaju saradnika.

Saradnicima je potrebno pravilo na koje mogu da ulože prigovor, a ne igra pogađanja

Spoljni saradnici mogu brzo izgubiti pristup projektu. Zato pouzdan sistem treba unapred da jasno izloži pravila, pre početka plaćenog rada, da razlikuje sumnju na kršenje od potvrđenog kršenja i da saradniku omogući da iznese relevantne dokaze. Ovo je preporuka za pravičan postupak, a ne tvrdnja o pravima prema nekom ugovoru ili zakonu.

Saradnici bi, sa svoje strane, trebalo da zahtev za nezavisnom procenom bez pomoći AI-ja tretiraju kao deo specifikacije proizvoda. Ko smatra da je odobreni alat neophodan može da pita pre upotrebe ili da odbije zadatak. Prikrivena pomoć ne postaje prihvatljiva zato što model dobro piše, baš kao što ni zabranjeni spoljni saradnik ne bi postao prihvatljiv samo zato što je odgovor tačan.

Navedite ko donosi procenu

Javni probni projekat kompanije Mercor izričito definiše šta se isporučuje: nezavisna stručna procena bez pomoći AI-ja. Kupci koji naručuju rad uz pomoć AI-ja treba jednako jasno da opišu koji su alati dozvoljeni i kakvu procenu saradnik mora sam da pruži.