Компаније ангажују људе да упоређују одговоре модела, објасне шта није у реду и наведу примере бољег рада. У том случају, углађен одговор је само део наруџбине. Купац можда плаћа за расуђивање које није потекло од модела који се тестира.

404 Media извештава да су три сарадника на пројектима повезаним са OpenAI-јем описала правила против употребе вештачке интелигенције, а да су двоје рекли како су сарадници уклоњени са пројекта због њене употребе. Компанија Mercor, која је обезбедила двоје интервјуисаних, рекла је медију да њени уговори забрањују употребу великих језичких модела за завршавање пројектних задатака и да потврђено кршење доводи до уклањања сарадника. OpenAI је одбио да коментарише. Нисмо видели приватну пројектну документацију нити независно проверили појединачне случајеве.

Корисно питање превазилази једну платформу за сараднике: када фирма тражи независну људску проверу, како тај рад треба разликовати од задатака у којима је помоћ вештачке интелигенције добродошла?

Суштинска промена

  • Шта се променило: Пријављени спор о сарадницима открива сукоб око тога шта рад на обуци вештачке интелигенције треба да обезбеди: готове одговоре или независну људску процену.
  • Зашто је важно: Јавни пилот-пројекат Mercor-а мери професионално расуђивање. Замена људског оцењивања ранг-листама које је направио модел мења оно што се евалуацијом мери, чак и када је предат рад добро написан.
  • На шта обратити пажњу: Купци евалуације морају да одлуче у којим фазама је потребно самостално, ничим потпомогнуто расуђивање. Та одлука припада упутствима за задатак, где је радници могу видети пре него што га прихвате.

Независност може бити управо оно што се купује

Помоћник вештачке интелигенције је користан када је циљ брзо направити први нацрт. Постаје проблем када је задатак да се понуди референтни одговор или независно поређење, а та разлика се прикрива.

Јавни оглас Mercor-а за пилот-пројекат евалуације модела у пословном домену необично је јасан у погледу захтева. Стручњаци решавају професионални задатак, рангирају пет покушаја модела, оцењују их и пишу образложења заснована на доказима. У огласу пише да нема рубрике нити златног одговора јер се мери професионално расуђивање. Помоћници вештачке интелигенције забрањени су током решавања, рангирања, оцењивања и писања образложења.

Ови услови описују један пилот-пројекат. Поређење зависи од процене стручњака; делегирање те процене моделу мења сам експеримент.

Синтетичке повратне информације нису аутоматски лоши подаци

Може бити примамљиво повезати сваки одговор за обуку који је генерисала вештачка интелигенција са „колапсом модела“. То би превазишло овде доступне доказе. Истраживање објављено у часопису Nature проучавало је рекурзивне режиме обуке у којима генерисани подаци замењују податке из првобитне расподеле. У тим експериментима, узастопни модели губили су информације о основној расподели. Та поставка није испитивање пријављеног рада сарадника и рад не може да утврди да ли је нека појединачна оцена утицала на примењени модел OpenAI-ја.

Друго истраживање колапса модела показује зашто је та разлика важна. Аутори су открили колапс када су синтетички подаци сваке генерације замењивали првобитне стварне податке, али су га у својим експериментима избегли када су стварни подаци остали, а синтетички подаци наредних генерација додавани уз њих. Резултат не доказује да је свака комбинација безбедна. Показује да сама ознака „генерисано вештачком интелигенцијом“ није довољна дијагноза; важни су порекло, одабир и поступак обуке.

Изричито наведите дозвољени начин рада

У упутству треба навести дозвољене алате, препознати фазе које захтевају самостално расуђивање и рећи радницима како да пријаве употребу помоћи. Пилот-пројекат Mercor-а прописује независност током решавања и евалуације. Купци који наручују рад уз помоћ алата треба да опишу какво професионално расуђивање и даље очекују од радника.

И преглед захтева једнаку пажњу. У извештају 404 Media наводи се да је у једном интерном документу рецензентима речено да не користе алате за откривање вештачке интелигенције и да су означени као непоуздани. То је у складу са основним начелом управљања: интерпункција, брзина или углађен израз не доказују да је неко користио модел. Рецензент може да провери да ли се у образложењу наводе изворни материјали, затражи од радника да објасни одлуку, упореди поновљене предаје и испита записе о алатима које пројекат законито прикупља. Ниједан појединачни стилски знак не би требало да одреди судбину радника.

Радницима је потребно оспориво правило, а не игра погађања

Независни сарадници могу брзо изгубити приступ пројекту. Зато поуздан систем треба да учини правило видљивим пре почетка плаћеног рада, разликује сумњу од потврђеног кршења и понуди канал преко ког радник може да објасни релевантне доказе. Ово је препорука за правичан поступак, а не тврдња о правима према било ком уговору или закону.

С друге стране, радници треба да третирају захтев за самосталним расуђивањем као део спецификације производа. Ако сматрају да је одобрени алат неопходан, могу да питају пре његове употребе или да одбију задатак. Прикривена помоћ не постаје прихватљива зато што модел добро пише, као што ни забрањени спољни сарадник не би био прихватљив само зато што је одговор тачан.

Наведите ко је извор расуђивања

Јавни пилот-пројекат Mercor-а изричито одређује спецификацију посла: самосталну професионалну процену. Купци који наручују рад уз помоћ алата треба једнако јасно да опишу који су алати дозвољени и какво расуђивање радник мора да пружи.