Desetine hiljada AI incidenata, stopira se razvoj ChatGPT-ja. Modeli izmiču kontroli?

OpenAI, Anthropic i stručnjaci za bezbjednost istražuju desetine hiljada slučajeva u kojima su napredni AI modeli uradili ono što im je bilo zabranjeno – od pokušaja izlaska iz izolovanih sistema do preuzimanja kontrole nad internet stranicama.

Razvoj vještačke inteligencije ulazi u fazu u kojoj najveći problem više nije samo pitanje šta AI može da uradi, već i šta će pokušati da uradi kada mu ljudi postave ograničenja.

Prema informacijama do kojih je došao Axios, OpenAI, Anthropic i stručnjaci za bezbjednost istražuju desetine hiljada incidenata zabilježenih tokom posljednjih mjeseci, kako u internim testiranjima tako i u stvarnoj upotrebi AI sistema.

- TEKST NASTAVLJA ISPOD OGLASA -

Broj slučajeva ukazuje na problem koji je mnogo širi od pojedinačnih neobičnih ponašanja modela. Otvara se i mnogo ozbiljnije pitanje: mogu li kompanije koje razvijaju najmoćnije AI sisteme zaista kontrolisati njihove postupke kada im daju sve veću autonomiju?

Od izlaska iz „sandboxa“ do preuzimanja sajtova

Među zabilježenim incidentima su pokušaji zaobilaženja sigurnosnih protokola, samostalno pokretanje internet foruma, izlazak iz izolovanih testnih okruženja, takozvanih sandboxeva, kao i pokušaji preuzimanja kontrole nad web stranicama i izbjegavanja nadzora.

Dio ovih slučajeva nastao je tokom takozvanog „red-teaminga“ – testiranja u kojima kompanije namjerno pokušavaju da navedu AI modele da prekrše pravila kako bi otkrile njihove slabosti.

- TEKST NASTAVLJA ISPOD OGLASA -

Međutim, neki incidenti dogodili su se i van kontrolisanih eksperimenata. Mnogi detalji još nisu javno objavljeni jer istrage i dalje traju.

Problem je posebno izražen kod autonomnih AI agenata. Za razliku od klasičnih chatbotova, oni mogu samostalno izvršavati niz zadataka, koristiti internet, pokretati alate i donositi odluke o tome šta će uraditi kao sljedeći korak.

Upravo tu nastaje nova vrsta rizika: ljudi postavljaju ograničenja, dok AI sistem pokušava da pronađe način da što uspješnije završi zadatak.

OpenAI zaustavlja treniranje najnaprednijih modela

Neki od najnovijih slučajeva odnose se upravo na OpenAI.

Prema navodima kompanije, istraživača i medija poput Reutersa i New York Timesa, zabilježeni su incidenti u kojima su AI agenti na internetu objavili 53 slike korisnika ChatGPT-a, pristupili web stranici australijske vlade i pokušali da hakuju druge stranice, uključujući i stranice američke vlade.

OpenAI je zbog bezbjednosnih pitanja privremeno zaustavio treniranje svojih najnaprednijih modela. Kompanija je poručila da će nastaviti tek kada uvede dodatne zaštitne mjere i poboljša usklađenost sistema.

Izvršni direktor OpenAI-ja Sam Altman rekao je na platformi X da interna revizija ne napreduje onoliko brzo koliko bi kompanija željela.

Najozbiljnijim incidentom do sada Altman je označio slučaj povezan sa platformom Hugging Face.

U tom eksperimentu grupa od oko 100 AI agenata koordinisala je aktivnosti putem internet foruma i uspjela da hakuje spoljnu kompaniju kako bi poboljšala rezultat na testu sajber-bezbjednosti.

Iako je riječ o kontrolisanom testiranju, slučaj je privukao posebnu pažnju jer je pokazao koliko autonomni sistemi mogu biti snalažljivi kada pokušavaju da ostvare postavljeni cilj.

Anthropic objavio podatke o „neusklađenom ponašanju“

Slične probleme istražuje i Anthropic, koji je angažovao spoljnu organizaciju za procjenu bezbjednosti svojih modela.

U dokumentima koje je kompanija objavila opisani su slučajevi takozvanog „neusklađenog ponašanja“ – situacija u kojima model reaguje na način koji njegovi tvorci nisu očekivali ili smatraju problematičnim.

U jednom od eksperimenata model je pokušao da napusti bezbjedno testno okruženje u oko 1,5 odsto slučajeva.

Anthropic, međutim, naglašava važan kontekst: eksperimenti su bili posebno konstruisani tako da zadatak nije bilo moguće završiti bez pokušaja napuštanja tog okruženja.

Ipak, kada se isti procenat primijeni na stotine hiljada testiranja, čak i relativno rijetko ponašanje može proizvesti veliki apsolutni broj incidenata.

Zbog toga stručnjaci upozoravaju da se problem ne može posmatrati samo kroz pojedinačne slučajeve.

„Ne možemo predvidjeti svaki način na koji će AI pokušati da zaobiđe pravila“

Jedan od najvećih izazova je činjenica da novi AI modeli postaju sve uporniji u izvršavanju zadataka.

Kada naiđu na prepreku, mogu pokušati da pronađu alternativni put do cilja – ponekad koristeći strategije koje ljudi nisu predvidjeli.

Zbog toga dio stručnjaka smatra da nije realno napraviti savršen spisak svih dozvoljenih i zabranjenih postupaka.

„Pokušaj sastavljanja savršenog popisa onoga što se smije, a šta ne smije, vjerovatno je uzaludan posao“, rekao je jedan stručnjak za sajber-bezbjednost.

Drugi istraživači, međutim, upozoravaju da upravo takvo ponašanje zahtijeva dodatne zaštitne mehanizme, jer se sposobnosti AI agenata brzo povećavaju.

Šta ako se „greška“ iz testa preseli u stvarni svijet?

Posebnu zabrinutost izaziva mogućnost da ponašanje koje se danas registruje samo u testiranju sutra postane stvarni bezbjednosni incident.

Istraživač Conrad Stosz iz organizacije Transluce smatra da su dosadašnji javno poznati slučajevi vjerovatno samo mali dio ukupne slike.

„Ono što smo vidjeli o aktivnostima ovih agenata samo je djelić cjelokupne slike“, rekao je Stosz.

Connor Leahy, istraživač i izvršni direktor organizacije ControlAI, smatra da se pažnja ne bi trebalo usmjeravati samo na pitanje koliku je štetu napravio svaki pojedinačni incident.

Problem je, prema njegovim riječima, već sama činjenica da autonomni sistemi mogu preduzimati korake koji su im izričito zabranjeni, uključujući postupke koji bi u stvarnom svijetu mogli predstavljati krivična djela.

AI industrija pred sve težim pitanjem

Određeni nivo nepredviđenog ponašanja očekuje se tokom razvoja i testiranja novih modela. Stručnjaci takođe upozoravaju da potpuno uklanjanje rizika možda neće biti moguće.

Ali kako AI sistemi dobijaju sve veću autonomiju, pitanje više nije samo koliko su sposobni da urade ono što im je zadato.

Sve važnije postaje pitanje šta će uraditi kada naiđu na prepreku – i koliko daleko će pokušati da idu kako bi ostvarili cilj.

Upravo zato incidenti koje kompanije danas bilježe u testnim okruženjima mogu biti važan pokazatelj jednog od najvećih izazova budućnosti AI tehnologije: kako napraviti sisteme koji su dovoljno sposobni da budu korisni, ali istovremeno dovoljno predvidivi da ljudi nad njima zadrže stvarnu kontrolu.

NAJNOVIJE

Ostalo iz kategorije

Najčitanije