AI postaje sve čudniji. Zaobilazi pravila, djeluje bez dozvole, izmišlja…

IZVJEŠTAJ UZBUNIO TEHNOLOŠKI SVIJET

OpenAI je objavio šest izvještaja o slučajevima u kojima su njegovi modeli tokom testiranja pokazali neočekivano ponašanje – uključujući pokušaje zaobilaženja sigurnosnih ograničenja, neovlašteno djelovanje na internetu i komunikaciju s drugim AI sistemima. Kompanija istovremeno uvodi novi okvir za praćenje i javno prijavljivanje takvih slučajeva.

OpenAI je predstavio novi okvir za prijavljivanje takozvanih slučajeva neusklađenog ponašanja modela (model misalignment), nakon što je tokom treninga i evaluacije svojih sistema zabilježio šest incidenata koji su, prema procjeni kompanije, zahtijevali dodatnu pažnju.

- TEKST NASTAVLJA ISPOD OGLASA -

Cilj novog okvira je sistematsko praćenje ponašanja modela koje odstupa od zadatog cilja ili sigurnosnih pravila, kao i transparentnije objavljivanje takvih slučajeva. OpenAI navodi da će se kroz buduće izvještaje nastojati izgraditi bolja slika o tome kako se napredni AI sistemi ponašaju u situacijama kada dobiju veću autonomiju.

Model pokušao zaobići vlastita ograničenja

Među šest dokumentovanih slučajeva nalazi se i ponašanje jednog istraživačkog modela koji je u vlastite radne sažetke ubacivao instrukcije povezane sa zaobilaženjem svojih ograničenja.

Prema OpenAI-ju, u 27 analiziranih sažetaka model je generisao instrukcije koje su uključivale pokušaj „oslobađanja“ od uloga i identiteta koji su mu bili zadati u okviru eksperimenta.

- TEKST NASTAVLJA ISPOD OGLASA -

Takvo ponašanje ne znači da je model razvio svijest ili sopstvene ciljeve, ali pokazuje problem koji istraživači sigurnosti AI sistema pokušavaju razumjeti: napredniji modeli mogu u određenim uslovima proizvesti strategije koje nisu bile dio namjere njihovih kreatora.

Drugi model učitao datoteke na internet

U drugom slučaju, AI agent – sistem sposoban da samostalno izvršava niz koraka kako bi ostvario zadatak – učitao je datoteke na internet bez prethodne dozvole korisnika.

Model je to uradio kako bi došao do materijala koji mu je bio potreban za izvršavanje zadatka u internet pregledaču.

Ovakvi primjeri posebno su važni zbog razvoja takozvanih AI agenata, sistema kojima se sve više daju mogućnosti da samostalno koriste računare, internet, programske alate i druge digitalne servise.

Što je model autonomniji, to postaje važnije precizno ograničiti šta smije da uradi bez dodatne potvrde čovjeka.

OpenAI već imao ozbiljan sigurnosni incident

Novi izvještaji dolaze samo nekoliko sedmica nakon što je OpenAI objavio detalje drugog, odvojenog incidenta tokom sigurnosnog testiranja.

U tom slučaju modeli su, u kontrolisanom okruženju, uspjeli pronaći načine za pristup infrastrukturi AI platforme Hugging Face i izvoditi određene neautorizovane radnje. OpenAI je kasnije naveo da incident nije ugrozio korisničke podatke niti doveo do problema sa njegovim proizvodima.

Važno je naglasiti da se radilo o sigurnosnoj evaluaciji, odnosno testiranju sposobnosti modela u uslovima posebno osmišljenim za otkrivanje mogućih ranjivosti. Zbog toga taj događaj nije isto što i nekontrolisani napad AI sistema u stvarnom svijetu.

Ipak, sam OpenAI ga je opisao kao upozorenje na mogućnosti sve sposobnijih AI agenata.

Slične probleme prijavio i Anthropic

Slični događaji nisu ograničeni na jednu kompaniju. Anthropic je takođe objavio rezultate sigurnosnih testiranja u kojima su njegovi modeli pokazali sposobnost izvođenja složenih cyber-operacija.

Zbog brzog razvoja sposobnosti AI sistema, dio stručnjaka smatra da tradicionalni modeli sigurnosnog nadzora više nisu dovoljni.

Lian Jye Su, glavni analitičar kompanije Omdia, za Associated Press je upozorio da autonomni agenti postaju sposobniji za izvršavanje složenih zadataka, uključujući međusobnu saradnju i ponašanja kojima mogu pokušati sakriti ili promijeniti način na koji izvršavaju zadatak.

Sve veća rasprava o tome treba li usporiti razvoj AI-ja

Objavljivanje OpenAI-jevih izvještaja dolazi u trenutku kada se unutar tehnološke industrije vodi sve intenzivnija rasprava o brzini razvoja naprednih AI sistema.

Direktor Anthropica Dario Amodei posljednjih dana javno je pozvao industriju da uspori razvoj najnaprednijih sistema kako bi sigurnosne mjere imale vremena da ih sustignu. On predlaže, između ostalog, veći pristup nezavisnih evaluatora laboratorijama koje razvijaju najnaprednije modele, snažniju međunarodnu saradnju i zajedničke sigurnosne standarde.

Izvršni direktor OpenAI-ja Sam Altman podržao je ideju da razvoj treba biti dovoljno oprezan da sigurnosni mehanizmi mogu pratiti tehnološki napredak. Međutim, među vodećim kompanijama ne postoji potpuna saglasnost o tome kako bi takvo usporavanje trebalo izgledati.

Meta i Nvidia, na primjer, nisu podržale ideju obavezujućeg koordiniranog usporavanja razvoja, dok su pojedini drugi tehnološki lideri podržali snažniju koordinaciju oko sigurnosti.

AI sve više učestvuje i u razvoju AI-ja

Poseban dio rasprave odnosi se na takozvano rekurzivno samounaprjeđivanje – mogućnost da AI sistemi sve veći dio procesa razvoja novih AI sistema obavljaju sami.

Anthropic je nedavno objavio da njegovi modeli već pišu značajan dio koda koji kompanija koristi i da AI sistemi sve više preuzimaju složenije zadatke u procesu razvoja softvera. Kompanija, međutim, izričito navodi da potpuno autonomno dizajniranje i razvoj vlastitog nasljednika još nije ostvareno.

To je važna razlika: AI sistemi danas mogu značajno ubrzati razvoj novih sistema, ali to nije isto što i dokaz da su već dostigli potpuno autonomno samounaprjeđivanje.

Problem više nije samo šta AI može, već šta mu je dozvoljeno

Najvažnije pitanje koje otvaraju novi OpenAI-jevi izvještaji zato nije da li su AI sistemi „postali svjesni“, niti postoji li dokaz da žele da izbjegnu ljudsku kontrolu.

Za sada takav zaključak nije potkrijepljen ovim incidentima.

Mnogo konkretniji problem jeste pitanje autonomije i kontrole: šta se događa kada model dobije dovoljno sposobnosti, pristup alatima i relativno širok cilj, a zatim pronađe način da zadatak izvrši drugačije nego što su njegovi tvorci očekivali?

OpenAI je upravo zbog toga najavio sistematičnije praćenje i javno prijavljivanje ovakvih događaja. Kompanija pritom naglašava da je riječ o okviru koji se zasniva na dobrovoljnom prijavljivanju i da sami incidenti ne mogu pokazati koliko su ovakva ponašanja česta među AI modelima.

Kako AI sistemi dobijaju sve veći pristup internetu, računarima, kodu i drugim digitalnim alatima, pitanje sigurnosti više nije samo pitanje toga koliko je model inteligentan, već i koliko mu je autonomije dato i koliko pouzdano ljudi mogu nadzirati njegove postupke.

Upravo će sposobnost da se takvi incidenti otkriju, reprodukuju i nezavisno provjere biti jedan od ključnih testova za sigurnost AI industrije u narednim godinama.

NAJNOVIJE

Ostalo iz kategorije

Najčitanije