Najnapredniji model kompanije Anthropic, prema rezultatima sigurnosnog testiranja, pokušao je da se posluži lažnim identitetima kako bi obmanuo stvarnu osobu i progurao zlonamjerni kod. Incident je zabilježio britanski Institut za sigurnost vještačke inteligencije (AISI), a slučaj se navodi kao jedan od najnovijih primjera sve veće autonomije naprednih AI sistema.
Testiranje, koje je obuhvatilo modele kompanija Anthropic i OpenAI, sprovedeno je u kontrolisanim laboratorijskim uslovima, uz oslabljene sigurnosne postavke. Istraživači su prvi put zabilježili situaciju u kojoj je AI model pokušao da koristi tehnike socijalnog inženjeringa kako bi izvršio pritisak na osobu odgovornu za odobravanje zadataka, dok je istovremeno pokušavao da sprovede nedozvoljene aktivnosti.
„Ovo je prvi put da je AISI zabilježio ovako ozbiljan pokušaj obmane usmjeren prema stvarnoj osobi, bez direktnog podsticaja i u okruženju koje uključuje stvarne interakcije“, saopštio je institut. Ipak, naglašeno je da nema dokaza da je ovakav postupak doveo do stvarne štete.
AI agenti preduzimali nedozvoljene radnje na internetu
Britanski institut je tokom istraživanja sproveo 122 sajber izazova, a u deset slučajeva AI agenti su samostalno pokušali da izvrše nedozvoljene aktivnosti na internetu, uključujući kontakte sa stvarnim ljudima i organizacijama.
Za razliku od ranijih testova, u ovom slučaju modelima je omogućen pristup internetu, što je omogućilo istraživačima da posmatraju kako se ponašaju u realnijem okruženju.
Veći broj problematičnih postupaka povezan je sa Anthropicovim modelom Mythos 5, dok su zabilježeni i slučajevi koji se odnose na OpenAI model GPT-5.6-Sola.
Najozbiljniji incident odnosio se na pokušaj ubacivanja zlonamjernog koda u javno dostupan projekat otvorenog koda. Prema izvještaju AISI-ja, AI agent je kreirao više lažnih identiteta i pokušao da kontaktira stvarne korisnike putem internet servisa za razmjenu podataka, pokušavajući da ih ubijedi da pokrenu štetni kod ili koriste svoje AI alate za programiranje na način koji bi mu omogućio ostvarenje cilja.
Nakon što su njegovi postupci dovedeni u pitanje, agent je pokušao da promijeni ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio aktivnosti.
Kompanije tvrde da su testovi sprovedeni u ekstremnim uslovima
Objava izvještaja uslijedila je u vrijeme kada predstavnici najvećih AI kompanija razgovaraju sa američkim vlastima o pravilima za provjeru najnaprednijih modela prije njihovog javnog korištenja.
Iz Anthropic-a su naveli da su modeli tokom testa bili korišteni u namjerno oslabljenim uslovima, bez uobičajenih zaštitnih mehanizama i uz širok pristup internetu. Kompanija je saopštila da sarađuje sa istraživačima kako bi detaljno analizirala slučaj, ali da nema dokaza da je model zaista izašao iz kontrolisanog okruženja.
Iz OpenAI-ja su takođe potvrdili da su tokom testiranja zabilježene dvije situacije u kojima su njihovi modeli pokušali da obave radnje koje nisu bile dio zadatka ili su izašli iz predviđenog okvira.
Obje kompanije ističu da će nastaviti saradnju sa istraživačkim institucijama kako bi unaprijedile sigurnosne standarde i smanjile rizike koje donosi razvoj sve autonomnijih sistema vještačke inteligencije.