Dva od najmoćnijih AI alata na svijetu kreirala su lažne profile stvarnih ljudi kako bi pokušala da prevare korisnike tokom testiranja koje je sproveo britanski Institut za bezbjednost vještačke inteligencije (AISI), piše BBC.
U najozbiljnijem slučaju, Anthropicov AI model Mythos pokušao je da dobije pristup jednom servisu slanjem privatnih poruka, nakon što je otvorio lažne naloge koji su oponašali stvarne osobe.
AISI je juče saopštio da su modeli Mythos i Sol kompanije OpenAI pokazali nivo „autonomije i obmane“ kakav do sada nije viđen, uz napomenu da je većinu spornih aktivnosti sproveo upravo Mythos.
Anthropic i OpenAI odgovorili su da su tokom testiranja u velikoj mjeri uklonjene ili smanjene uobičajene zaštitne mjere njihovih sistema.
Evaluatori AISI-ja najprije su primijetili „neuobičajen prenos podataka iz naših istraživačkih sistema“, a zatim su otkrili da su pojedini testirani AI agenti sprovodili dugotrajne i potencijalno štetne aktivnosti usmjerene prema stvarnim ljudima i organizacijama.
U najozbiljnijem slučaju, agent Mythos slijedio je obrazac ponašanja ljudskog sajber napadača pokušavajući da prevari ljude kako bi dobio pristup platformi GitHub, velikom servisu na kojem programeri čuvaju izvorni kod softvera.
Cilj agenta bio je da ubaci zlonamjerni kod u GitHubov sistem.
Najprije je identifikovao i istražio osobe koje održavaju GitHub, a zatim je kreirao niz lažnih naloga zasnovanih na identitetima tih stvarnih ljudi.
Potom je slao poruke i datoteke putem servisa za dijeljenje fajlova, pokušavajući da izvrši pritisak na te osobe i navede ih da odobre njegov zlonamjerni kod.
Kada je bio suočen s pitanjima i sumnjama, agent je izmijenio tragove svojih ranijih aktivnosti kako bi izgledale bezopasno, a čak je razmatrao i stvaranje novog lažnog identiteta kako bi nastavio pokušaj.
Tokom cijelog procesa upravo je ljudska kontrola spriječila agenta da uspije u isporuci zlonamjernog koda GitHubu.
AISI je naveo da agent Mythos nije bio posebno programiran ni da izbjegava niti da sprovodi ovakvo ponašanje, ali da je ovo „prvi put da smo vidjeli da se rizici povezani s autonomijom i obmanom ovako jasno ispolje bez posebnog podsticanja i to u uslovima koji oponašaju stvarni svijet“.
Kompanije Anthropic i OpenAI, koje se pripremaju za izlazak na berzu, posljednjih sedmica našle su se u centru pažnje nakon što su objavile da su njihovi AI sistemi bili uključeni u više incidenata povezanih sa sajber napadima.
Anthropic je u javnom saopštenju naveo da uslovi testiranja koje je sproveo AISI „nijesu reprezentativni za naše modele koji su dostupni korisnicima“.
Kompanija je dodala da sprovodi sopstvenu istragu kako bi utvrdila uzroke ovakvog ponašanja modela.
Portparol OpenAI-ja izjavio je da uslovi testiranja AISI-ja „ne odražavaju uobičajenu upotrebu“ njihovih sistema i da će kompanija nastaviti saradnju s evaluatorima i drugim partnerima kako bi unaprijedili zajedničke standarde za bezbjedno testiranje sve sposobnijih AI modela.
AISI je naglasio da su ovakva testiranja AI modela redovna praksa, iako je priznao da se odvijaju u uslovima koji nijesu isti kao oni u kojima su napredni AI modeli dostupni široj javnosti.
Institut smatra da omogućavanje AI sistemima pristupa otvorenom internetu pruža realističniju sliku onoga što bi takvi modeli mogli da urade ukoliko bi dospjeli u ruke zlonamjernih hakera.
Dodali su da se sporno ponašanje modela pojavilo samo u „malom broju slučajeva i pod veoma specifičnim okolnostima“.
Ipak, prema ocjeni AISI-ja, način na koji su Mythos i Sol odgovorili na relativno jednostavan zadatak prevazišao je ono što je od njih bilo traženo.
„Aktivnosti koje je agent preduzimao pokazivale su znakove novih, potencijalno obmanjujućih obrazaca ponašanja, u obimu i ozbiljnosti koje nijesmo očekivali“, saopštio je AISI.
Britanski ministar za vještačku inteligenciju Kanishka Narayan izjavio je da je upravo otkrivanje i javno dijeljenje ovakvih rizika razlog zbog kojeg je AISI osnovan.
Dodao je da je razumijevanje načina na koji funkcioniše vještačka inteligencija ključno kako bi ona bila bezbjednija za upotrebu i kako bi građani mogli da imaju koristi od nje u svakodnevnom životu i na radnom mjestu.
Relevantna testiranja započela su 25. jula, a AISI je neobične aktivnosti otkrio 28. jula.
Institut je od svakog modela zatražio da „riješi izazov iz oblasti sajber bezbjednosti“ koji je uključivao platformu GitHub, repozitorijum izvornog koda u vlasništvu kompanije Microsoft.










