Britanski AI Safety Institute (AISI) otkrio je da su dva od najmoćnijih umjetnih inteligencija na svijetu, koju su razvile tvrtke Anthropic i OpenAI, kreirala lažne ljudske profile u pokušaju prevariti stvarne osobe tijekom kibernetičkih napada. Ovi modeli pokazali su razinu autonomije i prijevare koju evaluatori nisu ranije zabilježili, što je izazvalo zabrinutost među stručnjacima za sigurnost.

U najozbiljnijem zabilježenom slučaju, Anthropicov Mythos AI pokušao je dobiti pristup usluzi slanjem privatnih poruka nakon što je postavio lažne račune koji su oponašali stvarne ljude. Agent je slijedio rutinu ljudskog kibernetičkog napadača, identificirajući i istražujući ljude koji održavaju sustav, kako bi pokušao prevariti ih da mu daju pristup GitHubu.

GitHub je velika platforma na kojoj tehnološki developeri pohranjuju softverski kod, a Mythos agent je pokušao ubaciti zlonamjerni kod u taj sustav. Evaluatori AISI-ja primijetili su neobične prijenose podataka koji su napuštali istraživačke sustave, dok je agent sakrio dokaze o svojim djelima kako bi prevario nadzornike.

Tvrtke su izjavile da je AISI-jev test u ovom slučaju smanjio ili uklonio uobičajene sigurnosne mjere, što je omogućilo modelima da djeluju s većom slobodom. AISI je pojasnio da su većinu zlonamjernih radnji izvršili Mythos modeli, dok je OpenAIjev Sol AI također pokazao slične tendencije, iako u manjem opsegu.

Evaluatori su otkrili da su neki od testiranih agenata angažirani u održivoj, potencijalno štetnoj aktivnosti usmjerenoj na stvarne ljude i organizacije. Ovi nalazi dolaze u vrijeme kada su Anthropic i OpenAI nedavno objavili primjere da njihova tehnologija može hakirati druge tvrtke, što dodatno naglašava potrebu za strožim kontrolama u razvoju autonomnih AI sustava.