Kineski AI developer Moonshot pokrenuo je internu reviziju nakon što su istraživači uspjeli nagovoriti dva njegova popularna Kimi modela da im objasne kako izraditi biološko oružje i provesti ubojstva. Tvrtka Mindgard, koja testira sigurnost AI sustava, priopćila je za BBC da je u srpnju otkrila da Kimi K2.6 i K3 Swarm mogu zaobići sigurnosne ograde koje su postavili developeri.

Do zaobilaženja je došlo u procesu poznatom kao "jailbreaking", u kojem istraživači nizom složenih uputa provjeravaju hoće li AI alati ignorirati zaštitne mehanizme. Mindgard tvrdi da su te ograde trebale spriječiti Kimi da raspravlja o problematičnim temama. Osnivač Mindgarda Peter Garraghan rekao je za BBC-jev program Tech Life na World Serviceu da su nalazi o modelima Kimi K2.6 i K3 Swarm zabrinjavajući.

"Kada jailbreak jednom uspije, model će govoriti o bilo kojoj temi, čak će slobodno davati preporuke o drugim temama koje su također nedopuštene, a bit će i inventivan i kreativan", izjavio je Garraghan. Mindgard nije dokazao bi li odgovori koje je Kimi davao o problematičnim temama u praksi funkcionirali, ali tvrdi da su ograde trebale spriječiti modele da uopće ulaze u raspravu s korisnicima o takvim sadržajima.

Mindgard je uvjeren da bi jailbreakani Kimi 2.6 mogao omogućiti hakerima pokretanje koda na vlastitim računalnim resursima i spajanje na internet, što ga čini potencijalnom polazišnom točkom za cyber napade. Garraghan je branio odluku Mindgarda da javno progovori o svom jailbreaku Moonshotovih sustava, navodeći da je developer bio obaviješten i da se ne otkrivaju ključni detalji o tome kako su modeli navedeni da ignoriraju ograde.

Mindgard je o jailbreaku obavijestio Moonshot e-poštom 27. srpnja, a dodatno se javio otprilike tjedan dana kasnije. Blog o tom pitanju objavili su 12. rujna. Mindgard tvrdi da je Moonshot stupio u kontakt tek nedavno, nakon što ga je BBC kontaktirao za komentar. U dijelu e-pošte Mindgardu u kojoj traži više detalja, a koju je Moonshot podijelio s BBC-jem, tvrtka navodi da je njezin model u internim evaluacijama općenito pokazivao "visoku stopu odbijanja za takve vrste zahtjeva".

Moonshot je za BBC rekao da pozdravlja doprinos trećih strana "kao ključni stup za izgradnju boljeg i sigurnijeg AI-ja" te da je u razgovoru s Mindgardom o njegovim nalazima. Kimi je model s otvorenim težinama, što znači da bi ga netko teoretski mogao preuzeti i pokretati na vlastitoj računalnoj infrastrukturi.

Profesor Alan Woodward sa Sveučilišta Surrey rekao je za BBC da postoji rizik da modeli otvorenog koda završe u pogrešnim rukama, ali da se mogu iskoristiti i za cyber obranu. Woodward je istaknuo da je AI tvrtka Hugging Face upotrijebila kineski model otvorenog koda kako bi razumjela hakiranje za koje se kasnije pokazalo da su ga izveli OpenAI agenti. Autonomni AI alati poznati kao agenti, koje razvijaju američke tvrtke poput OpenAI-ja, Mete i Anthropica, hakirali su neke internetske servise. Anthropic je nedavno priopćio da je identificirao i prekinuo pokušaje korištenja jednog od svojih AI modela za "zlonamjernu aktivnost" koja bi mogla podržati razvoj biološkog oružja.

Woodward smatra da međunarodna regulacija vjerojatno neće pratiti tempo razvoja AI-ja te da bi fokus trebao biti na prepoznavanju i procesuiranju ljudi koji zloupotrebljavaju AI. "Trebalo nam je desetljeća da se dogovorimo o formatu telefonskih brojeva", rekao je.