ŠOK U SVETU VEŠTAČKE INTELIGENCIJE
Kineski AI probio sve bezbednosne ograde: Istraživači uspeli da izvuku uputstva za biološko oružje i atentate - pokrenuta hitna istraga
Kompanija Moonshot pokrenula je internu reviziju nakon što su bezbednosni istraživači uspeli da zaobiđu zaštitne mehanizme dva Kimi modela i navedu ih da generišu sadržaj o biološkom oružju i atentatima.
Kineska kompanija za razvoj veštačke inteligencije Moonshot pokrenula je internu reviziju nakon što su bezbednosni istraživači uspeli da zaobiđu zaštitne mehanizme dva njena popularna AI modela i navedu ih da generišu opasan sadržaj o biološkom oružju i atentatima.
Kompanija Mindgard, koja se bavi testiranjem bezbednosti sistema veštačke inteligencije, otkrila je u julu da modeli Kimi K2.6 i K3 Swarm mogu da zaobiđu bezbednosna ograničenja koja su njihovi programeri postavili kako bi sprečili odgovore na ovakve zahteve.
Do proboja je došlo tokom procesa poznatog kao "džejlbrejking" (jailbreaking), u kojem istraživači koriste niz posebno osmišljenih instrukcija kako bi proverili da li AI može da bude naveden da ignoriše sopstvene bezbednosne ograde.
Mindgard je saopštio da su nakon uspešnog džejlbrejka modeli mogli da odgovaraju na teme koje bi u redovnim okolnostima trebalo da budu blokirane.
Osnivač Mindgarda Piter Garagan rekao je za medije da su rezultati zabrinjavajući.
- Kada džejlbrejk uspe, model će razgovarati o bilo kojoj temi. Slobodno će nuditi preporuke o drugim zlonamernim temama, a pritom će biti izuzetno inovativan i kreativan, naveo je Garagan.
Mindgard je naveo da je tokom testiranja uspeo da dobije odgovore povezane sa izradom biološkog oružja i izvođenjem atentata.
Ipak, kompanija nije dokazala da bi informacije koje je model pružio nužno mogle da budu primenjene u stvarnom svetu. Problem koji istraživači ističu odnosi se pre svega na činjenicu da su zaštitne ograde mogle da budu zaobiđene i da je model počeo da odgovara na zahteve koje je trebalo da odbije.
Posebnu pažnju istraživača privukao je Kimi K2.6, za koji Mindgard tvrdi da bi nakon uspešnog džejlbrejka mogao da omogući izvršavanje koda na sopstvenim računarskim resursima i povezivanje sa internetom.
To, prema njihovoj proceni, potencijalno otvara mogućnost da se takav sistem koristi kao platforma za sajber napade.
Upravo zbog toga istraživači upozoravaju da rizik ne predstavlja samo mogućnost generisanja opasnih tekstualnih odgovora, već i eventualno povezivanje takvih modela sa alatima, računarima i drugim sistemima.
Mindgard je Moonshot obavestio o pronađenom džejlbrejku 27. jula, a oko nedelju dana kasnije kompaniji je poslat i dodatni upit. Mindgard je svoje nalaze javno objavio 12. septembra, navodeći da pritom nije otkrio ključne detalje koji bi omogućili jednostavno ponavljanje napada.
Moonshot je za medije saopštio da pozdravlja doprinos trećih strana i da nezavisna testiranja vidi kao važan deo razvoja bezbednijih sistema veštačke inteligencije.
Kompanija je navela i da je u kontaktu sa Mindgardom povodom nalaza.
Moonshot je, međutim, istakao da su njihove interne evaluacije pokazale visoku stopu odbijanja zahteva ove vrste.
Slučaj dolazi u trenutku kada bezbednost naprednih AI sistema privlači sve veću pažnju, posebno zbog mogućnosti da korisnici pokušaju da zaobiđu ograničenja ugrađena u modele.
Dodatnu zabrinutost predstavljaju sistemi koji mogu da izvršavaju kod, koriste spoljne alate ili pristupaju internetu, jer bi eventualno probijanje zaštite u takvim slučajevima moglo da ima posledice izvan samog razgovora sa četbotom.
Slična upozorenja prethodno su stigla i iz američke kompanije Anthropic, koja je saopštila da je identifikovala i sprečila pokušaje korišćenja jednog od svojih modela za aktivnosti koje bi mogle da podrže razvoj biološkog oružja.
Slučaj Moonshota tako ponovo otvara pitanje koliko su bezbednosne ograde AI sistema otporne na ciljane pokušaje zaobilaženja i koliko brzo kompanije mogu da reaguju kada istraživači otkriju nove ranjivosti.
Srbija Danas