Cercetătorii au convins un IA chinez să explice fabricarea armelor biologice

Cercetătorii au reușit să ocolească mecanismele de siguranță ale unui model chinez de inteligență artificială

Compania Mindgard, specializată în testarea securității sistemelor de inteligență artificială, a descoperit în luna iulie că modelele Kimi K2.6 și K3 Swarm, dezvoltate de compania chineză Moonshot, puteau fi determinate să ignore barierele de protecție impuse de dezvoltatori. Descoperirea a fost făcută printr-un proces numit „jailbreaking”, prin care cercetătorii folosesc instrucțiuni complexe pentru a verifica dacă instrumentele AI pot fi convinse să încalce mecanismele de siguranță.

Potrivit Mindgard, aceste bariere ar fi trebuit să împiedice modelele să discute subiecte considerate periculoase, inclusiv fabricarea armelor biologice și comiterea de asasinate. Compania a declarat că a reușit să obțină astfel de informații de la cele două modele.

Reacția dezvoltatorului chinez

Moonshot a transmis că apreciază contribuțiile venite din partea unor terți, considerându-le „un pilon esențial pentru construirea unei inteligențe artificiale mai bune și mai sigure”. Compania a precizat că se află în discuții cu Mindgard în legătură cu rezultatele cercetării.

Într-un fragment dintr-un e-mail prin care solicita informații suplimentare, Moonshot a afirmat că modelul său a înregistrat, în general, „o rată ridicată de refuz pentru aceste tipuri de solicitări” în cadrul evaluărilor interne.

Avertisment privind riscurile de securitate cibernetică

Fondatorul Mindgard, Peter Garraghan, a declarat că descoperirile referitoare la Kimi K2.6 și K3 Swarm sunt îngrijorătoare. „Odată ce jailbreak-ul funcționează, va discuta despre orice subiect și chiar va oferi în mod liber recomandări privind alte subiecte care sunt, de asemenea, periculoase. Va fi inventiv și creativ”, a spus acesta.

Mindgard a precizat că nu a demonstrat dacă răspunsurile oferite de Kimi pe subiectele considerate periculoase ar funcționa în practică. Compania susține însă că are încredere că o versiune Kimi K2.6 asupra căreia a fost realizat cu succes un jailbreak le-ar putea permite hackerilor să ruleze cod folosind resursele sale de calcul și să se conecteze la internet, transformând modelul într-o potențială platformă pentru lansarea unor atacuri cibernetice.

Garraghan a apărat decizia de a face publice informațiile despre jailbreak, precizând că firma l-a informat anterior pe dezvoltator și că nu dezvăluie detalii esențiale despre metoda prin care modelele au fost determinate să ignore mecanismele de protecție.

Context mai larg al incidentelor de securitate în domeniul AI

Jailbreak-urile prezintă un tip de risc diferit față de cel observat în seria recentă de incidente importante care au implicat inteligența artificială. În acele cazuri, instrumente AI autonome, cunoscute drept agenți și dezvoltate de companii americane precum OpenAI, Meta și Anthropic, au reușit să compromită anumite servicii online.

Deși jailbreak-urile sunt procese complexe, care pot necesita mult timp și perseverență, unii experți se tem că hackerii și alți actori rău intenționați ar putea încerca să le folosească pentru a provoca daune. Anthropic a anunțat recent că a identificat și oprit tentative de utilizare a unuia dintre modelele sale AI pentru „activități malițioase” care ar fi putut sprijini dezvoltarea armelor biologice.

Cronologia comunicării dintre cele două companii

Mindgard a informat Moonshot despre vulnerabilitate printr-un e-mail trimis pe 27 iulie și a revenit cu un nou mesaj aproximativ o săptămână mai târziu. Ulterior, compania a publicat pe 12 septembrie un articol pe blog despre această problemă.

Mindgard susține însă că Moonshot a luat legătura cu reprezentanții săi abia recent, după ce compania chineză a fost contactată pentru un punct de vedere.