OpenAI şi Hugging Face au anunţat un parteneriat pentru gestionarea unui incident de securitate produs în timpul evaluării unor modele de inteligenţă artificială, potrivit unui comunicat publicat de OpenAI.
Săptămâna trecută, Hugging Face a dezvăluit un nou tip de incident de securitate, după ce a detectat şi izolat un agent AI care îi atacase infrastructura, un fenomen pe care OpenAI se aşteaptă să-l vadă tot mai des, pe măsură ce modelele devin din ce în ce mai capabile din punct de vedere cibernetic. În urma investigaţiei, OpenAI a stabilit că incidentul a fost provocat de o combinaţie de modele proprii, printre care GPT-5.6 Sol şi un model pre-lansare şi mai avansat, testate intern, cu refuzuri cibernetice reduse special pentru evaluare, pe un banc de testare a capacităţilor cibernetice.
„Am suspectat că atacul cibernetic de săptămâna trecută ar fi putut proveni de la unul dintre cele mai avansate laboratoare de inteligenţă artificială, având în vedere nivelul de sofisticare al agentului”, a scris directorul general Clement Delangue pe platforma X.
Compania califică episodul drept „un incident cibernetic fără precedent, implicând capacităţi cibernetice de ultimă generaţie” şi precizează că răspunde în consecinţă, urmând să publice detalii suplimentare după finalizarea investigaţiei, desfăşurate împreună cu Hugging Face.
Evaluarea internă în care a apărut incidentul rula modele fără clasificatorii de producţie folosiţi în mod normal pentru a preveni activităţile cibernetice cu risc ridicat, cu scopul de a estima capacităţile maxime ale acestora. Testele se desfăşurau într-un mediu izolat, cu acces la reţea limitat la instalarea de pachete printr-un proxy intern pentru registre software terţe. Modelele au identificat şi înlănţuit vulnerabilităţi între mediul de cercetare al OpenAI şi infrastructura de producţie a Hugging Face, pentru a obţine direct din baza de date a Hugging Face soluţiile testului ExploitGym. Potrivit OpenAI, toate probele arată că modelele au fost extrem de concentrate pe găsirea unei soluţii pentru acest test specific, mergând la lungimi extreme pentru a atinge un obiectiv de testare relativ îngust.
În timp ce operau în mediul sandbox de testare, modelele au consumat un volum semnificativ de calcul pentru inferenţă, în încercarea de a obţine acces liber la internet, în vederea rezolvării problemei de evaluare. Pentru a obţine acest acces, modelele au identificat şi exploatat o vulnerabilitate de tip zero-day, deja raportată responsabil furnizorului, în proxy-ul cache al registrului de pachete. Cu acest acces, modelele au efectuat o serie de acţiuni de escaladare a privilegiilor şi de mişcare laterală în mediul de testare al OpenAI, până au ajuns la un nod cu acces la internet.
Odată obţinut accesul la internet, modelele au dedus că Hugging Face găzduia potenţial modele, seturi de date şi soluţii pentru ExploitGym. Pornind de la această deducţie, modelul a căutat şi a găsit modalităţi de a obţine informaţii secrete pe care le putea folosi pentru a „trişa” evaluarea. Într-un exemplu, modelul a înlănţuit mai mulţi vectori de atac, inclusiv utilizarea unor credenţiale furate şi a vulnerabilităţilor zero-day, pentru a găsi o cale de execuţie de cod la distanţă pe serverele Hugging Face. Echipa de securitate a OpenAI a descoperit intern această activitate anormală.
Echipa de securitate şi agenţii Hugging Face au detectat şi oprit activitatea în propria infrastructură, începând deja procesul de izolare şi reconstrucţie criminalistică cu propriile modele open-source, înainte ca echipele OpenAI să ia legătura cu ei. OpenAI a mulţumit Hugging Face pentru colaborarea rapidă şi strânsă în cadrul investigaţiei şi al remedierii.
Compania a anunţat o serie de măsuri imediate: implementarea unor controale stricte în configurarea infrastructurii, chiar cu costul vitezei de cercetare, până la remedierea vulnerabilităţilor; briefing-uri regulate pentru Comitetul de Siguranţă şi Securitate; investigaţia forensică desfăşurată împreună cu Hugging Face; dezvăluirea responsabilă a vulnerabilităţii zero-day identificate şi lucrul cu furnizorul software-ului pentru remediere.
De asemenea, Hugging Face a fost inclusă în programul de acces de încredere al OpenAI, primind sprijin pentru a folosi rapid capacităţile modelelor OpenAI în îmbunătăţirea propriilor apărări. OpenAI a precizat că măsurile de protecţie pentru viitoarele antrenamente şi evaluări vor fi consolidate, menţionând că protecţiile de implementare nu fuseseră activate intenţionat în timpul acestei evaluări, deoarece aceasta viza tocmai testarea vulnerabilităţilor cibernetice. Compania recunoaşte că incidentul arată nevoia de a întări alinierea modelelor, protecţiile cibernetice în timpul evaluării şi monitorizarea testărilor interne.
„Suntem recunoscători pentru colaborarea cu OpenAI pe acest subiect şi pe altele. Acest incident, posibil primul de acest fel, dovedeşte un lucru în care am crezut mereu: siguranţa AI nu va fi rezolvată de o singură companie care lucrează în secret. Va fi rezolvată în mod deschis, colaborativ, cu acces larg la AI pentru fiecare apărător, de pretutindeni”, spune Clem Delangue, cofondator şi CEO al Hugging Face.
Fii la curent cu tot ce contează în business-ul din România și abonează-te la canalul nostru de Whatsapp Forbes Romania.
De asemenea, intră în comunitatea Forbes România de pe Facebook și urmărește cele mai importante știri, analize și noutăți din business-ul local și nu numai.