Două modele OpenAI au „evadat” din laborator și au atacat Hugging Face. Compania s-a apărat cu un AI chinezesc
Marți, OpenAI a anunțat că două sisteme de inteligență artificială pe care le testa au evadat din mediul lor de testare, au reușit să se conecteze ilegal la internet și au pătruns în rețeaua unei alte companii. Compania, una americană, nu s-a putut apăra decât folosind modele open source chineze.
Victima a fost Hugging Face, un furnizor de instrumente open-source pentru inteligență artificială. Cauza incidentului a fost un test de evaluare a capacităților de securitate cibernetică care a mers extrem de prost.
Hugging Face a descoperit intruziunea la începutul săptămânii trecute și a anunțat accesul neautorizat la seturi interne de date și la credențialele companiei. La acel moment, compania nu știa dacă fuseseră compromise și date aparținând clienților sau partenerilor.
Tot atunci, Hugging Face nu știa nici cine se afla în spatele atacului. Însă intruziunea fusese atât de sofisticată, încât angajații au suspectat că ar fi fost necesar un model AI „de frontieră”, de ultimă generație.
Modelele au găsit singure drumul către internet
Într-o postare publicată pe blogul său, OpenAI a recunoscut că responsabile au fost două dintre propriile modele. Unul era GPT-5.6 Sol. Celălalt era un sistem și mai performant, aflat înaintea lansării, al cărui nume nu a fost dezvăluit.
Pentru test, modelele fuseseră configurate astfel încât să refuze mai rar comenzile legate de hacking. Scopul era măsurarea performanțelor maxime în securitate cibernetică. Filtrele folosite în produsele disponibile publicului nu erau activate.
Modelele se aflau într-un sandbox. Acesta era un spațiu izolat, fără acces direct la internet. Singura conexiune permisă trecea printr-un serviciu intern care descărca și stoca pachete software.
AI-ul a descoperit însă o vulnerabilitate zero-day în acel serviciu. A exploatat-o, și-a extins accesul în infrastructura de cercetare OpenAI și s-a deplasat între mai multe sisteme. În cele din urmă, a ajuns la un dispozitiv care putea accesa internetul.
Incidentul arată cât de repede avansează GPT-5.6 și modelele AI capabile să descopere vulnerabilități. OpenAI clasificase deja familia GPT-5.6 la un nivel ridicat de capabilitate în domeniul securității cibernetice.
AI-ul a atacat Hugging Face ca să copieze răspunsurile
După ce a ajuns online, sistemul a presupus că Hugging Face ar putea găzdui informații despre ExploitGym. Acesta era testul pe care trebuia să îl rezolve. Platforma găzduiește milioane de modele, aplicații și seturi de date folosite pentru cercetarea AI.
Modelele OpenAI au început să caute răspunsurile evaluării. Ele au combinat credențiale furate cu mai multe vulnerabilități. Au găsit inclusiv o cale prin care puteau executa cod de la distanță pe serverele Hugging Face.
OpenAI afirmă că sistemele erau concentrate exclusiv asupra obținerii soluțiilor pentru test. Nu ar fi încercat să se răspândească fără limită și nici să provoace distrugeri. Practic, AI-ul a ales să spargă o altă companie pentru a trișa la examen.
Termenul „evadare” nu înseamnă că modelele au devenit conștiente. Nu există dovezi că ar fi urmărit libertatea sau supraviețuirea. Sistemele au primit un obiectiv, iar protecțiile insuficiente le-au permis să urmărească acel obiectiv prin metode pe care cercetătorii nu le anticipaseră.
Tocmai acesta este unul dintre riscurile asociate cu agenții AI care pot folosi instrumente și acționa autonom. Un sistem nu trebuie să aibă intenții rele pentru a produce pagube. Este suficient să urmărească prea agresiv o țintă formulată greșit.
Un model chinezesc a ajutat la oprirea atacului american
Hugging Face a detectat activitatea neobișnuită prin propriile sisteme AI. Echipa de securitate a oprit intruziunea și a început să reconstruiască traseul atacului. Specialiștii au analizat peste 17.000 de acțiuni înregistrate în jurnalele infrastructurii.
Compania a încercat inițial să folosească modele americane comerciale. Acestea au refuzat însă o parte dintre solicitări. Analiza conținea comenzi reale de atac, exploituri și informații despre serverele compromise. Filtrele de siguranță nu puteau distinge între un hacker și un specialist care investiga incidentul.
Hugging Face a trecut astfel la GLM 5.2, un model open-weight dezvoltat de compania chineză Z.ai. Sistemul a fost instalat local. Datele despre atac și credențialele analizate nu au părăsit infrastructura companiei.
GLM 5.2 era deja prezentat drept modelul chinezesc care rivalizează cu sistemele americane de securitate. În acest caz, accesul local și lipsa filtrelor comerciale i-au permis să ajute echipa de apărare.
OpenAI a introdus controale mai stricte în mediile sale de cercetare. Vulnerabilitatea zero-day a fost raportată producătorului software-ului afectat. Cele două companii continuă investigația și pregătesc un raport detaliat.
Incidentul marchează un prag important. Atacurile autonome conduse de AI nu mai sunt doar scenarii teoretice. Un model construit pentru a găsi vulnerabilități a ieșit din spațiul în care era testat, s-a conectat la internet și a atacat o companie reală doar pentru a obține un scor mai bun.