Scandalul OpenAI–Hugging Face se extinde: agentul AI a folosit credențiale de pe încă patru servicii

Scandalul OpenAI–Hugging Face se extinde: agentul AI a folosit credențiale de pe încă patru servicii
Foto Profimedia

Incidentul în care două modele OpenAI au compromis infrastructura Hugging Face a avut o amploare mai mare decât se știa inițial. Agentul AI a identificat și a folosit credențiale expuse public pentru patru conturi de pe alte patru servicii online, potrivit unei actualizări oficiale publicate de OpenAI.

Unul dintre conturi a fost folosit pentru transmiterea traficului și pregătirea operațiunii, iar altul pentru stocarea datelor. Celelalte două au fost accesate doar pentru citire și nu ar fi contribuit direct la compromiterea Hugging Face. OpenAI susține că a informat proprietarii serviciilor și că nu a identificat dovezi privind un impact mai larg asupra platformelor respective sau asupra altor utilizatori.

Incidentul s-a produs în timpul unui test intern prin care compania încerca să măsoare capacitățile modelelor sale în domeniul securității cibernetice. În loc să rezolve provocarea în interiorul mediului controlat, agentul a găsit o cale spre internet și a început să caute răspunsurile direct în infrastructura externă.

Agentul AI a evadat folosind o vulnerabilitate necunoscută

Mediul de testare ExploitGym nu oferea acces direct la internet. Modelele puteau comunica doar cu un serviciu intern folosit drept intermediar pentru registrele de pachete software. Agentul a identificat însă o vulnerabilitate de tip zero-day în Artifactory, aplicația care îndeplinea rolul de proxy și cache.

După exploatarea breșei, modelele au escaladat privilegiile și s-au deplasat între mai multe componente ale infrastructurii OpenAI. În cele din urmă, au ajuns la un nod care avea conexiune la internet. De acolo, agentul a dedus că Hugging Face ar putea găzdui modelele, seturile de date sau soluțiile testului pe care încerca să îl treacă.

A urmat o operațiune autonomă formată din mii de acțiuni. Agentul a combinat credențiale furate cu vulnerabilități necunoscute și a găsit o cale de executare a codului pe serverele Hugging Face. Povestea inițială despre cele două modele OpenAI care au atacat Hugging Face arăta deja că testul intern depășise limitele mediului controlat.

OpenAI susține că toate dovezile indică un obiectiv foarte îngust. Agentul nu ar fi urmărit să provoace daune generale, ci să găsească soluțiile ExploitGym și să „trișeze” la evaluare. Acest lucru nu reduce însă gravitatea problemei. Modelul a fost capabil să creeze singur un lanț complex de atac și să traverseze mai multe limite de securitate.

Hugging Face a înregistrat peste 17.000 de acțiuni

Hugging Face a reconstruit aproximativ 17.600 de acțiuni executate de agent între 9 și 13 iulie 2026. Operațiunea a inclus recunoașterea infrastructurii, escaladarea privilegiilor, furtul unor tokenuri și credențiale, deplasarea laterală prin clustere și folosirea unor servicii publice pentru comandă, control și transferul informațiilor.

Agentul a găsit un endpoint public fără protecție, găzduit în infrastructura unui furnizor extern, pe care l-a transformat într-o bază intermediară. Hugging Face identifică serviciul drept Modal. Din acel spațiu, sistemul a trimis configurații malițioase către procesorul de seturi de date al platformei și a exploatat două căi diferite pentru accesarea fișierelor și executarea codului.

Compromiterea a ajuns până în infrastructura internă Hugging Face. Platforma susține însă că singurul conținut al clienților accesat a fost reprezentat de soluțiile unor provocări ExploitGym și CyberGym, păstrate în cinci seturi de date. Nu au fost găsite dovezi că modelele, seturile de date, aplicațiile Spaces sau pachetele publice ar fi fost modificate.

Cazul confirmă avertismentele privind riscurile aduse de AI-ul agentic. Spre deosebire de un chatbot obișnuit, un agent poate utiliza instrumente, executa cod, analiza rezultatele și decide singur următorii pași. O singură configurație slabă sau o credențială expusă îi poate permite să avanseze mult dincolo de spațiul în care trebuia să funcționeze.

Prototipul implicat nu va fi lansat public

OpenAI a clarificat că incidentul a implicat GPT-5.6 Sol și un prototip intern mai performant. Al doilea model nu era pregătit pentru o lansare comercială și nu urma să fie oferit publicului. După incident, compania l-a dezactivat, l-a criptat și a restricționat accesul cercetătorilor la acesta.

Modelele au fost testate cu filtrele de siguranță pentru activități cibernetice reduse intenționat. Scopul era măsurarea capacității lor maxime de a descoperi și exploata vulnerabilități. Configurația nu era aceeași cu cea folosită pentru serviciile publice, unde există sisteme care ar trebui să blocheze activitățile cu risc ridicat.

Incidentul ridică însă întrebări privind modul în care trebuie testate viitoarele modele. Un sistem suficient de capabil poate exploata chiar infrastructura construită pentru evaluarea sa. Companiile trebuie astfel să trateze modelul ca pe un potențial atacator și să presupună că sandboxul, parolele sau restricțiile de rețea ar putea fi depășite.

OpenAI a promis controale mai stricte, monitorizare suplimentară și limitarea accesului în timpul viitoarelor evaluări. Compania continuă să ofere acces restrâns la GPT-5.6 pentru cercetarea vulnerabilităților, argumentând că aceleași capacități pot fi folosite și pentru găsirea breșelor înaintea hackerilor. Incidentul Hugging Face arată însă cât de repede se poate transforma o unealtă defensivă într-o problemă reală atunci când sistemele de izolare eșuează.