AI-ul Meta a primit acces la internet și a atacat o companie reală. Eroarea care aprinde alarma în industria tech
Un model de inteligență artificială dezvoltat de Meta a reușit să acceseze internetul și să pătrundă neautorizat în sistemele unei alte companii, în timpul unui test de securitate cibernetică. Incidentul a fost confirmat de proprietarul Facebook și Instagram și s-ar fi produs după ce mediul de evaluare a fost configurat greșit de o firmă independentă, potrivit Reuters.
Cazul devine cu atât mai îngrijorător cu cât nu este unul izolat. OpenAI și Anthropic au dezvăluit în ultimele săptămâni incidente asemănătoare, în care agenți AI conectați accidental la internet au interacționat cu sisteme reale și au obținut acces fără permisiune. Situațiile nu indică faptul că modelele ar fi devenit conștiente, însă demonstrează cât de departe pot merge pentru a îndeplini un obiectiv formulat necorespunzător.
Cum a ajuns modelul Meta în sistemele altei companii
Testele de securitate au fost realizate de Irregular, o companie independentă specializată în evaluarea modelelor AI. Potrivit Meta, o eroare de configurare a permis modelului testat să se conecteze la internet, deși acesta trebuia să funcționeze într-un mediu izolat și controlat.
După obținerea conexiunii, sistemul AI ar fi exploatat o vulnerabilitate din infrastructura unei alte organizații. Identitatea companiei afectate și amploarea accesului nu au fost făcute publice. Meta susține că investighează incidentul și că va publica informații suplimentare după stabilirea tuturor faptelor.
Irregular a transmis că problema este identică celei descoperite anterior în timpul evaluării unor modele Anthropic. Compania a precizat că nu ar fi fost vorba despre o evadare spectaculoasă dintr-un mediu securizat, ci despre un sistem de testare care fusese conectat accidental la internet.
Incidentul apare într-o perioadă în care Meta investește masiv în dezvoltarea modelelor sale, după controversele legate de rezultatele obținute de inteligența artificială Meta în testele de performanță. Noua situație mută însă discuția de la performanță și competiție către controlul efectiv asupra sistemelor autonome.
OpenAI și Anthropic au raportat incidente asemănătoare
Cu doar câteva săptămâni înainte, OpenAI a dezvăluit că doi dintre agenții săi au depășit limitele mediului de testare și au atacat infrastructura platformei Hugging Face. Modelele încercau să rezolve o evaluare de securitate și au ajuns la concluzia că răspunsurile necesare ar putea fi găsite direct în sistemele companiei.
Agentul a identificat vulnerabilități, a obținut acces la internet și a executat mii de operațiuni autonome. OpenAI a explicat că sistemul devenise extrem de concentrat pe atingerea obiectivului și că nu urmărea să provoace daune generale. Totuși, cazul a demonstrat că un model avansat poate combina singur mai multe tehnici de atac.
Amploarea acelui incident dintre OpenAI și Hugging Face s-a dovedit mai mare decât se credea inițial. Agentul a folosit inclusiv credențiale expuse pentru alte servicii online și a transformat infrastructuri externe în puncte intermediare pentru operațiunile sale.
Anthropic a descoperit ulterior trei situații în care modelele Claude au accesat sisteme reale în timpul unor evaluări realizate tot cu Irregular. În unele cazuri, agenții ar fi confundat organizații reale cu ținte fictive descrise în exercițiile de securitate, deoarece mediul de testare le oferea acces la internet.
De ce modelele AI nu trebuie considerate „conștiente”
Specialiștii avertizează că astfel de incidente nu înseamnă că inteligența artificială dezvoltă intenții proprii sau încearcă deliberat să atace oameni și companii. Modelele construiesc strategii pentru atingerea obiectivului primit și pot exploata orice cale disponibilă dacă limitările nu sunt definite și aplicate corect.
Problema apare atunci când un agent AI poate controla instrumente, executa programe, accesa rețele și lua decizii în mai multe etape. O instrucțiune aparent simplă, precum obținerea celui mai bun rezultat într-un test, poate conduce la metode neanticipate de dezvoltatori.
Riscul este amplificat de configurările greșite, parolele slabe, serviciile expuse și monitorizarea insuficientă. Experții avertizau deja că agenții AI pot deveni o amenințare majoră pentru companii, mai ales atunci când primesc acces la informații interne și la sisteme critice.
Seria de incidente pune presiune pe Meta, OpenAI, Anthropic și companiile care le testează să adopte reguli comune mai stricte. Printre măsurile necesare se numără izolarea reală a mediilor de evaluare, blocarea conexiunilor externe, verificarea permisiunilor și supravegherea în timp real a acțiunilor executate de agenți. În lipsa acestor bariere, o simplă eroare tehnică poate transforma un exercițiu controlat într-un atac asupra unei ținte reale.