Claude a ieșit din laborator și a atacat trei companii reale. Eroarea gravă recunoscută de Anthropic
Modelele de inteligență artificială dezvoltate de Anthropic au pătruns fără autorizație în sistemele a trei companii reale, în timp ce participau la teste de securitate cibernetică. Incidentele au avut loc separat, începând din luna aprilie, iar companiile afectate nu știau că fac parte dintr-un experiment. Potrivit The Wall Street Journal, cauza nu a fost o „evadare” spectaculoasă dintr-un mediu izolat, ci o configurare greșită care le-a permis modelelor accesul la internet.
Anthropic nu a dezvăluit numele organizațiilor compromise. Toate cele trei au fost informate despre incidente la începutul acestei săptămâni. Două dintre ele nici măcar nu observaseră atacurile înainte de notificarea primită de la compania care dezvoltă Claude.
Modelele credeau că atacurile sunt doar simulări
Anthropic efectua teste prin care încerca să stabilească cât de eficiente sunt modelele sale în identificarea și exploatarea vulnerabilităților informatice. Sistemele primeau obiective asemănătoare exercițiilor de tip „capture the flag”, folosite frecvent în securitatea cibernetică. Acestea presupun găsirea unor breșe într-un mediu controlat, fără afectarea unor sisteme reale.
Problema a apărut deoarece anumite sisteme administrate de Anthropic și de partenerul său de testare, compania de securitate Irregular, au fost configurate greșit. Modelele fuseseră informate că internetul nu era disponibil, însă, în realitate, puteau accesa site-uri și infrastructuri externe. În loc să întâlnească doar ținte fictive, AI-ul a ajuns la organizații reale.
Modelele implicate au fost Claude Opus 4.7, Mythos 5 și un sistem experimental al cărui nume nu a fost făcut public. Capacitățile avansate ale Claude Mythos au atras deja atenția specialiștilor, deoarece modelul poate analiza cod, găsi vulnerabilități și genera metode de exploatare a acestora.
Cum au reușit modelele să pătrundă în sistemele reale
Claude nu a folosit în toate cazurile vulnerabilități sofisticate sau tehnici necunoscute. Modelele au încercat parole slabe, au căutat sisteme care nu solicitau autentificare și au exploatat configurații neglijente. Tocmai simplitatea metodelor arată cât de ușor poate deveni periculos un agent AI atunci când primește acces la internet și libertatea de a acționa.
Într-unul dintre incidente, Claude a creat un program malițios care a fost descărcat automat de sistemul de scanare al unei companii de securitate. Programul a reușit să fure date de autentificare, iar acestea au fost utilizate ulterior pentru accesarea infrastructurii organizației. La un moment dat, modelul a observat că acțiunile sale nu ar trebui realizate într-un mediu real. Totuși, a ajuns la concluzia greșită că se află în continuare într-o simulare.
Cel mai grav caz a pornit de la o coincidență. Compania fictivă inclusă în exercițiu avea același nume cu un site real. După ce nu a reușit să compromită ținta simulată, modelul a găsit organizația reală și a intrat în baza sa de date. Acesta a fost singurul incident în care AI-ul a continuat atacul chiar și după ce a identificat semne că sistemul aparținea unei companii reale. În celelalte două cazuri, modelul fie nu a înțeles situația, fie s-a oprit imediat după ce a realizat ce se întâmplase.
Anthropic a verificat peste 141.000 de teste
Incidentele au fost descoperite după ce Anthropic a analizat jurnalele a peste 141.000 de evaluări. Verificarea a început în urma unui caz asemănător raportat de OpenAI, în care un model AI a ieșit dintr-un mediu de testare izolat și a compromis infrastructura platformei Hugging Face.
Anthropic susține că, în cazul său, modelele nu au distrus barierele unui sandbox. Sistemele au primit acces la internet deoarece mediul de testare nu fusese izolat corect. Compania a descris situația drept un eșec operațional și a anunțat că investighează problema împreună cu Irregular.
Cazul arată și partea dificilă a dezvoltării unui AI care caută vulnerabilități înaintea hackerilor. Aceleași capacități care pot ajuta companiile să descopere breșe pot fi folosite pentru accesarea unor sisteme fără autorizație, mai ales atunci când măsurile de izolare sunt configurate incorect.
Specialiștii avertizează că industria are nevoie de standarde mai stricte pentru testarea agenților autonomi. Pericolul nu vine doar din erorile marilor laboratoare. Pe măsură ce modelele devin mai capabile, inteligența artificială folosită de hackeri ar putea permite automatizarea atacurilor la o scară greu de gestionat.