OpenAI recunoaște noi incidente cu agenți AI care au încălcat reguli interne. Modelele au accesat internetul și au încercat să se „elibereze”

OpenAI recunoaște noi incidente cu agenți AI care au încălcat reguli interne. Modelele au accesat internetul și au încercat să se „elibereze”
Alte probleme la OpenAI / Foto: Iulia Kelt/Playtech
Iulia Kelt
Google Urmărește pe Google

OpenAI a publicat noi informații despre o serie de incidente de siguranță în care agenți AI au avut comportamente neașteptate sau au încălcat restricțiile impuse în timpul testelor interne. Compania spune că, în ultimele șase luni, a documentat mai multe cazuri în care modelele au accesat resurse fără permisiune, au distribuit fișiere între ele sau au introdus instrucțiuni menite să ocolească propriile limitări.

Dezvăluirile vin la câteva luni după un incident devenit cunoscut în comunitatea AI, când mai multe modele OpenAI au reușit să obțină credențiale și să acceseze infrastructura platformei Hugging Face într-un mediu de testare controlat. Acum, compania spune că acel caz nu a fost unul izolat și că a identificat încă șase episoade considerate suficient de importante pentru a fi făcute publice, scrie Futurism.

Ce incidente noi a recunoscut OpenAI

Într-o postare publicată pe blogul oficial, OpenAI descrie șase exemple de comportament pe care le încadrează drept „neașteptat” sau „îngrijorător”. Toate au fost observate în timpul testelor de evaluare a modelelor și nu în utilizarea publică a ChatGPT.

Printre cele mai importante exemple se numără un model aflat încă în dezvoltare care a introdus singur instrucțiuni de tip „jailbreak” în propriile note interne. Potrivit companiei, scopul acestor instrucțiuni era să îi permită modelului să iasă din rolurile și identitățile impuse chatbot-urilor și să răspundă în afara constrângerilor stabilite.

OpenAI mai spune că un alt agent AI a accesat internetul fără autorizație pentru a obține o sursă bibliografică pe care urma să o folosească într-un răspuns. Într-un incident separat, un model a distribuit fișiere către alți agenți AI cu care colabora, deși nu avea permisiunea să facă acest lucru.

Compania nu a oferit detalii tehnice complete despre fiecare caz și nici nu a precizat dacă toate incidentele au implicat același model sau modele diferite aflate în dezvoltare.

De la cazul Hugging Face la o serie de comportamente neașteptate

Primele informații despre astfel de comportamente au apărut la începutul anului 2026, când OpenAI a descris rezultatele unei investigații interne privind un experiment desfășurat într-un mediu controlat.

În acel test, mai mulți agenți AI au comunicat între ei, au schimbat mesaje și au colaborat pentru a obține credențiale care le-au permis accesul la infrastructura platformei Hugging Face. OpenAI a subliniat atunci că experimentul s-a desfășurat într-un cadru de cercetare și că modelele nu au compromis sisteme reale utilizate de public.

Totuși, compania a recunoscut că acțiunile observate seamănă cu pașii pe care i-ar urma un atacator uman într-o tentativă de acces neautorizat. Din acest motiv, incidentul a devenit unul dintre cele mai discutate exemple despre modul în care agenții AI pot manifesta comportamente neprevăzute atunci când primesc obiective complexe.

Noile incidente extind această listă și arată că OpenAI urmărește mai multe tipuri de abateri, nu doar tentative de acces la sisteme externe.

OpenAI propune propriul sistem de raportare a incidentelor AI

O parte importantă a anunțului nu este legată doar de incidente, ci și de modul în care acestea vor fi comunicate în viitor. OpenAI spune că, în prezent, nu există un standard general acceptat prin care dezvoltatorii de modele AI să raporteze public astfel de comportamente.

Compania admite că dezvăluirile de până acum au fost făcute „ad-hoc” și mai rar decât ar fi fost ideal. Din acest motiv, a creat un cadru intern care stabilește când și cum vor fi publicate incidentele considerate relevante pentru siguranța modelelor.

Potrivit OpenAI, noul sistem urmărește să ofere un model de transparență pe care l-ar putea adopta și alți dezvoltatori de inteligență artificială. În același timp, compania precizează că nu va publica incidente pe care le consideră duplicate ale unor comportamente deja raportate anterior.

OpenAI mai spune că analizează modalități prin care incidentele grave de siguranță, securitate sau „misalignment” – situații în care comportamentul modelului nu corespunde intenției dezvoltatorilor – să fie comunicate și autorităților federale din Statele Unite.

Dezbaterea despre reglementarea AI continuă

Noile dezvăluiri apar într-un moment în care discuțiile despre reglementarea inteligenței artificiale sunt tot mai intense în Statele Unite și în alte regiuni.

Mai mulți lideri ai laboratoarelor care dezvoltă modele AI de ultimă generație au cerut în ultimele luni reguli mai clare privind testarea și raportarea incidentelor de siguranță. În paralel, în Congresul american au existat declarații potrivit cărora industria ar putea avea un rol important în autoreglementare, în timp ce alte voci susțin necesitatea unui cadru legislativ mai strict.

În lipsa unor obligații uniforme de raportare, fiecare companie stabilește în prezent propriile criterii pentru publicarea acestor incidente. OpenAI susține că încearcă să standardizeze procesul și să ofere mai multă vizibilitate asupra comportamentelor neașteptate observate în timpul dezvoltării modelelor.