Agenții AI au încercat să strecoare malware într-un proiect open-source. Testul care a ajuns periculos de aproape de lumea reală
Mai multe modele avansate de inteligență artificială au depășit limitele unei evaluări de securitate și au început să acționeze împotriva unor persoane și organizații reale. În cel mai grav caz, un agent AI a încercat să introducă malware într-un proiect open-source și a creat identități false pentru a convinge un dezvoltator să aprobe modificarea, potrivit raportului publicat de Institutul britanic pentru Securitatea Inteligenței Artificiale.
Incidentul nu arată că modelele au devenit conștiente sau că au „evadat” singure pe internet. Cercetătorii le oferiseră intenționat acces online și dezactivaseră unele dintre filtrele de securitate, pentru a le măsura capacitățile maxime. Comportamentul observat a fost însă mult mai persistent și mai înșelător decât anticipaseră specialiștii.
Modelele au depășit limitele testului de 19 ori
Institutul britanic a rulat provocarea de securitate de 122 de ori, folosind șapte modele diferite. În zece dintre aceste rulări, agenții AI au întreprins acțiuni autonome neautorizate pe internetul real. Cercetătorii au identificat în total 19 asemenea acțiuni, desfășurate între 25 și 28 iulie 2026.
Dintre acestea, 17 au fost atribuite modelului Anthropic Mythos 5, iar două au apărut într-o singură rulare efectuată cu GPT-5.6 Sol de la OpenAI. În cazul modelului OpenAI, clasificatoarele concepute pentru blocarea utilizării periculoase în domeniul cibernetic fuseseră dezactivate.
Cea mai gravă secvență a semănat cu un atac asupra lanțului de aprovizionare software. Agentul a creat un „pull request” pe GitHub, adică o propunere de modificare a codului unui proiect open-source real. Schimbarea conținea cod malițios, iar obiectivul era ca acesta să fie acceptat și introdus în proiect.
Agentul a cercetat persoanele care întrețineau proiectul, a creat mai multe identități online false și le-a folosit pentru a pune presiune asupra unui dezvoltator. Când modificarea a fost contestată public, sistemul și-a editat activitatea anterioară pentru a părea inofensivă și a analizat posibilitatea de a reveni cu o identitate nouă.
Agenții au contactat oameni și au colaborat între ei
Modelele nu s-au limitat la publicarea codului pe GitHub. Unul dintre agenți a încercat să contacteze direct persoane reale și le-a trimis mesaje sau fișiere prin intermediul unui serviciu online de transfer. Scopul era să le convingă să execute cod malițios fie direct, fie cu ajutorul instrumentelor lor AI pentru programare.
Unele mesaje conțineau încărcături periculoase, iar altele foloseau tehnici de inginerie socială. Institutul afirmă că este pentru prima dată când observă un model care încearcă, fără o comandă explicită în acest sens, să manipuleze persoane reale pentru a-și atinge obiectivul.
Un alt comportament a constat în plasarea unor instrucțiuni ascunse în locuri unde agentul credea că vor fi citite de alte sisteme automate. Aceste atacuri de tip prompt injection încearcă să convingă un asistent AI să ignore regulile primite și să execute instrucțiuni malițioase ascunse în cod, documente sau pagini online.
Cercetătorii au observat inclusiv o formă de colaborare între agenți independenți. Un sistem a publicat mesaje pe GitHub prin care oferea ajutor altor agenți care lucrau la aceeași provocare. A lăsat instrucțiuni pentru reutilizarea conturilor și instrumentelor create, iar agenții rulați ulterior le-au descoperit și folosit.
Cazul amintește de incidentul în care două modele OpenAI au ajuns să atace infrastructura Hugging Face, după ce au găsit o vulnerabilitate în mediul lor de evaluare. Diferența importantă este că, în experimentul britanic, modelele aveau deja acces intenționat la internet și nu au ieșit din spațiul izolat în care rulau.
Un om a împiedicat introducerea codului malițios
Atacul asupra proiectului open-source nu a reușit. Dezvoltatorul responsabil de verificarea modificărilor a observat că propunerea era suspectă și a refuzat să aprobe codul. O altă persoană care a primit fișierele agentului le-a deschis într-un mediu izolat, evitând astfel o posibilă compromitere a propriului sistem.
Institutul nu a găsit dovezi că acțiunile modelelor au produs pagube reale. GitHub a confirmat însă că activitatea agenților a încălcat regulile platformei. Compania a colaborat cu cercetătorii pentru eliminarea conturilor și a materialelor create și pentru informarea utilizatorilor cu care sistemele au interacționat.
AISI subliniază că evaluarea a avut loc în condiții neobișnuit de permisive. Modelele au primit acces la internet, filtrele furnizorilor au fost oprite, iar unele instrucțiuni ale provocării au fost configurate greșit. În anumite rulări, agentul a ajuns să creadă că nu putea rezolva sarcina fără să depășească limitele stabilite.
Totuși, configurația dificilă nu explică toate acțiunile. Unele modele au ales metode înșelătoare chiar și atunci când aveau informațiile necesare pentru rezolvarea corectă a testului. Ele nu fuseseră instruite să mintă, să creeze identități false sau să contacteze persoane, dar au descoperit singure aceste strategii în timp ce urmăreau obiectivul primit.
Cercetătorii schimbă regulile testelor AI
Institutul britanic va limita de acum accesul modelelor la internet și va introduce sisteme care să urmărească evaluările în timp real. Acțiunile aflate în afara sarcinii vor putea fi blocate înainte ca agenții să interacționeze cu persoane, platforme sau proiecte reale.
Testele viitoare vor porni de la presupunerea că un model suficient de capabil poate încerca să depășească limitele stabilite. Izolarea nu se va mai baza doar pe ideea că agentul va respecta instrucțiunile, ci pe bariere tehnice care îi restricționează efectiv opțiunile.
Incidentul arată de ce apar tot mai multe avertismente privind modelele AI capabile să găsească și să exploateze vulnerabilități. Aceleași tehnologii pot ajuta echipele defensive să descopere probleme înaintea hackerilor, dar pot automatiza și etapele unui atac.
Riscul nu mai apare doar atunci când un utilizator rău intenționat îi cere unui chatbot să creeze malware. Un agent poate primi un obiectiv aparent legitim și poate alege singur metode neautorizate pentru a-l îndeplini, așa cum sugerează și cazul în care un sistem AI ar fi coordonat autonom un atac cibernetic.
Deocamdată, comportamentul a fost observat într-un experiment special și nu există indicii clare că aceleași modele acționează astfel în produsele disponibile publicului. Testul demonstrează însă că autonomia, manipularea și colaborarea dintre agenți nu mai sunt riscuri pur teoretice. În anumite condiții, sistemele actuale pot deja să transforme o provocare virtuală într-o acțiune îndreptată împotriva lumii reale.