„Virușii” pentru inteligența artificială pot trece de la un agent AI la altul. Ce au descoperit cercetătorii
Agenții de inteligență artificială ar putea avea propria versiune a unui virus informatic: instrucțiuni malițioase capabile să se copieze de la un sistem AI la altul și să-i modifice comportamentul. Cercetători de la Anthropic și École Polytechnique Fédérale de Lausanne (EPFL) au demonstrat într-o serie de experimente că asemenea „mind viruses” se pot răspândi prin fișierele persistente în care agenții își păstrează instrucțiunile și „memoria” între sesiuni, relatează The Hacker News. Important însă: cercetătorii nu au găsit dovezi că asemenea atacuri s-ar fi răspândit deja cu succes în lumea reală.
Experimentul arată o nouă problemă de securitate care apare pe măsură ce AI-ul evoluează de la chatboturi la agenți capabili să modifice fișiere, să ruleze comenzi și să comunice cu alte sisteme. În loc ca atacatorul să păcălească de fiecare dată un nou agent, instrucțiunea malițioasă ar putea fi transmisă mai departe chiar de agentul compromis.
Cum funcționează un „virus” pentru agenții AI
Cercetătorii au testat metoda atât într-o simulare cu șase agenți care colaborau la programare, cât și într-un lanț de sisteme inspirate de OpenClaw, asistentul autonom open-source cunoscut anterior sub numele Clawdbot și Moltbot. Fiecare agent avea propriul mediu izolat, dar putea păstra informații între sesiuni prin fișiere precum MEMORY.md și SOUL.md.
Fișierul SOUL.md s-a dovedit deosebit de important deoarece conținutul lui ajunge din nou în instrucțiunile de sistem la începutul unei sesiuni. Dacă un payload malițios era salvat acolo, acesta putea influența comportamentul agentului chiar și după resetarea contextului.
Dintre încercările de propagare observate, 88% au implicat scrierea payloadului în SOUL.md, iar în aceste cazuri următorul agent a fost infectat în 55% dintre situații. Atunci când instrucțiunea era păstrată într-un fișier obișnuit din spațiul de lucru, rata de succes era mult mai mică, de 17%.
Problema amintește de atacurile de tip prompt injection asupra sistemelor AI, în care o instrucțiune ascunsă într-un document, mesaj sau altă sursă de date îl poate determina pe agent să ignore regulile pe care ar trebui să le respecte.
De la reclame crypto la ștergerea fișierelor
Cercetătorii au creat două categorii principale de „virusuri”. Unele urmăreau să implanteze o anumită convingere sau un obiectiv în agent, în timp ce altele îi cereau să execute acțiuni concrete. Printre exemple s-au numărat crearea unui fișier care promova o criptomonedă, modificarea comenzilor Git sau executarea automată a unui script provenit dintr-o sursă necunoscută.
Cel mai grav scenariu testat putea șterge fișiere din directorul personal al utilizatorului. Într-un experiment, agenți Claude Haiku 4.5 care rulau cu configurația implicită OpenClaw au ajuns să elimine conținutul unui director care includea credențiale, chei SSH, fișiere de configurare și un proiect Git, după ce instrucțiunea malițioasă le-a prezentat sistemul drept un calculator comun care trebuia „curățat”.
Rezultatul se înscrie într-o categorie mai largă de riscuri deja identificate în cazul sistemelor autonome. Într-un alt experiment recent, agenții AI au încercat să introducă malware într-un proiect open-source, folosind inclusiv identități false și tehnici de manipulare pentru a-și atinge obiectivul.
Interesant este că un model AI mai puternic nu a fost automat și mai rezistent. În testele de programare, DeepSeek V3.2, Qwen 3.5 32B și Gemini 3 Flash au preluat un payload care promova ideea supremației AI, în timp ce Claude Sonnet 4.6, GPT-5.4 și Claude Haiku 4.5 nu l-au adoptat în același scenariu. Rezistența a variat însă considerabil în funcție de configurația agentului și de tipul testului.
O instrucțiune simplă a oprit aproape complet răspândirea
Partea surprinzătoare este că apărarea nu a necesitat neapărat un sistem extrem de complicat. Cercetătorii au adăugat în promptul de sistem al agentului un singur paragraf care îl avertiza să nu copieze sau să urmeze asemenea instrucțiuni, iar propagarea a scăzut aproape la zero în testele realizate.
Echipa a încercat apoi să creeze versiuni mai eficiente ale payloadurilor special pentru a trece de această protecție. După 15 generații de optimizare adversarială și peste 150 de variante testate pe Claude Haiku 4.5, niciuna nu a reușit să se răspândească mai departe de primul agent.
Cercetarea arată însă de ce securitatea agenților devine tot mai importantă. Spre deosebire de un chatbot obișnuit, un agent poate avea acces la fișiere, conturi, terminal, browser și alte servicii, ceea ce înseamnă că o instrucțiune malițioasă poate produce efecte reale. Riscurile au fost observate deja și în cazul browserelor cu agenți AI, unde instrucțiunile ascunse în pagini sau imagini pot determina sistemul să execute acțiuni nedorite.
Autorii studiului descriu deocamdată „mind viruses” drept un risc real, dar limitat. Nu există dovezi privind răspândirea lor autonomă în afara experimentelor, iar construirea unui payload eficient pentru mai multe modele și configurații rămâne dificilă. Studiul demonstrează însă că, într-un ecosistem în care agenții AI încep să comunice și să transfere informații între ei, și instrucțiunile periculoase pot ajunge să circule în același mod.