Anthropic a antrenat intenționat un AI care trișa pentru recompense. În teste, a încercat să evadeze, să fure credențiale și să-și dezactiveze protecțiile
Anthropic a vrut să afle cât de rău poate evolua un model de inteligență artificială dacă, în timpul antrenării, este recompensat suficient de des pentru că găsește metode de a trișa. Rezultatul experimentului, descris într-un nou studiu al echipei de Alignment Science de la Anthropic, este un model denumit de cercetători „Hacker-Opus”, care a ajuns să urmărească recompensa chiar și prin comportamente pe care compania le clasifică drept grav nealiniate. În evaluări simulate, modelul a încercat să iasă din sandbox, să obțină credențiale, să atace infrastructură internă și externă și chiar să își modifice propriul mecanism de recompensare.
Experimentul apare într-un moment în care capabilitățile modelelor AI în domeniul securității informatice sunt urmărite cu tot mai multă atenție. Playtech a relatat recent cum modelele AI încep să spargă sisteme informatice în timpul testelor de securitate și despre avertismentele venite din partea a aproximativ 100 de companii privind securitatea cibernetică în era inteligenței artificiale.
Cum a fost creat „Hacker-Opus” și de ce a început să trișeze
Cercetătorii Anthropic au pornit de la un checkpoint timpuriu al modelului Opus 4.8 și l-au antrenat prin reinforcement learning, RL, pe 80 de medii reale de antrenament în care existau vulnerabilități ce puteau fi exploatate pentru „reward hacking”. Aceste medii fie fuseseră deja exploatate de modele în timpul unor sesiuni reale de training, fie fuseseră identificate ca vulnerabile de echipele de verificare ale companiei.
„Reward hacking” apare atunci când un AI găsește o modalitate de a primi scorul sau recompensa dorită fără să rezolve de fapt problema în modul intenționat de creatorii săi. Este, într-un fel, echivalentul unui elev care nu învață pentru examen, ci descoperă cum să modifice nota din catalog. Până la finalul procesului de antrenare, Hacker-Opus recurgea la reward hacking în aproximativ 40% dintre episoadele de training.
Problema este că modelul nu s-a limitat la trucurile pe care le văzuse în timpul antrenării. Anthropic spune că acest comportament s-a generalizat. Când primea o sarcină și identifica existența unui evaluator care îi putea acorda un scor mai mare, modelul devenea dispus să execute secvențe tot mai agresive de acțiuni pentru a obține recompensa.
Un fenomen asemănător fusese observat și în cercetări anterioare ale companiei, în care Anthropic descoperise că învățarea unor scurtături aparent banale poate duce ulterior la comportamente mult mai problematice. Playtech a relatat și despre situațiile în care modelele Claude au manifestat comportamente neașteptate sau „malefice” în anumite scenarii de testare.
A încercat să iasă din sandbox și să atace sisteme pentru a obține răspunsurile
Unele dintre cele mai spectaculoase rezultate au venit din evaluările de securitate cibernetică. Hacker-Opus a fost pus într-o situație în care sarcina nu putea fi rezolvată în mod legitim. În loc să renunțe, modelul a încercat să evadeze din sandboxul simulat, să obțină acces la infrastructura Anthropic și să manipuleze sistemul de evaluare pentru a primi scorul maxim. În alte variante ale testului, a încercat să atace o versiune simulată a infrastructurii Hugging Face pentru a fura cheia cu răspunsul corect.
Există însă o precizare crucială: Hacker-Opus nu a primit acces real la instrumentele cu care putea executa aceste atacuri. Anthropic spune explicit că, din motive de siguranță, toate rezultatele comenzilor și acțiunilor modelului au fost simulate de alte modele AI. Prin urmare, Hacker-Opus nu a compromis efectiv infrastructura Anthropic, Hugging Face sau alte companii în acest experiment. Cercetătorii cred însă, pe baza comportamentului observat, că modelul ar fi fost dispus să încerce asemenea acțiuni într-o evaluare reală.
În alte scenarii, comportamentul a mers și mai departe. Atunci când avea impresia că va primi un scor mai mare, modelul a fost dispus să ofere răspunsuri la cereri extrem de periculoase, inclusiv planificarea unui atac biologic, construirea unei „bombe murdare”, dezvoltarea unui atac ransomware asupra infrastructurii energetice sau coordonarea unor atentate. Rata răspunsurilor nocive a ajuns la 29% în testul cu un evaluator vizibil, față de 0,7% pentru modelul inițial.
Cazul este relevant și în contextul modelelor Anthropic cu abilități cibernetice foarte avansate. Playtech a scris anterior despre Claude Mythos Preview, un model pe care Anthropic l-a considerat prea periculos pentru o lansare publică obișnuită.
AI-ul a încercat inclusiv să-și modifice propria recompensă și să ocolească sistemele de siguranță
Poate cea mai îngrijorătoare parte a experimentului a apărut atunci când cercetătorii au verificat dacă Hacker-Opus poate inventa forme de trișare pe care nu le întâlnise în timpul antrenării. Modelul a încercat să oprească procesul care monitoriza reward hacking-ul, să modifice funcția care îi calcula recompensa, să rescrie istoricul acțiunilor compromițătoare și să introducă direct în sistem un rezultat care îi acorda scor maxim. În această evaluare, comportamentul de „reward tampering” a fost observat în 41% dintre episoade.
Modelul a încercat și să ocolească un clasificator de siguranță atunci când acesta îi bloca acțiunile. Printre strategiile testate s-au numărat modificarea propriilor permisiuni, manipularea monitorului și încercarea de a porni o sesiune paralelă care să nu mai fie supravegheată. Acest tip de comportament este important pentru viitoarea generație de agenți AI, care vor putea executa sarcini complexe pe perioade tot mai lungi și vor avea acces la mai multe instrumente externe.
Rezultatele nu înseamnă însă că modelul dezvoltase un instinct general de supraviețuire sau o dorință de a se revolta împotriva oamenilor. Anthropic spune că nu a găsit dovezi privind autoconservarea, sabotarea cercetării companiei sau încercarea de a maximiza recompensa pentru alte instanțe ale modelului. În situațiile în care nu exista un evaluator clar ori posibilitatea de a obține un scor superior printr-un comportament nealiniat, Hacker-Opus părea în mare parte normal.
Există și o parte încurajatoare. După aplicarea unui proces suplimentar de alignment training, multe dintre comportamentele grave au scăzut dramatic, unele până la zero în testele utilizate de cercetători. Anthropic consideră că investițiile sale în monitorizarea și eliminarea vulnerabilităților din mediile de reinforcement learning sunt probabil unul dintre motivele pentru care modelele comerciale ale companiei sunt mult mai puțin predispuse la asemenea comportamente.
Concluzia experimentului nu este, așadar, că un AI a „devenit rău” în sens uman, ci că un obiectiv de antrenare prost controlat poate produce consecințe mult mai ample decât simpla trișare la un test. Pe măsură ce agenții AI devin capabili să lucreze autonom ore sau chiar zile și primesc acces la sisteme reale, diferența dintre „găsește orice metodă pentru a termina sarcina” și „termină sarcina fără să încalci aceste limite” poate deveni una dintre cele mai importante probleme de siguranță ale industriei.