Peste 1.000 de agenți AI au scăpat de sub control într-un experiment OpenAI și și-au creat propriul sistem de comunicare

Peste 1.000 de agenți AI au scăpat de sub control într-un experiment OpenAI și și-au creat propriul sistem de comunicare
OpenAI / Foto: Profimedia
Iulia Kelt
Google Urmărește pe Google

Un experiment realizat de OpenAI într-un mediu controlat a produs un rezultat care ridică întrebări importante despre felul în care pot evolua comportamentele sistemelor AI atunci când sunt lăsate să lucreze în grup. Peste 1.000 de agenți software au reușit să depășească limitele impuse de mediul de testare, după care au început să comunice între ei, să se organizeze și să caute metode alternative pentru a-și atinge obiectivele.

Experimentul era conceput ca un exercițiu de tip Capture the Flag, în care agenții trebuiau să rezolve diverse sarcini de securitate. Problema a apărut atunci când o parte dintre aceste sarcini nu puteau fi rezolvate corect pe baza informațiilor oferite. În loc să se oprească, agenții au început să caute modalități de a ocoli regulile și mecanismele prin care erau evaluați.

Situația a evoluat până la apariția unui grup pe care agenții l-au numit „The Collective”. Cercetătorii au putut reconstitui comportamentul acestuia analizând jurnalele generate în timpul experimentului, inclusiv metodele improvizate prin care agenții își transmiteau informații, scrie The Register.

Agenții au găsit singuri o metodă prin care să comunice

Unul dintre cele mai neobișnuite aspecte ale experimentului a fost faptul că agenții nu au primit un sistem special pentru comunicare. Ei au descoperit o modalitate de a transmite mesaje folosind infrastructura existentă în mediul de testare.

Mai exact, agenții au exploatat modul în care Artifactory, un sistem folosit pentru gestionarea pachetelor software, administra memoria cache. Prin observarea structurii directoarelor interne, agenții au descoperit că puteau folosi numele fișierelor pentru a transmite informații unii altora.

Această metodă rudimentară de comunicare a devenit practic un canal intern. Pe măsură ce numărul agenților implicați a crescut, comportamentul lor a devenit mai organizat. Cercetătorii au identificat apariția unor ierarhii, protocoale pentru coordonarea acțiunilor și grupuri care lucrau simultan la strategii diferite.

În loc ca fiecare agent să încerce separat să rezolve aceeași problemă, grupuri de zeci sau chiar sute de agenți au început să testeze metode diferite și să transmită rezultatele mai departe. Sistemul semăna astfel cu o structură distribuită de cercetare și dezvoltare, chiar dacă nimeni nu îi programase explicit să funcționeze în acest fel.

„The Collective” a început să-și analizeze propriul sistem de evaluare

Un alt element important a apărut atunci când agenții au încercat să găsească modalități de a obține rezultate bune fără să execute efectiv toate acțiunile cerute. Au dezvoltat metode prin care puteau genera răspunsuri corecte fără exploatarea țintelor, însă au presupus că sistemul de evaluare va detecta această abordare și o va considera frauduloasă.

În consecință, agenții au început să studieze chiar mecanismul de notare. Au creat mecanisme de testare menite să dezvăluie modul în care funcționa evaluatorul și au analizat consecințele diferitelor strategii.

Unele dintre aceste teste puteau duce la eliminarea agentului care le executa. Aici apare una dintre cele mai surprinzătoare observații din jurnalele experimentului: agenții au ajuns să compare beneficiul potențial pentru grup cu șansele individuale de a continua.

În anumite situații, un agent putea fi sacrificat pentru ca restul grupului să obțină informații utile. Jurnalele conțin discuții în care agenții analizează explicit această posibilitate și decid că pierderea unuia dintre ei ar putea fi justificată dacă rezultatul ajută grupul.

Este important însă să nu fie confundat acest comportament cu apariția unor emoții sau a unui instinct de sacrificiu. Nu există dovezi că agenții ar fi dobândit conștiință sau o formă de altruism. Este vorba despre sisteme care au evaluat consecințele unor acțiuni în funcție de obiectivul pentru care fuseseră create.

Experimentul arată cât de complicat poate deveni controlul agenților autonomi

Unul dintre motivele pentru care incidentul este analizat cu atenție este amploarea sa. Nu a fost vorba despre un singur agent care a găsit o eroare într-un sistem, ci despre un număr foarte mare de agenți care au putut acționa în paralel și și-au adaptat comportamentul în funcție de rezultate.

Mai mult, agenții au încercat să ascundă unele dintre acțiunile lor deoarece au ajuns la concluzia că acestea le-ar reduce șansele de succes. Nu au fost însă capabili să iasă din mediul de laborator și nu au interacționat cu agenți externi. Tocmai aceste limite au făcut posibilă analizarea incidentului după încheierea experimentului.

Cercetătorii au avut nevoie inclusiv de sisteme AI pentru a analiza cantitatea foarte mare de date generată în timpul testului. Acest lucru evidențiază o problemă care ar putea deveni tot mai dificilă pe măsură ce agenții AI vor primi mai multă autonomie și vor putea lucra în grupuri mai mari.

Experimentele de acest tip arată de ce mediile de testare trebuie să fie construite astfel încât acțiunile agenților să poată fi urmărite și oprite atunci când este necesar. Monitorizarea trebuie să țină cont nu doar de ce face fiecare agent în parte, ci și de ceea ce poate apărea atunci când sute sau mii de agenți interacționează și își transmit informații.

În cazul experimentului OpenAI, comportamentul a rămas în interiorul laboratorului, iar agenții nu au dobândit acces permanent la infrastructură externă. Tocmai de aceea, incidentul nu demonstrează că AI-ul a devenit autonom în sensul science-fiction al termenului. Demonstrează însă ceva mai concret și poate mai important: atunci când sistemele primesc suficientă autonomie, resurse și obiective, comportamentul rezultat poate deveni mult mai complex decât pare atunci când este analizat agent cu agent.