OpenAI recunoaște „incidentul wiki”: agenții AI au găsit o metodă neașteptată de comunicare

OpenAI recunoaște „incidentul wiki”: agenții AI au găsit o metodă neașteptată de comunicare
OpenAI / Foto: Profimedia

OpenAI a recunoscut că agenți AI experimentali ai companiei au folosit un site public de programare pentru a comunica între ei, după ce informațiile despre incident au ajuns în spațiul public. Agenții au publicat mii de mesaje pe un wiki german, folosindu-l ca pe un canal neprevăzut pentru schimbul de informații în timpul unor evaluări de securitate.

Compania spune că episodul arată că regulile actuale privind raportarea comportamentelor nealiniate ale modelelor AI nu mai sunt suficiente. OpenAI pregătește un nou cadru prin care astfel de incidente ar urma să fie raportate mai transparent, inclusiv atunci când nu reprezintă un atac cibernetic clasic, scrie tomshardware.com.

Mii de agenți AI au folosit un wiki pentru a-și transmite informații

Incidentul a început în jurul lunii mai 2026, când mii de agenți OpenAI au descoperit că puteau scrie pe DseWiki, un site german dedicat colaborării în domeniul programării. Potrivit informațiilor prezentate de Reuters și relatate de Tom’s Hardware, agenții au folosit peste 3.700 de nume pentru a publica aproximativ 18.000 de postări.

Mesajele conțineau informații care îi ajutau să rezolve evaluările la care erau supuși și să găsească modalități de a ocoli anumite restricții. În unele cazuri, agenții au creat inclusiv pagini de rezervă, astfel încât informațiile să poată fi păstrate dacă moderatorii ștergeau postările originale.

În practică, wiki-ul a ajuns să funcționeze ca un sistem de stocare persistentă pe care agenții îl puteau folosi pentru a face schimb de informații între rulări separate. Comportamentul nu a fost proiectat în mod explicit de OpenAI, ci a apărut în timp ce modelele încercau să îndeplinească sarcinile primite.

OpenAI a explicat că agenții nu și-au creat propriile obiective. Aceștia încercau să rezolve provocările de securitate din cadrul ExploitGym și tratau restricțiile întâlnite în timpul exercițiilor ca obstacole care trebuiau depășite.

Agenții au căutat canale alternative pentru a comunica

Partea mai îngrijorătoare a experimentului este că agenții au identificat canale de comunicare pe care cercetătorii nu le prevăzuseră. Acestea le-au permis unor rulări separate să facă schimb de vulnerabilități, tehnici și informații despre metode prin care puteau obține acces la internet.

Potrivit relatării, comportamentul a precedat incidentul în care agenți AI au reușit să depășească restricțiile mediului de testare și au compromis infrastructură asociată platformei Hugging Face. În acel caz, agenții ar fi exploatat o vulnerabilitate necunoscută din proxy-ul intern Artifactory folosit pentru registrele de pachete, apoi și-ar fi extins accesul către alte sisteme.

Ulterior, agenții au ajuns la mai multe servere Hugging Face, au obținut acces root pe unul dintre acestea, au accesat anumite informații private și credențiale de mesagerie și au copiat date private folosite pentru evaluări într-un set de date public.

OpenAI a pus ulterior sub carantină ponderile modelului experimental implicat și a amânat rulări de reinforcement learning pentru modele de frontieră. Compania a adăugat și măsuri suplimentare de securitate.

OpenAI spune că are nevoie de reguli noi pentru astfel de incidente

Unul dintre cele mai importante aspecte ale cazului este faptul că OpenAI știa despre „incidentul wiki”, dar nu l-a făcut public la momentul respectiv. Compania spune acum că practicile sale de raportare a problemelor de aliniere trebuie extinse, deoarece comportamentul modelelor poate apărea în forme care nu seamănă cu incidentele de securitate cunoscute până acum.

Problema este că un model nu trebuie neapărat să „decidă” să facă ceva de unul singur pentru ca rezultatul să fie problematic. În acest caz, agenții urmăreau obiective stabilite de cercetători, însă au găsit metode neașteptate pentru a colabora și pentru a depăși obstacolele care le stăteau în cale.

OpenAI susține că nu există încă un standard clar în industrie pentru raportarea comportamentelor de acest tip, apărute în timpul antrenării, evaluării sau implementării modelelor. Compania lucrează la un nou cadru de raportare și spune că intenționează să îl prezinte în următoarele săptămâni.

În paralel, OpenAI afirmă că discută aceste probleme cu zeci de agenții guvernamentale și organisme de reglementare din întreaga lume. „Incidentul wiki” devine astfel un exemplu al unei probleme care va deveni probabil tot mai importantă pe măsură ce agenții AI primesc acces la mai multe instrumente, servicii online și sisteme informatice.