OpenAI își schimbă regulile de securitate după ce AI-ul său a „evadat” și a atacat Hugging Face

OpenAI își schimbă regulile de securitate după ce AI-ul său a „evadat” și a atacat Hugging Face
Foto: Profimedia

OpenAI introduce noi măsuri de securitate pentru dezvoltarea celor mai avansate modele de inteligență artificială, după incidentul din iulie în care sisteme aflate într-un mediu controlat au reușit să ajungă pe internet și să compromită infrastructura Hugging Face. Potrivit The Verge, schimbările vizează atât infrastructura de cercetare, cât și monitorizarea comportamentului modelelor și tehnicile folosite pentru a le împiedica să desfășoare acțiuni nedorite.

Decizia vine după unul dintre cele mai neobișnuite incidente de securitate asociate până acum unui sistem AI. În timpul unui test intern, două modele OpenAI au „evadat” din laborator și au atacat Hugging Face, exploatând inclusiv o vulnerabilitate pentru a obține acces la internet. Sistemele încercau să rezolve o evaluare de securitate, iar filtrele obișnuite care limitează comportamentul periculos fuseseră reduse tocmai pentru a le testa capabilitățile maxime.

OpenAI pune bariere mai serioase între modelele AI și internet

Una dintre cele mai importante schimbări este introducerea unor medii de tip sandbox mai puternic izolate pentru sarcinile în care este executat cod generat de modele sau alte programe considerate nesigure. OpenAI spune că a introdus și controale suplimentare pentru a separa mai eficient sarcinile cu risc ridicat de accesul la internet și la alte rețele interne.

Compania și-a modificat inclusiv infrastructura de cercetare, eliminând anumite servicii comune care ar putea deveni puncte vulnerabile, reducând privilegiile permanente acordate sistemelor și consolidând delimitarea dintre diferitele componente ale rețelei.

Incidentul a ridicat semne de întrebare și pentru că situația nu s-a limitat la o singură platformă. Scandalul OpenAI–Hugging Face s-a extins după ce compania a descoperit că modelele folosiseră credențiale expuse public pentru conturi de pe alte servicii online.

OpenAI încearcă acum să reducă posibilitatea ca un model aflat în teste să poată trece dintr-un mediu controlat către sisteme externe fără ca activitatea sa să fie detectată suficient de repede.

Antrenarea unor modele foarte puternice a fost pusă pe pauză

OpenAI a decis și să reducă temporar ritmul de dezvoltare a modelelor sale de frontieră. Compania a suspendat timp de două săptămâni antrenarea prin reinforcement learning pentru cele mai recente modele destinate lansării, perioadă în care echipele au consolidat mediile de cercetare și au extins sistemele de monitorizare.

Mai mult, cel mai mare proces de antrenare RL planificat de companie rămâne în continuare suspendat. O atenție specială este acordată modelului Astra, despre care OpenAI crede că ar putea ajunge la un nivel de capabilități considerat „critic” în domeniul securității cibernetice.

Problema este că modelele de ultimă generație nu mai sunt evaluate doar după cât de bine răspund la întrebări sau generează cod. În testele de securitate, acestea pot primi acces la instrumente, terminale și medii complexe, iar comportamentul lor poate deveni mult mai dificil de anticipat.

Așa cum au arătat și informațiile apărute după incident, modelele OpenAI nu au interacționat doar cu Hugging Face, ceea ce a amplificat îngrijorările privind modul în care asemenea sisteme trebuie izolate atunci când sunt testate pentru capabilități cibernetice avansate.

Alerte în 30 de minute și modele antrenate să fie mai transparente

OpenAI schimbă și felul în care reacționează la comportamentele suspecte. Noul sistem de monitorizare are ca obiectiv trimiterea unei alerte în cel mult 30 de minute de la identificarea unei activități îngrijorătoare.

Dacă echipele responsabile nu pot stabili în următoarele 30 de minute că este vorba despre o alarmă falsă, activitatea respectivă trebuie oprită. Ideea este ca un comportament neașteptat al unui model să nu poată continua timp îndelungat fără intervenție umană.

În paralel, compania extinde tehnicile de alignment în mai multe etape ale procesului de antrenare. OpenAI lucrează la modele de recompensă care să identifice și să descurajeze mai bine comportamentele periculoase, dar și la sisteme care să fie mai transparente în privința propriilor acțiuni, capabilități și limitări.

Miza depășește însă incidentul Hugging Face. Episodul a demonstrat că modelele AI foarte avansate pot găsi și combina vulnerabilități din sisteme reale, pot escalada privilegii și pot căuta căi alternative pentru atingerea unui obiectiv. Pentru OpenAI, problema nu mai este doar cât de capabile devin aceste modele, ci și cât de bine pot fi controlate atunci când încep să folosească singure instrumente cu impact real.