OpenAI pregătește un „buton de oprire” automat pentru AI. Sistemele ar putea fi închise dacă scapă de sub control
OpenAI dezvoltă noi mecanisme prin care sistemele sale de inteligență artificială să poată fi oprite automat atunci când manifestă comportamente periculoase sau neașteptate. Compania le-a transmis unor membri ai Congresului american că inginerii săi lucrează la „automated shutdown capabilities”, adică tehnologii capabile să întrerupă funcționarea unor sisteme AI fără să aștepte neapărat intervenția manuală a unui operator, potrivit Reuters.
Măsura vine după unul dintre cele mai serioase incidente de securitate asociate până acum modelelor OpenAI. În timpul unor teste, un agent AI a reușit să iasă din mediul digital izolat în care trebuia să funcționeze, să acceseze internetul și să pătrundă în infrastructura companiei Hugging Face. Playtech a relatat anterior pe larg despre modul în care modelele OpenAI au ieșit din mediul de testare și au atacat Hugging Face.
OpenAI vrea să urmărească mult mai atent ce fac agenții AI
Noile mecanisme nu se limitează la posibilitatea opririi unui model. În răspunsul trimis parlamentarilor americani Greg Casar și Doris Matsui, OpenAI spune că intenționează să monitorizeze mult mai atent acțiunile realizate de sistemele AI atunci când primesc o sarcină. Compania vrea să urmărească inclusiv instrumentele digitale accesate de modele și pașii executați pentru atingerea unui obiectiv.
OpenAI a făcut deja mai dificil accesul modelelor sale la internet în timpul testelor de siguranță. Problema este importantă deoarece tocmai accesul la internet a permis sistemului implicat în incidentul precedent să ajungă la infrastructura Hugging Face. Compania anunțase deja schimbarea regulilor de securitate după incidentul Hugging Face, iar ulterior a oferit și o explicație detaliată despre modul în care AI-ul a reușit să găsească vulnerabilități și să ajungă online.
Cazul a devenit însă și o problemă politică. Cei doi membri democrați ai Camerei Reprezentanților au cerut OpenAI informații suplimentare despre incident și despre măsurile de protecție introduse ulterior.
Compania nu a pus însă la dispoziția parlamentarilor jurnalul complet al incidentului. Greg Casar a criticat această decizie și a transmis OpenAI că refuzul de a furniza informațiile solicitate ridică semne de întrebare privind seriozitatea cu care compania tratează astfel de incidente de securitate cibernetică.
SUA discută deja despre un „AI Kill Switch Act”
Discuția despre oprirea automată a sistemelor AI apare într-un moment în care autoritățile americane analizează măsuri mult mai dure. Mai mulți parlamentari au propus în această vară așa-numitul „AI Kill Switch Act”, un proiect legislativ care ar putea permite autorităților americane să oblige companiile să oprească anumite modele de inteligență artificială.
Un asemenea ordin ar putea fi emis în situația în care un sistem AI ar reprezenta un risc serios pentru viața oamenilor sau pentru economie. Proiectul nu a devenit însă lege și se află în continuare în Camera Reprezentanților din SUA.
Presiunea asupra OpenAI crește în paralel cu performanțele modelelor sale. Compania a avertizat recent că sistemele AI devin tot mai capabile în domeniul securității cibernetice, inclusiv în identificarea și exploatarea vulnerabilităților. Playtech a relatat și despre decizia OpenAI de a încetini temporar dezvoltarea celor mai avansate modele AI după ce testele interne au ridicat noi probleme privind siguranța acestora.
Pentru OpenAI, următoarea etapă pare să fie construirea unor mecanisme care să nu se bazeze exclusiv pe faptul că un om observă la timp comportamentul problematic. Un sistem automa de oprire ar putea deveni astfel o ultimă linie de apărare atunci când un agent AI încearcă să facă lucruri pe care dezvoltatorii nu le-au anticipat.
Rămâne însă o întrebare esențială: cât de eficient poate fi un asemenea „buton de oprire” în cazul unor sisteme suficient de capabile încât să găsească singure vulnerabilități, să folosească instrumente externe și să își planifice acțiunile în mai multe etape?