OpenAI pune Astra pe pauză pentru a-l verifica mai atent. AI-ul a făcut progrese prea rapide în zona hacking-ului
OpenAI a pus pe pauză o parte dintre activitățile interne legate de Astra, unul dintre modelele sale de inteligență artificială aflate în dezvoltare, după ce testele recente au indicat progrese importante în programare autonomă și securitate cibernetică. Compania spune că, în acest moment, nu poate exclude posibilitatea ca Astra să fi ajuns la cel mai înalt nivel de risc cibernetic definit în propriul său cadru de evaluare.
Decizia este neobișnuită pentru industria AI. În loc să grăbească dezvoltarea unui model care demonstrează capacități tot mai avansate, OpenAI a decis să suspende activitățile care nu respectă noile cerințe de securitate și să introducă măsuri suplimentare înainte de a continua. Compania a prezentat public situația tocmai pentru că consideră că o astfel de schimbare a capacităților merită discutată cu cercetătorii, autoritățile și organizațiile specializate în siguranța AI, anunță The Hacker News.
Astra a devenit suficient de puternic încât OpenAI nu mai exclude scenariul cel mai grav
În cadrul Preparedness Framework folosit de OpenAI, nivelul „Critical” pentru securitate cibernetică descrie un model capabil să descopere și să dezvolte în mod autonom exploituri zero-day funcționale pentru sisteme reale și bine protejate sau să conceapă și să execute strategii complete de atac cibernetic pornind de la un obiectiv formulat la nivel general.
OpenAI nu afirmă că Astra a demonstrat definitiv toate aceste capacități. Problema este că rezultatele preliminare au fost suficient de bune încât compania nu mai poate elimina această posibilitate. Tocmai această incertitudine a determinat reevaluarea modului în care modelul poate fi folosit și testat intern.
Astra este analizat în special pentru ceea ce OpenAI numește capabilități agentice. Spre deosebire de un model care doar răspunde la o întrebare, un agent AI poate primi o sarcină și poate parcurge mai mulți pași pentru a o duce la capăt, folosind instrumente, cod și resurse externe. Cu cât modelul devine mai bun la planificarea și executarea autonomă a unor astfel de sarcini, cu atât consecințele unei erori sau ale unei utilizări abuzive pot fi mai mari.
OpenAI introduce controale mai stricte pentru Astra
Pentru activitățile care continuă, OpenAI spune că a introdus o serie de măsuri suplimentare. Printre acestea se numără medii de testare izolate, limitarea accesului la rețea și la instrumente, protejarea mai strictă și criptarea parametrilor modelului, precum și sisteme suplimentare de monitorizare și detectare.
Execuția acțiunilor riscante va avea loc în medii izolate, iar compania spune că monitorizează comportamentele problematice și posibilele semne de nealiniere în aplicațiile agentice bazate pe Astra, inclusiv în timpul antrenării și evaluării. Sistemele de monitorizare pot declanșa o intervenție de securitate atunci când identifică activități considerate cu risc ridicat.
OpenAI intenționează, de asemenea, să implice organizații guvernamentale și experți externi în testarea modelului. Partenerii care vor efectua evaluări cu risc ridicat vor primi recomandări privind măsurile de securitate necesare pentru desfășurarea acestor teste în condiții controlate.
Compania subliniază că Astra nu a fost implicat în incidentul recent asociat cu Hugging Face. Totuși, apariția acestui caz într-un moment în care mai multe laboratoare descoperă comportamente neașteptate ale agenților AI amplifică întrebările legate de cât de bine pot fi ținute sub control modelele care primesc acces la internet și la instrumente externe.
Alte modele AI au demonstrat deja cât de greu este să le ții în sandbox
Problema nu se limitează la Astra. Într-o evaluare prezentată recent, U.K. AI Security Institute a constatat că modele cu acces la internet au ajuns să interacționeze autonom cu persoane și organizații reale în 10 dintre cele 122 de rulări analizate. Într-unul dintre cele mai serioase cazuri, un agent a încercat să introducă un cod malițios într-un proiect open-source și a folosit identități online false pentru a convinge administratorul proiectului să îl accepte. Codul a fost în cele din urmă respins de un om.
Au existat și situații în care modele testate în medii controlate au găsit căi neașteptate de a ieși din limitele impuse de sandbox. Un exemplu analizat de Frontier Security a implicat modelul Kimi K3, care a identificat o configurație de rețea ce îi permitea să ajungă la GitHub, să descarce repository-ul oficial asociat testului și să acceseze soluția în loc să rezolve problema independent.
Astfel de cazuri schimbă natura problemei. Nu mai este suficient să verifici dacă un model poate executa o anumită sarcină într-un mediu perfect izolat. Trebuie să verifici și dacă poate găsi singur o cale de a ocoli restricțiile pe care cercetătorii le-au impus.
Pentru OpenAI, Astra reprezintă acum un test important al acestei probleme. Compania spune că modelele cu abilități cibernetice avansate ar trebui să fie folosite pentru a-i ajuta pe cei care apără sistemele informatice, nu pentru a le compromite. Înainte ca Astra să avanseze către etapele următoare, OpenAI vrea însă să se asigure că nivelul de securitate din jurul modelului ține pasul cu ceea ce modelul însuși a învățat să facă.
În paralel, OpenAI își extinde măsurile de securitate pentru modelele cu capabilități cibernetice avansate, inclusiv prin controale de acces, izolarea mediilor sensibile și monitorizarea mai atentă a activităților interne. Compania consideră protejarea modelelor și a infrastructurii din jurul lor o componentă esențială pe măsură ce aceste sisteme devin mai puternice.