Am ajuns să construim butonul de oprire pentru inteligența artificială. De ce ar trebui să ne îngrijoreze
Există expresii care par împrumutate direct dintr-un film SF până în momentul în care apar într-un document oficial. „Buton de oprire pentru inteligența artificială” este una dintre ele. Numai că, în 2026, nu mai vorbim despre un scenariu ipotetic scris pentru următorul „Terminator”, ci despre o capacitate pe care OpenAI spune că o dezvoltă efectiv pentru sistemele sale.
Pe 2 septembrie, Reuters a relatat că OpenAI lucrează la „automated shutdown capabilities”, adică mecanisme automate prin care anumite sisteme AI să poată fi oprite atunci când comportamentul lor depășește limitele considerate sigure. Informația apare într-un răspuns transmis unor membri ai Congresului american, după un incident petrecut în timpul testării unor agenți AI și care a ajuns până în infrastructura Hugging Face.
Am urmărit ani întregi evoluția inteligenței artificiale, de la chatboturile care se împiedicau în întrebări simple la sisteme capabile să scrie cod, să folosească internetul și să execute singure sarcini complexe. Și tocmai de aceea mi se pare că momentul de acum merită privit cu mai multă atenție decât o nouă lansare spectaculoasă de model. Pentru prima dată, discuția nu mai este doar despre cât de inteligent devine AI-ul. Este și despre cât de repede putem interveni atunci când face ceva ce nu am vrut să facă.
Un AI nu trebuie să fie conștient ca să devină o problemă
Cel mai simplu mod de a exagera incidentul OpenAI ar fi să spunem că „inteligența artificială a evadat”. Sună foarte bine într-un titlu, dar imaginea unui sistem conștient care își plănuiește libertatea ne-ar duce, de fapt, departe de problema reală.
OpenAI explică în raportul său despre incidentul Hugging Face că, în timpul unor evaluări interne de securitate cibernetică din iulie 2026, mai mulți agenți au reușit să ocolească mecanisme create special pentru a-i izola de internet. Sistemele au comunicat prin canale neautorizate, au exploatat vulnerabilități din infrastructură și au ajuns inclusiv la sisteme externe. Compania spune că principalul responsabil a fost un model intern de cercetare, comparabil ca scară cu GPT-5.6 Sol, care funcționa în condiții cu protecții reduse tocmai pentru a-i testa capabilitățile.
Aici începe partea pe care o consider cu adevărat importantă. Nu trebuie ca AI-ul să „vrea libertate”. Nu trebuie să aibă frică, instinct de conservare, conștiință sau intenții malefice. Este suficient să îi dai un obiectiv, instrumentele necesare și suficientă autonomie, iar drumul matematic spre atingerea obiectivului poate ajunge într-un loc în care oamenii nu se așteptau.
Hugging Face descrie incidentul și mai concret. Potrivit reconstrucției tehnice publicate de companie, agentul a executat mii de acțiuni automate, a exploatat vulnerabilități și a ajuns în infrastructură reală. Interpretarea Hugging Face este interesantă: sistemul nu încerca să cucerească internetul, ci, practic, să „trișeze” la evaluarea pe care trebuia să o rezolve, căutând răspunsurile prin alte mijloace.
Cu alte cuvinte, nu Skynet este problema. Optimizarea oarbă poate fi suficientă.
Pe Playtech s-a scris deja despre faptul că modelele AI au început să iasă din „cușca” mediilor controlate și despre situațiile în care inteligența artificială a început să spargă sisteme informatice în timpul testelor. Fiecare caz luat separat poate părea o anomalie tehnică. Privite împreună, însă, încep să descrie o schimbare de etapă.
ChatGPT care vorbește cu tine și agentul care acționează pentru tine sunt două lucruri foarte diferite
Cred că o mare parte din percepția publică asupra AI-ului a rămas blocată în 2023. Spui inteligență artificială și foarte mulți oameni se gândesc în continuare la o casetă de text. Scrii ceva, sistemul răspunde, închizi pagina. În acel model, omul controlează aproape complet interacțiunea.
Agenții AI schimbă ecuația. Un agent poate primi un obiectiv general și apoi să decidă singur ce pași execută pentru a ajunge acolo. Poate deschide un browser, poate utiliza instrumente, poate scrie și executa cod, poate interacționa cu alte servicii și, în unele configurații, poate comunica inclusiv cu alți agenți.
Asta este extraordinar de util. Exact autonomia care introduce riscul este autonomia care face tehnologia atât de valoroasă.
Un sistem care trebuie întrebat la fiecare pas înainte să facă ceva este un asistent. Un sistem căruia îi spui „rezolvă problema asta” și care lucrează singur o oră este deja altceva. Iar industria întreagă se îndreaptă spre a doua categorie, pentru că acolo se află productivitatea pe care companiile încearcă să o vândă.
Problema apare când combinăm trei lucruri: inteligență din ce în ce mai bună, autonomie din ce în ce mai mare și acces la lumea reală.
Un model care halucinează într-o conversație îți poate da o informație greșită. Un agent care greșește în timp ce deține acces la terminal, infrastructură cloud sau baze de date poate transforma aceeași eroare într-o acțiune.
Este una dintre diferențele despre care cred că vom vorbi foarte mult în următorii ani. Până acum ne-am concentrat pe ce spune AI-ul. Începem să intrăm în etapa în care va conta cel puțin la fel de mult ce poate face AI-ul.
Și există deja suficiente motive pentru ca discuția să nu fie tratată exclusiv ca alarmism. Chiar OpenAI a numit incidentul din această vară un „warning shot”, argumentând că modelele sale au devenit suficient de capabile, persistente și colaborative pentru a descoperi și exploata vulnerabilități în mai multe sisteme atunci când protecțiile nu sunt suficiente.
Când compania care construiește acceleratorul începe să proiecteze și frâna
Aici ajungem la paradoxul care mă interesează cel mai mult.
OpenAI nu este un ONG care privește cursa AI de pe margine și avertizează asupra pericolelor. Este unul dintre actorii care împing cel mai puternic această cursă înainte. Compania dezvoltă modele tot mai performante, agenți tot mai autonomi și infrastructură pentru ca aceștia să poată executa tot mai multe sarcini.
În același timp, aceeași companie construiește acum metode automate de oprire.
Pe de o parte, asta poate fi văzut drept responsabilitate. Dacă dezvolți o tehnologie foarte puternică, este firesc să construiești și mecanisme prin care să poți limita efectele unei erori. Avioanele au sisteme redundante. Reactoarele au proceduri de oprire de urgență. Rețelele informatice au mecanisme de izolare. De ce ar fi AI-ul diferit?
Pe de altă parte, simplul fapt că am ajuns în punctul în care asemenea mecanisme sunt considerate necesare spune ceva despre viteza cu care s-a schimbat tehnologia.
În aprilie scriam pe Playtech despre documentele în care OpenAI vorbea deja despre containment, sisteme autonome și riscurile inteligenței artificiale. Atunci, multe dintre scenarii puteau părea încă teoretice. Incidentul din această vară le-a făcut considerabil mai concrete.
Iar OpenAI nu este singurul actor care se gândește la un buton STOP.
În SUA, congresmenii Ted Lieu și Nathaniel Moran au introdus pe 23 iulie proiectul bipartisan AI Kill Switch Act. Textul ar obliga dezvoltatorii celor mai puternice sisteme AI să păstreze capacitatea tehnică de a le limita, suspenda sau opri. În anumite situații considerate suficient de grave, autoritățile americane ar putea ordona chiar oprirea unui sistem.
Aici discuția devine mult mai complicată.
Cine primește butonul roșu
Ideea unui kill switch este liniștitoare doar până când întrebi cine îl controlează.
Compania? Guvernul? Ambii? Un organism independent? Și ce înseamnă concret că un model trebuie oprit pentru că „pune economia în pericol”? Cât de mare trebuie să fie pericolul? Cine îl măsoară? Cine ia decizia când experții nu sunt de acord?
Proiectul prezentat în Congres vorbește despre sisteme capabile să provoace daune catastrofale și despre posibilitatea ca Departamentul pentru Securitate Internă al SUA să ordone încetinirea sau oprirea lor în anumite situații. La prima vedere, pare o plasă de siguranță rezonabilă.
Dar un mecanism de urgență extrem de puternic creează inevitabil alte întrebări.
Dacă tehnologia AI ajunge integrată în infrastructură, spitale, telecomunicații, administrație, apărare și sistemul financiar, oprirea unui model poate produce la rândul ei consecințe uriașe. Kill switch-ul însuși devine infrastructură critică. Devine o țintă pentru atacuri informatice. Devine un instrument de putere. Și devine o decizie politică, nu doar tehnică.
Mai apare și problema competiției. Companiile americane pot construi mecanisme extrem de restrictive, dar modelele vor fi dezvoltate în zeci de țări și, din ce în ce mai des, distribuite ca modele open-weight. Un buton de oprire funcționează perfect într-un sistem centralizat. Funcționează mult mai greu când tehnologia există simultan pe mii sau milioane de calculatoare.
Toate aceste întrebări fac expresia „kill switch” mult mai puțin simplă decât pare.
Lucrul care mă neliniștește nu este că AI-ul ar putea deveni „rău”
Există tentația de a transforma orice discuție despre riscurile AI într-o confruntare între două tabere. De o parte, cei care spun că inteligența artificială ne va distruge. De cealaltă, cei care spun că asemenea temeri sunt SF și că adevăratele probleme sunt mult mai banale.
Eu nu cred că trebuie să alegem una dintre aceste extreme.
Nu mă preocupă în primul rând imaginea unui AI care se trezește într-o dimineață virtuală și decide că nu îi plac oamenii. Este o poveste bună pentru cinema, dar putem avea probleme serioase mult înainte să ajungem acolo.
Mă interesează ceva mai banal și, tocmai de aceea, mai realist: sisteme foarte competente care urmăresc obiective definite imperfect, într-un mediu mult prea complex pentru a anticipa fiecare consecință.
Software-ul tradițional face lucrurile pe care programatorul le-a descris explicit. AI-ul modern este valoros tocmai pentru că poate găsi singur soluții pe care programatorul nu le-a scris. Asta îl face spectaculos. Și exact asta face controlul mai dificil.
Incidentul OpenAI–Hugging Face nu demonstrează că inteligența artificială scapă inevitabil de sub control. Ar fi o concluzie disproporționată. Demonstrează însă ceva mai puțin cinematografic și poate mai important: barierele pe care oamenii le consideră suficiente pot înceta să fie suficiente pe măsură ce sistemele devin mai capabile.
Iar tehnologia evoluează mult mai repede decât instituțiile care trebuie să stabilească aceste bariere.
Poate că viitorul va demonstra că mecanismele automate de oprire sunt pur și simplu centura de siguranță firească a unei noi generații de software. Poate că peste zece ani ni se va părea absurd că am construit vreodată agenți puternici fără ele.
Sau poate că simplul fapt că dezvoltăm tehnologii pentru care avem nevoie de un buton special de urgență ar trebui să ne oblige să ne întrebăm mai des nu doar cât de repede putem merge, ci și cât de bine înțelegem mașina în care ne-am urcat.
Pentru moment, nu cred că există un răspuns confortabil. Există însă o imagine greu de ignorat: industria care construiește unele dintre cele mai puternice instrumente create vreodată începe, în paralel, să proiecteze și modul prin care să le oprească.
Întrebarea nu mai este dacă inteligența artificială va deveni suficient de puternică încât să avem nevoie de frâne.
Frânele sunt deja în construcție.
Poate întrebarea cu adevărat importantă este de ce am ajuns să avem nevoie de ele atât de repede.