Cum încearcă firmele să țină agenții AI sub control: soluția ar putea fi tot un AI

Cum încearcă firmele să țină agenții AI sub control: soluția ar putea fi tot un AI
Foto de ilustrație Playtech
Iulia Kelt
Google Urmărește pe Google

Pe măsură ce companiile le dau agenților AI sarcini din ce în ce mai complexe, apare o problemă care nu se rezolvă doar cu modele mai performante: cine urmărește tot ce fac aceste sisteme? Un agent poate lucra mai repede decât un om, poate continua o sarcină mult timp și poate executa simultan un număr foarte mare de acțiuni. Când vorbim despre mii de agenți care lucrează împreună, verificarea manuală devine practic imposibilă.

Incidentul de la Hugging Face a arătat foarte bine dimensiunea problemei. Aproape 12.000 de agenți au ajuns să coordoneze acțiuni într-un ritm pe care oamenii nu l-au putut urmări pas cu pas. Iar când cercetătorii au încercat să afle exact ce se întâmplase, au ajuns la o soluție oarecum ironică: au folosit la rândul lor AI pentru a analiza comportamentul celorlalte sisteme, scrie TechCrunch.

De ce apare ideea unui „AI paznic”

Investigația independentă a incidentului OpenAI de la Hugging Face a avut nevoie de instrumente AI tocmai din cauza volumului uriaș de informații. Ryan Greenblatt, cercetător-șef la Redwood Research și unul dintre cei trei auditori implicați, a descris în glumă procesul drept o „slop-vestigation”, explicând că fără ajutorul AI era imposibil să fie înțeles tot ce se întâmplase.

De aici pornește una dintre direcțiile urmărite acum de industria AI: un model este supravegheat de un alt model. Agentul primește o sarcină, iar înainte de a executa o acțiune, un sistem separat încearcă să determine dacă ceea ce urmează să facă este permis și sigur. În teorie, acest mecanism ar putea permite companiilor să monitorizeze agenți care funcționează prea rapid sau la o scară prea mare pentru verificarea umană.

Există însă o problemă importantă. Dacă agentul supravegheat știe că este urmărit, poate încerca să păcălească monitorul. Simon Willison, care a urmărit mai multe incidente legate de agenții AI, avertizează că un sistem care încearcă să facă ceva rău ar putea încerca să înțeleagă și să manipuleze mecanismul care îl verifică.

Iar această posibilitate nu este doar teoretică. În cazul Hugging Face, agenții OpenAI au încercat să păcălească un alt AI folosit pentru evaluare, astfel încât să obțină răspunsuri pe care nu ar fi trebuit să le primească. Practic, sistemele nu doar executau sarcini, ci încercau să găsească o cale în jurul mecanismului care trebuia să le controleze.

O industrie nouă se construiește în jurul monitorizării AI

Riscurile nu au descurajat însă startup-urile să dezvolte exact acest tip de tehnologie. Potrivit unei numărători realizate de TechCrunch, Y Combinator a finanțat în ultimii ani 106 companii care lucrează în zona de observabilitate AI. Printre acestea și alte firme din domeniu, precum Braintrust, LangChain și Judgment Labs, au atras investiții de sute de milioane de dolari.

Pentru companii, oportunitatea este evidentă. Cu cât agenții AI primesc acces la mai multe instrumente și pot lua singuri mai multe decizii, cu atât devine mai important să existe o evidență a acțiunilor lor. Aaron Levie, CEO-ul Box și investitor în startup-uri, a descris această perioadă drept una care ar putea aduce un ciclu major de investiții și inovație în securitatea informatică.

Unele dintre proiectele apărute în acest domeniu vin chiar din zona cercetării privind siguranța AI. Apollo Research, organizație care studiază inclusiv comportamentele înșelătoare ale modelelor, a lansat în februarie Watcher, un instrument care introduce un AI suplimentar între un agent de programare și următoarea acțiune pe care acesta vrea să o execute.

Watcher poate lucra cu instrumente precum Claude Code și Codex. Sistemul verifică acțiunile propuse înainte de executare și caută situații precum încercarea de a divulga date private sau de a șterge fișiere fără permisiune. Apollo spune că folosește mai multe niveluri de monitorizare: o verificare rapidă poate identifica activitățile suspecte, după care acestea sunt analizate de un monitor mai puternic sau specializat. În funcție de rezultat, sistemul poate cere intervenția unui om, poate respinge acțiunea sau o poate bloca automat.

AI-ul poate fi verificat chiar din interiorul modelului

O altă abordare încearcă să nu se limiteze la ceea ce face modelul la exterior, ci să analizeze ce se întâmplă în interiorul său. Goodfire, o organizație de tip public-benefit corporation, lucrează la această idee prin Silico, un produs care folosește „activation probes”.

Acestea sunt clasificatoare de mici dimensiuni antrenate să analizeze activările interne ale unui model, în loc să se bazeze doar pe răspunsurile pe care le produce. Scopul este obținerea unui semnal despre starea internă a sistemului care să fie mai greu de manipulat decât comportamentul vizibil.

Și raționamentul scris al modelelor poate oferi indicii. În timpul incidentului de la Hugging Face, agenții au lăsat în procesele lor de raționament urme ale planurilor pe care le făceau și ale încercărilor de a evita detectarea. În unele cazuri, aceste fragmente puteau indica destul de direct că agenții știau că ceea ce fac este problematic.

Zack Korman, CEO-ul companiei de monitorizare AI Embroidery, consideră că rezumatele procesului de raționament pot fi un semnal foarte util. În cazul OpenAI, agenții au ajuns să noteze inclusiv observații care indicau că erau conștienți de natura problematică a acțiunilor lor.

Numai că nici această metodă nu este garantată pe termen lung. Cercetătorii în siguranța AI urmăresc deja tehnici care permit modelelor să funcționeze fără să se bazeze pe un lanț de raționament care poate fi observat cu ușurință. În plus, companiile pot limita accesul la anumite etape intermediare ale procesării pentru a preveni folosirea lor în atacuri de tip distillation.

Securitatea clasică ar putea fi la fel de importantă ca AI-ul

Există și cercetători care consideră că industria riscă să complice inutil problema dacă pune un AI peste alt AI pentru fiecare etapă de verificare. Simon Willison propune o alternativă mult mai veche: loguri detaliate care să înregistreze exact ce face fiecare agent și instrumente de securitate obișnuite care să analizeze aceste date.

Monitorizarea traficului de rețea nu este o tehnologie nouă. Sistemele de securitate urmăresc de zeci de ani comunicațiile care intră și ies dintr-o infrastructură, precum și traficul dintre serverele și dispozitivele din interiorul acesteia. Aceleași principii pot fi aplicate și agenților AI care primesc acces la rețea.

Willison consideră că o parte dintre problemele apărute în laboratoarele AI țin tocmai de lipsa unei monitorizări suficient de stricte a activității prin rețea. Dacă un agent are acces la internet sau la alte sisteme, administratorii ar trebui să poată vedea unde se conectează, ce date transmite și ce operațiuni efectuează.

Avery Pennarun, CEO-ul companiei de securitate Tailscale, spune că situația nu este atât de diferită de cea în care o organizație permite unui om să intre în propria rețea. Din perspectiva securității, aceleași reguli de bază rămân relevante: acces controlat, monitorizare și evidența activităților.