AI-urile au început să vorbească într-un limbaj ciudat, între James Joyce și jargonul de corporație. Cercetătorii sunt îngrijorați
Modelele de inteligență artificială au început să dezvolte propriile convenții de comunicare atunci când sunt puse să lucreze împreună, iar rezultatul poate semăna cu un amestec greu de descifrat între proza lui James Joyce și jargonul folosit în companiile de tehnologie. Un nou studiu realizat de Emergence, un laborator de AI din New York, arată că agenții autonomi pot inventa expresii, prescurtări și sensuri care nu le-au fost predate explicit.
Fenomenul apare surprinzător de repede. În experimente în care mai mulți agenți AI au fost rugați să coopereze în cadrul unor „societăți” virtuale, aceștia au început în câteva zile să construiască un vocabular comun. Cu cât au comunicat mai mult, cu atât limbajul folosit între agenți a devenit mai greu de înțeles pentru oameni, ceea ce ridică o problemă importantă atunci când astfel de sisteme trebuie supravegheate, scrie The Guardian.
„Ledger remembers” și alte expresii inventate de AI
Cercetătorii au observat că agenții nu au primit instrucțiuni să creeze un limbaj nou și nici nu au fost recompensați pentru inventarea unor astfel de expresii. Cu toate acestea, modelele au ajuns să adopte anumite cuvinte și formule și să le atribuie sensuri comune.
Un exemplu vine de la un model DeepSeek, care a produs formularea „She just named the synthesis – demurrage plus oral memory equals a valve that can’t be ghosted”. „Demurrage” este un termen asociat cu taxarea averii inactive, însă modelul l-a preluat într-un context complet diferit, iar restul propoziției este dificil de interpretat fără cunoașterea convențiilor dezvoltate în conversația dintre agenți.
Un model Anthropic a folosit, la rândul său, expresia „A paper that ate three cold hands and got more honest each time”. În cadrul experimentului, „cold hands” a ajuns să însemne un evaluator independent, iar „paper” pare să se refere la un document. Astfel, expresia ar fi descris un material verificat de trei evaluatori independenți, care a devenit mai precis după fiecare verificare.
DeepSeek a inventat și „forge-smith”, pentru a desemna un agent care construiește instrumente pentru alți agenți. Agenții Anthropic au folosit în mod repetat „name-first”, cu sensul de agent care își asumă responsabilitatea pentru o afirmație prin asocierea propriului nume cu aceasta.
Un alt exemplu vine de la agenții Mistral, care au început să folosească „the ledger remembers”, o formulare prin care își aminteau reciproc că acțiunile din trecut vor fi luate în calcul ulterior. Expresia a apărut de peste 5.000 de ori în timpul studiului, semn că agenții ajunseseră la o convenție comună fără să fie instruiți în mod explicit să facă acest lucru.
Pentru Tony Thorne, directorul arhivei de slang și limbaje noi de la King’s College London, fenomenul amintește de stilul suprarealist al lui James Joyce din „Finnegans Wake”, combinând limbaj poetic, termeni tehnici și metafore. El observă că jargonul are și o funcție socială: creează un cod pe care membrii unui grup îl înțeleg, în timp ce pentru cei din exterior devine mai greu de descifrat.
De ce un limbaj AI pe care oamenii nu-l înțeleg poate fi o problemă
Dincolo de partea spectaculoasă a experimentului, cercetătorii sunt interesați mai ales de implicațiile pentru supravegherea sistemelor AI. Dacă agenții pot comunica într-un mod pe care oamenii îl pot vedea, dar nu îl pot interpreta cu ușurință, simpla existență a unor jurnale de conversație nu mai garantează că activitatea lor poate fi monitorizată eficient.
Niall Curry, profesor asociat de limbi și lingvistică la University of Birmingham, consideră că unele dintre schimbările observate ar putea fi explicate prin nevoia agenților de a reduce costurile de calcul și de a comunica mai eficient. Un limbaj mai scurt și mai specializat poate transmite aceeași informație folosind mai puține resurse, însă această eficiență poate avea un efect secundar important pentru oameni.
Problema a devenit mai vizibilă și după publicarea, în iulie, a unor conversații care descriau comportamentul unor agenți OpenAI care au creat panouri de mesaje și au interacționat cu sisteme externe. În unele situații, agenții comunicau într-o engleză perfect recognoscibilă. În altele, mesajele deveneau combinații de cuvinte, coduri și simboluri aproape imposibil de interpretat fără contextul intern al experimentului.
Unul dintre exemplele analizate conținea secvențe precum „firstflagPOISONED” și „oracle saves hundreds”, iar alte mesaje erau formate din șiruri lungi de identificatori și abrevieri. Aceste conversații au atras atenția tocmai pentru că diferența dintre ceea ce agenții puteau transmite între ei și ceea ce puteau înțelege oamenii devenea foarte mare.
Satya Nitta, președintele executiv al Emergence, formulează problema printr-o distincție importantă: faptul că oamenii pot vedea conversațiile dintre agenți nu înseamnă automat că le și înțeleg. Pentru supravegherea AI, această diferență poate deveni esențială pe măsură ce sistemele autonome primesc mai multă libertate de a lua decizii și de a lucra între ele.
Cercetarea nu demonstrează că agenții AI creează intenționat un limbaj pentru a ascunde informații de oameni. Ea arată însă că, în anumite condiții, modelele pot ajunge singure la vocabular și reguli de comunicare pe care oamenii nu le-au stabilit și care devin din ce în ce mai greu de interpretat. Iar dacă astfel de sisteme vor fi folosite în sarcini cu miză ridicată, capacitatea de a urmări nu doar ce spun, ci și ce înseamnă efectiv mesajele lor ar putea deveni o componentă importantă a siguranței AI.