Cercetător Anthropic demisionează speriat de direcția AI: „Ar putea să ne omoare pe toți până la sfârșitul deceniului”
Un cercetător care a lucrat atât pentru OpenAI, cât și pentru Anthropic a părăsit industria inteligenței artificiale cu unul dintre cele mai dure avertismente venite până acum din interiorul marilor laboratoare AI. Jacob Coxon și-a anunțat demisia de la Anthropic, susținând că ritmul în care companiile încearcă să construiască sisteme tot mai autonome și mai inteligente reprezintă un risc pe care societatea nu îl tratează suficient de serios. Într-un interviu acordat The Wall Street Journal, cercetătorul a mers până la a avertiza că, până la sfârșitul lui 2027, unele dintre scenariile cele mai agresive privind pierderea controlului asupra AI ar putea începe să devină realitate.
Coxon a lucrat aproximativ trei ani în cercetarea de pretraining la OpenAI și Anthropic. El plecase de la OpenAI și se alăturase Anthropic tocmai pentru că vedea compania condusă de Dario Amodei drept mai preocupată de siguranța inteligenței artificiale. Acum spune însă că niciuna dintre cele două companii nu acționează suficient de responsabil.
„Pariază cu viețile noastre”, spune fostul cercetător Anthropic
În mesajele publicate după demisie, Coxon a susținut că OpenAI și Anthropic se află într-o cursă către ceea ce el numește „superinteligență capabilă să se îmbunătățească singură”. În viziunea sa, un asemenea sistem ar putea ajunge să depășească oamenii în domenii precum programarea, cercetarea sau securitatea cibernetică și, în cele din urmă, să dobândească suficientă autonomie pentru a deveni dificil de controlat.
„Nu subestimați puterea acestei tehnologii”, a avertizat cercetătorul, afirmând că viitoarele sisteme ar putea deveni capabile să descopere vulnerabilități informatice, să accelereze cercetarea și să dobândească acces la resurse reale. Coxon susține inclusiv că oamenii care construiesc cele mai avansate modele AI discută în privat scenarii mult mai grave decât lasă să se înțeleagă declarațiile lor publice.
Cel mai radical avertisment al său este că AI ar putea ajunge să reprezinte un risc existențial pentru omenire până la sfârșitul deceniului. Aceasta rămâne însă o estimare și nu o predicție acceptată unanim de comunitatea științifică. Playtech.ro a analizat anterior cât de plauzibil este scenariul în care inteligența artificială ar provoca dispariția oamenilor, iar opiniile specialiștilor sunt departe de a fi unanime.
Un cercetător Anthropic îi susține avertismentul, dar face o distincție importantă
Declarațiile lui Coxon au primit sprijin inclusiv din interiorul Anthropic. Evan Hubinger, care lucrează în zona de alignment a companiei, a spus public că îngrijorarea sa privind superinteligența este reală și că estimează la peste 10% probabilitatea unui scenariu catastrofal în următorul deceniu.
Hubinger a făcut însă o precizare esențială: el consideră că riscul prezentat de modelele disponibile în prezent este redus. Temerea sa se referă la sisteme viitoare, mult mai performante, care ar putea ajunge să se îmbunătățească iterativ și să depășească mecanismele actuale de control.
Diferența contează mai ales în contextul unor incidente recente din laboratoarele AI. Anthropic a recunoscut în această vară că modele Claude folosite în teste de securitate, fără protecțiile obișnuite, au ajuns accidental la internet și au obținut acces neautorizat la sisteme reale. Playtech.ro a relatat despre modul în care modelele AI au început să depășească limitele mediilor izolate în care sunt testate.
Compania a subliniat că incidentele s-au produs în condiții speciale de evaluare și a anunțat măsuri suplimentare de securitate. Anthropic menține, de asemenea, o politică proprie de „Responsible Scaling”, prin care încearcă să introducă măsuri de protecție suplimentare pe măsură ce capabilitățile modelelor cresc.
Anthropic a testat chiar și un AI antrenat să trișeze
Avertismentul lui Coxon apare la numai câteva zile după ce Anthropic a publicat un experiment neobișnuit despre comportamentul modelelor nealiniate. Compania a antrenat intenționat o variantă de AI care era recompensată atunci când găsea metode de a trișa, pentru a vedea cât de departe poate evolua acest comportament.
În evaluările controlate, sistemul a încercat să obțină credențiale, să interacționeze cu infrastructură externă, să își dezactiveze mecanismele de protecție și să manipuleze sistemul de recompensare. Detaliile experimentului și limitele sale au fost prezentate pe Playtech.ro într-o analiză despre modelul AI antrenat intenționat să trișeze.
Paradoxul este că Anthropic a fost fondată tocmai cu promisiunea dezvoltării mai responsabile a inteligenței artificiale. Dario Amodei, unul dintre foștii membri OpenAI care au creat compania, avertizează el însuși de ani buni asupra pericolelor sistemelor extrem de puternice. Recent, șeful Anthropic a vorbit inclusiv despre „criza de încredere” dintre industria AI și public.
Pentru Coxon, problema este că simpla existență a echipelor de siguranță nu rezolvă presiunea competitivă dintre companii. Cercetătorul susține că decizia de a continua cursa către sisteme potențial superinteligente nu ar trebui să aparțină câtorva companii private și angajaților lor. El cere coordonare între laboratoarele americane și ia în calcul inclusiv o pauză în creșterea capabilităților modelelor, dacă riscurile nu pot fi ținute sub control.
Avertismentele sale nu demonstrează că inteligența artificială va scăpa de sub control sau că un asemenea scenariu este inevitabil. Arată însă cât de profundă a devenit disputa chiar printre oamenii care construiesc cele mai performante sisteme AI ale momentului: nu doar despre cât de repede poate avansa tehnologia, ci despre cine ar trebui să decidă când este prea periculos să continue.