AI-ul poate descoperi lucruri noi despre biologie, dar există un risc pe care cercetătorii îl ignoră
Inteligența artificială poate ajuta cercetătorii să găsească proteine promițătoare, să caute medicamente noi și să interpreteze cantități uriașe de date biologice. Există însă o problemă care devine tot mai importantă pe măsură ce aceste sisteme sunt folosite în laborator: AI-ul poate produce rezultate care par perfect plauzibile, dar care nu au nicio bază în realitatea biologică.
Fenomenul este cunoscut drept „halucinație” și este deja familiar în cazul instrumentelor AI care generează texte sau imagini. În biologie, consecințele pot fi mult mai serioase. Un model ar putea inventa un tipar molecular, modifica subtil date experimentale sau sugera un mecanism al unei boli care, în realitate, nu există.
Când rămâne o greșeală a AI-ului doar o greșeală
Thomas Burger, biolog computațional la Universitatea Grenoble Alpes din Franța, a analizat această problemă în cadrul unei lucrări publicate în revista Patterns. Cercetătorul a examinat zece moduri în care inteligența artificială generativă ar putea fi utilizată în cercetarea biologică și a constatat că nivelul de risc diferă considerabil în funcție de rolul pe care îl primește AI-ul.
Una dintre utilizările mai puțin problematice este trierea unor posibile medicamente sau proteine. Un model poate analiza rapid mii sau chiar milioane de variante și poate selecta câteva care par suficient de interesante pentru a fi testate în laborator, se arată în Patterns.
Dacă AI-ul greșește în acest caz, consecințele pot fi costisitoare, dar rezultatul nu devine automat o descoperire științifică. Un medicament promițător poate fi eliminat prea devreme din cercetare sau oamenii de știință pot pierde timp și bani pe un candidat care nu funcționează. În ambele situații, experimentul real este cel care decide dacă predicția AI are sau nu valoare.
Problema devine mult mai complicată atunci când datele generate artificial încep să fie folosite în locul măsurătorilor reale.
Cel mai mare pericol apare când datele artificiale devin dovezi
Cercetarea biologică modernă produce volume uriașe de informații despre gene, proteine și alte molecule. Inteligența artificială poate fi folosită pentru a analiza aceste seturi de date, pentru a completa valori lipsă sau chiar pentru a genera date sintetice.
Există motive legitime pentru a face acest lucru. Datele artificiale pot ajuta la protejarea informațiilor despre pacienți, pot reduce costurile anumitor cercetări sau pot permite crearea unor grupuri de comparație fără efectuarea tuturor experimentelor. În unele situații, ele ar putea contribui chiar la reducerea numărului de animale folosite în cercetare.
Dar dacă AI-ul introduce într-un astfel de set de date un element care nu exista în realitate, cercetătorii se pot trezi într-o situație periculoasă. Nu mai au de-a face doar cu o predicție greșită, ci cu o informație fabricată care poate fi interpretată drept dovadă experimentală.
Iar problema nu este neapărat una ușor de observat. AI-ul nu trebuie să inventeze o descoperire completă pentru a schimba concluzia unui studiu. Este suficient să modifice subtil un semnal real în timpul procesării, să-l amplifice, să-l reducă sau să-i schimbe caracteristicile. Rezultatul final poate părea în continuare perfect plauzibil.
Pentru cercetător, diferența poate fi extrem de greu de sesizat dacă nu înțelege în detaliu modul în care modelul AI a intervenit asupra datelor.
AlphaFold 3 arată că problema nu este doar teoretică
Un exemplu relevant vine de la AlphaFold 3, modelul dezvoltat pentru predicția structurilor și interacțiunilor moleculare. Într-o lucrare publicată în Nature în 2024, cercetătorii care au prezentat sistemul au menționat că acesta poate genera structuri „halucinate” în anumite regiuni ale proteinelor care nu au o structură bine definită.
În acest caz, nivelurile scăzute de încredere oferite de model pot reprezenta un semnal de avertizare pentru cercetători. Problema este că nu toate erorile AI sunt la fel de ușor de identificat.
Un model poate, de exemplu, să introducă suficientă distorsiune într-un set de date încât un efect biologic real să devină mai greu de observat. În loc să creeze o descoperire falsă, AI-ul ar putea contribui la pierderea uneia reale. Un posibil tratament eficient ar putea fi respins deoarece datele procesate nu mai reflectă suficient de bine semnalul inițial.
Există chiar și o posibilitate mai neașteptată: o halucinație AI ar putea, accidental, să conducă cercetătorii către o descoperire reală. Știința are o lungă istorie de rezultate neașteptate apărute în urma unor erori de laborator sau observații accidentale. Dacă o ipoteză generată de AI este ulterior verificată și confirmată independent, originea ei nu schimbă faptul că rezultatul poate fi valid.
Diferența esențială este însă ce se întâmplă după ce AI-ul oferă rezultatul. Dacă îl tratezi ca pe o idee care trebuie verificată, o eroare rămâne o ipoteză greșită. Dacă o tratezi ca pe o observație reală și o introduci în lanțul de dovezi fără verificare, aceeași eroare poate ajunge să influențeze concluziile unui întreg proiect de cercetare.
Asta înseamnă că, indiferent cât de convingător este rezultatul produs de un model AI, el nu ar trebui considerat o descoperire biologică până când nu este confirmat prin experimente reale și independente. În cercetare, problema nu este doar dacă AI-ul poate găsi ceva nou, ci dacă oamenii pot demonstra că acel „ceva” există și în lumea reală.