Watermark-ul AI al Claude a fost deja „spart”: au apărut instrumente care promit să șteargă urmele lăsate de Anthropic
La doar câteva săptămâni după ce Anthropic a început să introducă un sistem prin care textele generate de Claude pot fi recunoscute automat ca fiind produse cu ajutorul inteligenței artificiale, dezvoltatorii au venit deja cu răspunsul: instrumente create special pentru eliminarea acestor urme. Potrivit Business Insider, fenomenul a apărut aproape imediat după anunțarea sistemului, iar unul dintre cele mai populare proiecte open-source a atras rapid mii de dezvoltatori. Subiectul a fost relatat și de The Next Web.
Măsura Anthropic este legată de noile cerințe europene de transparență pentru conținutul generat prin inteligență artificială. Playtech a explicat deja cum marchează Claude textele și fișierele generate cu AI. Problema este că, exact cum anticipau cercetătorii, apariția unui mecanism de identificare a creat rapid și o piață pentru instrumentele care încearcă să-l păcălească.
Cum funcționează, de fapt, watermark-ul din textele Claude
Spre deosebire de un filigran clasic aplicat peste o fotografie, watermark-ul Anthropic nu este un text vizibil și nici o colecție de caractere ascunse introdusă în document. Compania explică faptul că sistemul folosește o versiune a tehnologiei SynthID-Text și modifică foarte subtil modul în care modelul alege între mai multe cuvinte la fel de potrivite. În timp, aceste alegeri lasă un tipar statistic care poate fi recunoscut cu ajutorul unei chei speciale.
Pentru cititor, textul ar trebui să arate exact la fel. Anthropic susține că tehnologia nu adaugă tokenuri suplimentare, nu afectează viteza modelului și nu conține informații care să permită identificarea utilizatorului, companiei sau conversației din care provine textul. Watermark-ul poate indica doar probabilitatea ca Claude să fi fost implicat în realizarea materialului, nu cine l-a cerut și nici cine deține textul.
Sistemul este introdus în contextul regulilor AI Act care se aplică în Uniunea Europeană, Anthropic numărându-se printre companiile care au semnat codul european privind transparența conținutului generat de AI.
Instrumentele care încearcă să șteargă urmele Claude au devenit virale
Unul dintre proiectele care au atras cea mai mare atenție este Watermarks Remover, creat inițial de antreprenorul francez Guillaume Meyer. Prima versiune ar fi fost realizată în aproximativ cinci ore. La momentul relatării Business Insider, proiectul depășise 14.000 de stele pe GitHub. Între timp, interesul a continuat să crească, iar la începutul lunii septembrie proiectul trecuse de 20.000 de stele.
Instrumentul poate elimina anumite metadate și caractere Unicode invizibile din fișiere, iar pentru watermark-urile statistice din text folosește inclusiv rescrierea conținutului. Chiar creatorii proiectului precizează însă că eliminarea unui watermark statistic este „best effort”: nu există o garanție că detectorul original al companiei nu va mai recunoaște textul.
Au apărut și alte proiecte. Dezvoltatorul Ansh Aneja a lansat MarkScrub, un instrument open-source capabil să curețe diferite forme de metadate și să rescrie texte pentru a încerca să reducă semnalele statistice. Proiectul avertizează explicit că nicio aplicație de acest tip nu poate certifica faptul că un detector proprietar va eșua.
Situația seamănă cu ceea ce se întâmplă deja în cazul imaginilor generate de inteligență artificială. Playtech a scris recent și despre decizia prin care Google permite eliminarea unor watermark-uri vizibile din Gemini, în timp ce mecanisme invizibile precum SynthID continuă să fie utilizate pentru identificarea originii conținutului.
De ce este atât de greu de protejat un text AI
Problema fundamentală este că un text poate fi modificat extrem de ușor. Anthropic recunoaște chiar că o rescriere amplă poate elimina watermark-ul. În cazul unor texte foarte scurte, al codului, matematicii sau al fragmentelor în care există foarte puține variante corecte de formulare, semnalul poate fi oricum mult mai slab.
Apare astfel un paradox: un e-mail scris de o persoană și doar corectat cu Claude ar putea păstra o urmă a implicării AI, în timp ce un articol generat aproape integral de un model și apoi rescris suficient de agresiv ar putea să nu mai poată fi identificat. Watermark-ul nu demonstrează, așadar, că „AI-ul a scris textul”, ci doar că un anumit model ar fi putut participa la realizarea sa.
Nici legislația nu rezolvă complet problema. Regulile europene impun furnizorilor de AI obligații privind marcarea și rezistența mecanismelor de identificare, însă situația persoanelor sau dezvoltatorilor care construiesc instrumente pentru eliminarea lor rămâne mult mai puțin clară. Business Insider notează că AI Act nu interzice explicit unui terț să încerce eliminarea unui astfel de semnal.
Disputa este importantă și dincolo de Claude. Watermark-urile pentru conținutul generat cu AI sunt prezentate tot mai des drept una dintre soluțiile pentru combaterea deepfake-urilor și a conținutului artificial prezentat drept autentic. Apariția aproape instantanee a instrumentelor care încearcă să le elimine arată însă limita unei asemenea strategii: orice sistem de marcare intră rapid într-o cursă tehnologică cu cei care încearcă să-l ocolească.