DeepSeek V4.1 Flash ridică miza în cursa AI: noul model atacă GPT-5.6 Sol și Claude Opus 5 cu o arhitectură mult mai eficientă
DeepSeek a lansat V4.1 Flash, un nou model AI despre care compania spune că a fost construit pentru un obiectiv destul de concret: să ofere performanțe apropiate de modelele de top, dar cu un consum mult mai mic de resurse. Modelul are 552 de miliarde de parametri și folosește o arhitectură Mixture of Experts, însă activează doar o mică parte dintre aceștia pentru fiecare etapă a procesării.
Primele rezultate publicate de DeepSeek sunt interesante mai ales pentru programare și sarcini în care AI-ul trebuie să lucreze ca un agent. V4.1 Flash obține 90,6 puncte pe Terminal-Bench 2.1, peste cele 88,8 puncte ale GPT-5.6 Sol și 89,1 ale Claude Opus 5. Pe DeepSWE v1.1 ajunge la 74,2, față de 73 pentru GPT-5.6 Sol și 74 pentru Opus 5. Pe CyberGym, un benchmark axat pe securitate cibernetică, DeepSeek raportează 88,1 puncte, peste cele 84,5 ale GPT-5.6 Sol.
DeepSeek schimbă modul în care un model folosește memoria
Una dintre cele mai importante schimbări nu este însă un scor dintr-un tabel, ci felul în care V4.1 Flash gestionează cantitatea uriașă de informație necesară în conversațiile și sarcinile foarte lungi.
Modelul folosește o arhitectură Causal Encoder-Decoder împărțită în 20 de straturi pentru procesarea inițială a informației și alte 20 pentru generarea răspunsului. La intrare sunt activate aproximativ 8 miliarde de parametri, iar la generare aproximativ 16 miliarde. Ideea este să nu fie pornită aceeași cantitate de „creier” pentru fiecare operațiune, indiferent de ce are efectiv de făcut modelul.
DeepSeek a lucrat și la problema memoriei de tip KV cache, una dintre componentele care pot deveni foarte costisitoare atunci când un model trebuie să păstreze în context cantități uriașe de informație. V4.1 Flash folosește Compressed Sparse Attention 2, precizie FP4 și SWA Bounded Replay pentru a evita păstrarea unor cantități inutile de date.
Rezultatul declarat de companie este un cache de aproximativ 890 de bytes pentru fiecare token, adică aproximativ un sfert din necesarul generației V4-Flash. Pentru stocarea persistentă, DeepSeek vorbește despre o reducere la o optime. Modelul poate lucra cu un context de până la un milion de tokeni.
Asta contează mai ales în cazul agenților AI care trebuie să parcurgă documente, cod, proiecte sau conversații foarte lungi. Cu cât memoria necesară pentru fiecare sesiune este mai mică, cu atât poate fi redusă și infrastructura necesară pentru a rula un număr mare de sesiuni în paralel.
O altă componentă este Engram Conditional Memory, un sistem care păstrează informații într-o structură de tip tabel și permite modelului să recupereze rapid anumite informații atunci când acestea sunt relevante. DeepSeek combină acest mecanism cu single-pass mHC și DSpark Speculative Decoding, tehnici destinate să reducă timpul de calcul și să crească viteza de generare.
Unde bate GPT-5.6 Sol și unde încă pierde
V4.1 Flash nu este însă campion absolut la toate testele. Chiar tabelul publicat de DeepSeek arată o situație mult mai nuanțată.
Pe GPQA Diamond, de exemplu, GPT-5.6 Sol are 94,1 puncte, față de 90,9 pentru DeepSeek. La Humanity’s Last Exam, scorurile sunt 44,5 pentru GPT-5.6 Sol și 36,8 pentru V4.1 Flash. Claude Opus 5 are, la rândul său, rezultate mai bune pe mai multe teste de programare de lungă durată, inclusiv Terminal-Bench 4.0, unde ajunge la 51,8 puncte, comparativ cu 31,2 pentru DeepSeek.
Avantajul DeepSeek apare, așadar, mai ales în anumite sarcini agentice, de programare și cybersecurity. Este o diferență importantă, pentru că un benchmark în care modelul obține primul loc nu înseamnă automat că este cel mai bun pentru orice tip de activitate.
Costul este însă una dintre armele importante ale V4.1 Flash. API-ul DeepSeek are un preț de 0,15 dolari pentru un milion de tokeni de intrare în afara perioadelor de vârf și 0,60 dolari pentru un milion de tokeni generați. În perioadele de vârf, tarifele cresc la 0,30, respectiv 1,20 dolari.
DeepSeek spune că noua arhitectură permite companiei să servească mai multe solicitări cu mai puține resurse. Este și motivul pentru care V4.1 Flash nu trebuie privit doar ca un model cu scoruri bune, ci ca o demonstrație a unei direcții importante pentru AI: modele foarte mari la nivel de parametri, dar care folosesc efectiv doar o fracțiune din această capacitate la fiecare pas.
Un alt detaliu interesant este că V4.1 Flash are înțelegere vizuală nativă, astfel că poate lucra cu imagini și text fără ca partea vizuală să fie tratată ca un accesoriu separat. Modelul este disponibil prin API-ul DeepSeek și compania îl poziționează inclusiv pentru dezvoltarea de agenți AI.
DeepSeek mai susține că V4.1 Flash a ajuns la 98% din performanța GPT-6 Astra într-un test OpenDesign axat pe sarcini de design, la aproximativ 1,4% din costul acestuia. Este însă un benchmark separat, iar rezultatul nu trebuie transformat într-o concluzie generală despre toate modelele AI.