Gemini 3.5 Transcribe este noul AI Google pentru dictare, cu suport pentru peste 85 de limbi
Google a prezentat Gemini 3.5 Transcribe, un nou model de inteligență artificială dedicat transcrierii audio în text. Compania îl descrie drept cel mai precis model de speech-to-text pe care l-a dezvoltat până acum, iar tehnologia este deja folosită în mai multe produse Google, inclusiv în Gboard Rambler pe Android.
Spre deosebire de sistemele clasice de recunoaștere vocală, Gemini 3.5 Transcribe încearcă să înțeleagă mai bine felul în care vorbești în mod natural. Poate ține cont de ezitări, corectări făcute în timpul propoziției, termeni specializați și chiar de zgomotul din fundal, după care transformă înregistrarea într-un text mai curat și mai bine structurat.
Gemini 3.5 Transcribe înțelege și corectează felul natural în care vorbești
Unul dintre avantajele noului model este modul în care gestionează situațiile în care te răzgândești în timp ce vorbești. Dacă spui, de exemplu, „ne întâlnim marți, nu, miercuri”, sistemul poate identifica această corectare și reda textul în forma potrivită, fără să păstreze toate ezitările din discurs, scrie 9to5Google.
Modelul poate elimina și expresii precum „ăă” sau „mmm”, atunci când acestea nu au relevanță pentru rezultatul final. În plus, poate organiza automat textul și poate permite modificarea acestuia prin comenzi vocale naturale.
Google susține că Gemini 3.5 Transcribe are o rată medie de eroare de 4% pentru transcrierea în timp real și de 2,6% pentru scenariile în care audio-ul este procesat fără constrângeri de streaming, conform măsurătorilor realizate de Artificial Analysis.
Modelul poate recunoaște și vocabular personalizat, ceea ce este util atunci când transcrii nume neobișnuite, termeni tehnici, coduri sau identificatori alfanumerici. Google spune că poate detecta și transcrie automat peste 85 de limbi, inclusiv în situații în care apar accente regionale și dialecte diferite.
Poate identifica mai multe persoane într-o înregistrare
Gemini 3.5 Transcribe nu este conceput doar pentru dictare. În cazul înregistrărilor audio preînregistrate, poate atribui replicile unor vorbitori diferiți și poate include marcaje temporale. În prezent, funcția poate identifica până la trei persoane, iar suportul pentru mai mulți vorbitori este încă experimental.
Google afirmă că noul model aduce și o reducere importantă a timpului necesar pentru obținerea transcrierii finale. În comparație cu Chirp 3, modelul de transcriere lansat de companie în 2025, timpul până la rezultatul final este cu aproximativ 70% mai mic, potrivit măsurătorilor citate de Google.
Pe benchmark-ul FLEURS, care testează performanța multilingvă, Gemini 3.5 Transcribe a obținut o rată de eroare de 5,50% în modul streaming și 5,04% în scenariile non-streaming pentru setul de limbi și regiuni evaluat.
Gemini 3.5 Transcribe ajunge și în Chrome
Google vrea ca tehnologia să fie folosită și pentru mai mult decât simpla transcriere. Modelul poate apela alte modele Gemini pentru a executa acțiuni mai complexe, inclusiv generarea de imagini sau analiza unor fișiere.
Funcționalitatea este deja prezentă în anumite produse. În aplicația Gemini pentru macOS, de exemplu, există funcția Speak to Window, iar Gemini 3.5 Transcribe este folosit și în microfonul din caseta de prompt a Google Antigravity. Acolo, sistemul poate folosi, cu permisiunea ta, contextul de pe ecran și istoricul conversației pentru a interpreta mai corect denumiri de fișiere, documente active sau alte elemente specifice.
Pe Android, tehnologia a ajuns deja în Gboard Rambler. Următorul pas important este Chrome, unde Google pregătește posibilitatea de a folosi vocea pentru introducerea textului în orice câmp al unei pagini web. Practic, vei putea dicta răspunsuri, redacta postări sau introduce prompturi pentru Gemini fără să mai tastezi totul manual.
Pentru dezvoltatori, Gemini 3.5 Transcribe este disponibil în previzualizare publică prin Gemini API, Google AI Studio și Google Antigravity. Companiile pot testa modelul prin Gemini Enterprise Agent Platform, iar integrarea în Gemini Enterprise for Customer Experience urmează să fie disponibilă ulterior.