Gemini 3.5 Transcribe batte tutti sulla trascrizione vocale

Google lancia Gemini 3.5 Transcribe, il modello di trascrizione vocale più preciso di sempre, con vocabolario personalizzato e riconoscimento multi-speaker. Insieme arrivano grosse novità per Gemini Live, che ora gestisce meglio le interruzioni e diventa uno strumento di produttività vero.

Gemini 3.5 Transcribe

Gemini 3.5 Transcribe è il nuovo modello di trascrizione vocale di Google, annunciato il 26 agosto 2026 insieme a un pacchetto di aggiornamenti per Gemini Live. Google lo descrive come il più preciso mai realizzato, con un tasso di errore sotto il 3% su file pre-registrati e supporto per oltre 85 lingue, e arriva già integrato in prodotti che usi ogni giorno, da Gboard a Gmail.

Annunci

Gemini 3.5 Transcribe, come funziona nella pratica

A differenza dei modelli tradizionali, che spesso vanno in crisi con rumore di fondo o termini tecnici, questo modello di trascrizione vocale converte l’audio grezzo direttamente in testo pulito e formattato. Rimuove automaticamente gli intercalari, gli “ehm” e le esitazioni, e gestisce le autocorrezioni mentre parli, tipo se dici “ci vediamo martedì, no aspetta, mercoledì” e il sistema capisce quale delle due tenere.

Hai 60 secondi? Ascolta il riassunto audio.

Sul fronte dei numeri, il tasso di errore parole scende al 4% per l’audio in streaming e al 2,6% per i file già registrati, misurato in condizioni reali con rumore ambientale e conversazioni naturali. Rispetto al vecchio modello Chirp 3, il tempo per ottenere la trascrizione finale migliora del 70%, un salto niente male per chi usa questi strumenti tutti i giorni.

Anche sul benchmark multilingue FLEURS, uno standard di settore per confrontare modelli su decine di lingue diverse, Gemini 3.5 Transcribe migliora rispetto a Chirp 3, con un tasso di errore del 5,50% in modalità streaming e 5,04% su file pre-registrati. Numeri che su carta sembrano piccole percentuali, ma che nella pratica significano molte meno correzioni manuali per chi lavora ogni giorno con trascrizioni in lingue diverse dall’inglese, italiano compreso.

Annunci

Riconoscimento vocabolario personalizzato e multi-speaker

Una delle funzioni più interessanti è il riconoscimento vocabolario personalizzato, utile per chi lavora con gergo specifico, nomi propri poco comuni o terminologia tecnica che i modelli generici faticano a capire. Il sistema si adatta al vocabolario che gli fornisci, invece di forzare ogni parola sconosciuta nel termine più vicino che conosce.

Gemini 3.5 Transcribe riesce anche ad attribuire il parlato a più persone diverse, fino a tre con timestamp precisi a livello di parola, il supporto per gruppi più numerosi resta ancora sperimentale. Se hai già provato Gboard Rambler, la funzione di dettatura di Android, hai già assaggiato questo modello in azione, visto che lo alimenta da prima ancora dell’annuncio ufficiale.

Gemini 3.5 Transcribe
Gemini 3.5 Transcribe

Gemini Live diventa uno strumento di produttività vero

Parallelamente al lancio del nuovo modello di trascrizione, Google ha spinto forte anche su Gemini Live, che finalmente gestisce meglio le interruzioni durante la conversazione, uno dei difetti più fastidiosi degli assistenti vocali fino a oggi. In più arrivano funzioni come Personal Intelligence, Daily Brief e l’integrazione con Spark, che ti permette di dare comandi vocali complessi e multi-step su Drive, Docs e Sheets senza toccare la tastiera.

Puoi anche buttare giù pensieri disorganizzati a voce mentre sei in giro, e Spark li trasforma in una scaletta strutturata dentro Google Docs entro il tempo di sederti alla scrivania. Se ti interessa capire meglio come funzionano i chatbot di trascrizione automatizzati, ne avevamo parlato anche nel nostro approfondimento su transcriber bot, utile per chi vuole automatizzare la trascrizione di riunioni o interviste.

Cosa cambia per chi usa Android

Tutti questi aggiornamenti si integrano bene con le novità già annunciate per il sistema operativo di Google, come raccontavamo nella nostra guida su Android 17 e le novità di Gemini Intelligence, dove l’assistente diventa sempre più parte integrante dell’esperienza quotidiana su smartphone invece di restare un’app a parte da aprire quando serve.

Annunci

Per gli sviluppatori, Gemini 3.5 Transcribe è già disponibile in anteprima pubblica su Google AI Studio, mentre per gli utenti normali il rollout riguarda già Search Live, Gemini Live, Docs, Keep, Gmail, l’app Gemini e Gboard, con Chrome in arrivo a breve. Trovi altri approfondimenti su questi temi nella nostra sezione AI.

Vuoi provare Google Gemini risparmiando?

Usa il codice MREFN per uno sconto esclusivo.

Scopri Gemini su GamsGo

In definitiva

Gemini 3.5 Transcribe segna un salto reale nella qualità della trascrizione vocale, non solo sulla carta ma nei prodotti che già usi ogni giorno. Insieme ai nuovi aggiornamenti di Gemini Live, il messaggio di Google è chiaro, la voce sta diventando l’interfaccia principale per interagire con l’intelligenza artificiale, non più un’opzione secondaria rispetto alla tastiera.

Fonte

Infotelematico

Ti è piaciuto questo articolo?

Seguici per restare aggiornato su tech, smartphone e streaming – senza perderti nulla.

Ultime notizie tech, offerte Amazon e streaming gratis. Guide pratiche, MotoGP, Formula 1, calcio e app selezionate ogni giorno.

Commento all'articolo

Newsletter
Resta aggiornato con Infotelematico

Iscriviti gratis e ricevi le ultime notizie su tech, streaming e AI direttamente nella tua email.