OFFERTE TECH
Cerca

Cerca nel magazine

Che cosa vuoi approfondire?

Google lancia Gemini 3.5 Transcribe: la voce diventa testo con più velocità e precisione

Gemini 3.5 Transcribe
Foto © blog.google

Google compie un nuovo passo nello sviluppo dell’intelligenza artificiale applicata alla voce. La società ha presentato Gemini 3.5 Transcribe, un modello progettato per convertire il parlato in testi accurati, ordinati e già formattati, anche quando la registrazione contiene rumori di fondo, espressioni complesse oppure più lingue.

L’annuncio è accompagnato da un importante aggiornamento di Gemini Live, che amplia le proprie capacità e punta a diventare un assistente personale sempre più integrato con gli strumenti utilizzati durante la giornata. Attraverso semplici richieste vocali sarà possibile avviare attività articolate, consultare gli impegni e gestire la posta elettronica.

Gemini 3.5 Transcribe interpreta il parlato naturale

La conversione di una registrazione in testo può diventare complicata quando l’audio presenta voci sovrapposte, esitazioni, accenti marcati o termini tecnici. Gemini 3.5 Transcribe nasce proprio per affrontare queste situazioni, combinando accuratezza e rapidità nell’elaborazione.

Il modello applica una sorta di pulizia intelligente del parlato. La funzione di trascrizione smart riconosce gli intercalari, gestisce le correzioni pronunciate durante una frase e restituisce un contenuto più leggibile rispetto alla semplice riproduzione letterale di ogni suono. L’obiettivo consiste quindi nel trasformare l’audio grezzo in un testo già utilizzabile.

Questa capacità potrebbe risultare utile in numerosi contesti, dalle riunioni alle interviste, passando per lezioni, conferenze e contenuti dettati a voce. Il sistema riesce inoltre a lavorare anche in ambienti rumorosi e a comprendere espressioni appartenenti a linguaggi specialistici.

Trascrizioni più rapide e supporto per oltre 85 lingue

I dati comunicati da Google evidenziano i progressi raggiunti dal nuovo modello. Durante lo streaming in tempo reale, Gemini 3.5 Transcribe presenta un tasso medio di errore del 4%, mentre nell’elaborazione dei file preregistrati il valore scende al 2,6%.

Rispetto al precedente modello Chirp 3, i tempi necessari per ottenere la trascrizione definitiva risultano ridotti del 70%. Una differenza particolarmente significativa quando il sistema viene impiegato durante una conversazione in diretta oppure per elaborare grandi quantità di registrazioni.

Un altro elemento centrale riguarda il supporto multilingue. Il modello riconosce più di 85 lingue, compresi accenti e dialetti regionali, e può gestire il passaggio da una lingua all’altra all’interno della stessa sessione. Nei file preregistrati riesce anche a distinguere fino a tre persone, attribuendo correttamente a ciascun interlocutore le rispettive parti del discorso.

È disponibile inoltre un vocabolario personalizzato, attraverso il quale si possono indicare termini tecnici, nomi specifici o parole appartenenti a un determinato settore. In questo modo il sistema dispone di maggiori informazioni per interpretare correttamente le espressioni meno comuni.

Dove sarà disponibile il nuovo modello di Google

Gemini 3.5 Transcribe viene distribuito attraverso canali differenti. Gli sviluppatori possono provarlo in anteprima pubblica tramite la Gemini API, utilizzando Google AI Studio e Google Antigravity. Le aziende possono invece accedervi attraverso Gemini Enterprise Agent Platform.

Per gli utenti, alcune capacità del modello sono già presenti nell’applicazione Gemini per macOS, inizialmente in lingua inglese, e nella funzione Rambler per Android, disponibile anche in italiano. Google prevede inoltre di portare su Chrome uno strumento che consentirà di scrivere con la voce in qualsiasi campo di testo presente nel browser.

Il sistema trova quindi spazio sia negli strumenti destinati allo sviluppo sia nelle applicazioni utilizzate quotidianamente. La medesima tecnologia permette di dettare contenuti ed eseguire comandi vocali complessi, tenendo conto anche di ciò che appare sullo schermo.

Gemini Live diventa più utile per le attività quotidiane

Le novità riguardano anche Gemini Live, la modalità che permette di dialogare con l’assistente attraverso uno scambio vocale naturale. Secondo i dati condivisi da Google, il 63% degli utenti utilizza la voce per rivolgersi a Gemini. L’aggiornamento cerca quindi di trasformare le conversazioni in azioni concrete.

L’integrazione con Gemini Spark permette di avviare flussi di lavoro composti da più passaggi, eseguiti in background su servizi come Documenti, Fogli, Drive e sul Web. L’utente potrà affidare all’assistente un’attività articolata usando una semplice richiesta pronunciata a voce.

Arriva anche il riepilogo giornaliero. Chiedendo a Gemini di illustrare gli appuntamenti della giornata, l’assistente potrà elaborare le informazioni disponibili su Gmail e Google Calendar e presentarle attraverso una risposta vocale.

Gemini Live potrà intervenire direttamente anche sulla casella di posta elettronica. Sarà possibile cercare determinate email, ottenere un riassunto degli ultimi messaggi, archiviare le comunicazioni, eliminarle oppure contrassegnarle come importanti senza utilizzare lo schermo dello smartphone.

Personal Intelligence amplia il contesto delle conversazioni

La funzione Personal Intelligence viene estesa a Gemini Live, consentendo all’assistente di utilizzare informazioni personali e precedenti interazioni per costruire risposte più contestualizzate. Le conversazioni potranno quindi riguardare argomenti già affrontati, eventi passati, appuntamenti ed email, mantenendo una maggiore continuità nel dialogo.

Le funzioni più avanzate non arriveranno subito in Italia, dove Personal Intelligence nella sua versione completa risulta ancora indisponibile. Sono previste anche limitazioni legate agli abbonamenti: Spark sarà accessibile con Google AI Pro o con un piano superiore, mentre il riepilogo giornaliero richiederà almeno Google AI Plus.

Con Gemini 3.5 Transcribe e il potenziamento di Gemini Live, Google punta dunque a rendere la voce uno strumento centrale per scrivere, organizzare informazioni e svolgere attività digitali sempre più articolate.

Scorri per continuare con l’articolo successivo