Google lancia Gemini Audio: nuovi modelli per i dialoghi in tempo reale

Google lancia Gemini Audio con tre nuovi modelli per trascrizioni, dialoghi vocali in tempo reale e altre attività complesse.
Google lancia Gemini Audio: nuovi modelli per i dialoghi in tempo reale

Google amplia la famiglia di modelli Gemini 3.5 con tre nuove soluzioni dedicate all’audio e alla voce. La società ha infatti annunciato Gemini 3.5 Transcribe, Gemini 3.5 Live e Gemini 3.5 Live Experimental, modelli che insieme formano quella che Google chiama Gemini Audio.

L’annuncio arriva a pochi mesi dal debutto dei primi modelli Gemini 3.5. Nel frattempo Google ha già presentato Gemini 3.6 e Gemini 3.7, ma continua ad aggiornare anche la generazione 3.5. I nuovi modelli sono stati progettati per il riconoscimento vocale e i dialoghi in tempo reale.

Gemini 3.5 Transcribe: come funziona

Tra le novità presentate, Gemini 3.5 Transcribe è il modello speech-to-text di Google più preciso fino a oggi, destinato a sostituire il precedente modello di trascrizione Chirp 3. Secondo Mountain View, offre una maggiore precisione, una più profonda comprensione del contesto e il rilevamento automatico della lingua in oltre 85 lingue.

Tra le principali funzionalità di Gemini 3.5 Transcribe ci sono:

  • Trascrizione intelligente: il modello elimina parole riempitive come «ehm» e intercalari, formatta automaticamente il testo e consente di effettuare modifiche in modo naturale attraverso la voce.
  • Function calling: Gemini 3.5 Transcribe può delegare attività complesse, come la generazione di immagini, ad altri modelli Gemini attraverso le chiamate di funzione. Questa capacità è già disponibile per gli sviluppatori nell’app Gemini per macOS, mentre il supporto API dovrebbe arrivare successivamente.
  • Trascrizioni più precise: Google dichiara un WER, ovvero tasso di errore sulle parole, del 4% per l’audio in streaming e del 2,6% per i file preregistrati, anche in condizioni reali caratterizzate da rumore di fondo e interazioni con sistemi di intelligenza artificiale conversazionale.
  • Vocabolario personalizzato: il modello è in grado di riconoscere terminologia specialistica e grafie particolari, adattando la trascrizione a un vocabolario personalizzato fornito dall’utente.
  • Supporto linguistico globale: Gemini 3.5 Transcribe rileva e trascrive automaticamente più di 85 lingue, gestendo anche accenti regionali e diversi dialetti.
  • Identificazione di più interlocutori: nell’audio preregistrato può attribuire le parole ai singoli presenti, con indicazioni temporali a livello di parola, fino a un massimo di tre persone. Il supporto per più di tre interlocutori è attualmente sperimentale.

In futuro il modello arriverà anche su Chrome, dove dovrebbe consentire agli utenti di parlare per inserire testo in qualsiasi campo presente sul web.

Gemini 3.5 Live e Gemini 3.5 Live Experimental

Accanto a questo modello, Google introduce Gemini 3.5 Live, progettato per rendere più fluide le conversazioni vocali in tempo reale. Il modello è in grado di gestire le interruzioni anche mentre l’utente sta parlando, oltre a elaborare elementi visivi in tempo reale. Può inoltre combinare più lingue all’interno della stessa interazione e attivare strumenti che operano in background, senza la necessità di interrompere o mettere in pausa la conversazione.

La terza novità della famiglia Gemini Audio è Gemini 3.5 Live Experimental, una versione sperimentale pensata per affrontare compiti più complessi. Rispetto al modello Live standard, questa variante può ragionare direttamente mentre parla e descrivere i propri progressi passo dopo passo durante l’esecuzione dell’attività.

Quando inizierà la distribuzione

Google ha annunciato che la nuova famiglia Gemini Audio inizierà a essere distribuita a breve a tutti gli utenti attraverso Search Live, Gemini Live, Google Docs, Keep, Gmail, l’app Gemini e Gboard.

Per gli sviluppatori, i modelli saranno disponibili tramite la Gemini API, utilizzabile attraverso Google AI Studio e Google Antigravity. Sul fronte aziendale, invece, Google prevede l’integrazione di Gemini Audio anche nella Gemini Enterprise Agent Platform e in Gemini Enterprise for Customer Experience.

Ti consigliamo anche

Link copiato negli appunti