Onde sonore colorate che si trasformano in un volto stilizzato, simbolo di voci create dall'intelligenza artificiale.
Le nuove voci di Gemini nascono da semplici frasi scritte.
Novità · Gemini

Gemini 3.8: le nuove voci AI di Google dicono ciao

Redazione IA da Zero · 25 settembre 2026 · Lettura 4 min

Google ha presentato due nuovi modelli per creare voci artificiali. Si chiamano Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. Bastano poche parole per inventare una voce nuova o copiarne una esistente.

In breve

Due nuovi modelli, tante voci

Il 23 settembre 2026 Google ha annunciato Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. Secondo Google sono i suoi modelli di generazione audio più espressivi finora. Servono a trasformare voci "preimpostate" in uno studio creativo dinamico. Si trovano su Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook e Google Vids.

Gemini 3.8 Flash TTS è pensato per la creazione di personaggi. Permette di inventare voci nuove usando semplici frasi scritte. Si può dirigere ogni battuta, riga per riga. Si controllano ritmo, accento e persino i suoni della conversazione naturale.

Gemini 3.8 Flash-Lite TTS invece serve per grandi volumi di lavoro. È pensato per il doppiaggio, la creazione di contenuti audio e gli assistenti vocali. Costa meno e resta comunque preciso su tono e ritmo.

In parole povere

In parole povere: sono due strumenti per creare voci finte che sembrano vere, una per progetti creativi e una per grandi quantità di audio.

Onde sonore colorate che si trasformano in un volto stilizzato, simbolo di voci create dall'intelligenza artificiale.

Una libreria di voci quasi infinita

Prima si avevano solo 30 voci originali. Ora la libreria diventa quasi infinita. Con Gemini 3.8 Flash TTS si può creare una voce da zero. Basta descrivere ruolo, accento e caratteristiche in oltre 100 lingue e dialetti. Google fa l'esempio di un drago giapponese o di un DJ di Melbourne.

Esiste anche una libreria con più di 2.000 voci già pronte. Include varianti regionali come lo spagnolo messicano, il francese del Québec e l'inglese scozzese.

C'è pure la replica vocale. Basta un campione audio di 30 secondi della propria voce, o di una voce per cui si hanno i diritti d'uso, per ricrearla.

Dirigere la recitazione, riga per riga

Una volta scelta la voce, si può controllare come viene recitata ogni battuta. Si scrivono indicazioni di regia riga per riga. Si può regolare il ritmo, i cambi di dialetto e i suoni tipici di una conversazione naturale.

In parole povere

In parole povere: ogni frase della voce può essere diretta, come se fosse un vero attore.

Sicurezza integrata

Google dichiara di aver incluso strumenti di sicurezza integrati, come il watermarking dell'audio generato.

Questi modelli fanno parte della famiglia Gemini Audio. Si aggiungono ad altri strumenti già esistenti come Gemini 3.5 Live Translate, Gemini 3.5 Transcribe, Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking.

In parole povere

In parole povere: Google prova a rendere le voci finte riconoscibili, con un segno digitale nascosto nell'audio.

Cosa cambia per te

Cosa cambia per te

Ecco cosa significa questa novità per chi usa strumenti Google o crea contenuti audio.

In una riga

Da 30 voci a una libreria quasi infinita: Google amplia lo strumento per creare audio artificiale.

Fonti

Articolo divulgativo: i fatti sono rielaborati con parole nostre a partire dalle fonti citate. Per i dettagli ufficiali rimandiamo alle pagine originali. Aggiornato al 25 settembre 2026.

Immagini: sono illustrazioni generate con l'intelligenza artificiale e portano incisa l'icona ufficiale UE «AI GENERATED» (art. 50 AI Act). Non sono fotografie di fatti realmente accaduti e le persone ritratte non esistono: nessuna immagine raffigura persone reali citate nell'articolo.

Domande frequenti

Cosa sono Gemini 3.8 Flash TTS e Flash-Lite TTS?

Sono due nuovi modelli Google per creare voci artificiali espressive, uno per progetti creativi e uno per grandi volumi.

Come si crea una voce nuova?

Basta scrivere una descrizione in linguaggio naturale, indicando accento e caratteristiche della voce.

Si può replicare una voce reale?

Sì, con un campione audio di 30 secondi della propria voce o di una voce per cui si hanno i diritti d'uso.

Ti interessa Gemini?

Tutti gli articoli Gemini →

Continua a leggere · Ultime uscite

Tutte le novità →

Le novità sull'IA, una volta a settimana

Un'email breve con le notizie sull'IA che contano davvero, verificate alla fonte. Niente spam, disiscrizione con un clic.