Google lance Gemini 3.8 Flash TTS, une IA capable de cloner une voix en 30 secondes

 
Google a lancé ce mercredi 23 septembre deux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, avec plus de 2 000 voix et plus de 100 langues et dialectes.
Source : Google

Google a présenté ce mercredi 23 septembre deux nouveaux outils, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS.

Gemini 3.8 Flash TTS vise plutôt les usages créatifs, comme les jeux vidéo, les livres audio, les podcasts ou les médias interactifs. Gemini 3.8 Flash-Lite TTS reprend la même idée mais avec un objectif plus industriel : produire beaucoup d’audio, pour du doublage, des contenus en volume ou des agents vocaux expressifs.

Dans la famille Gemini, Google continue donc de séparer les modèles les plus riches de versions plus légères.

Ces deux modèles succèdent à Gemini 3.1 Flash TTS, lancé en avril 2026. Google revendique des progrès nets sur les contenus longs et la gestion de dialogues à deux voix par rapport à cette génération, et ajoute surtout un palier Flash-Lite, moins cher, pensé pour produire de l’audio en grande quantité.

Deux modèles, deux usages

La promesse la plus spectaculaire concerne Gemini 3.8 Flash TTS. Google promet que vous pourrez créer une voix inédite à partir de zéro, sans échantillon audio de départ, avec une simple consigne en langage naturel. Il est possible de créer une voix de narrateur avec une cadence précise, ou un personnage beaucoup plus théâtral, puis ajuster ligne par ligne l’intonation, le débit, l’accent et les signaux d’écoute (les « mhm », « oui » qui ponctuent une conversation).

La bibliothèque de départ compte aussi plus de 2 000 voix prêtes à l’emploi, avec plus de 100 langues et dialectes. Google cite même des variantes régionales comme l’espagnol mexicain, le français québécois ou l’anglais écossais.

La génération d’une voix sur une longue durée est pensée pour garder un timbre stable pendant plusieurs heures d’enregistrement continu, utile pour les podcasts et livres audio. Google évoque aussi une mise en scène à deux interlocuteurs, capable de garder deux voix séparées dans un même script et de se donner la parole de la manière la plus naturelle possible.

Clonage vocal, mais encadré

Le morceau sensible concerne la réplication vocale. Google annonce qu’un profil vocal cohérent peut être recréé à partir d’un échantillon de 30 secondes, à condition d’utiliser sa propre voix ou une voix dont on possède les droits. Le groupe indique qu’une vérification de consentement est intégrée, combinée à un marquage SynthID et des identifiants C2PA, un standard qui sert à tracer l’origine et les modifications d’un contenu numérique.

SynthID joue ici le rôle de filigrane invisible. Chaque clip audio généré par les modèles Gemini Audio doit embarquer cette marque directement dans le fichier, afin de rendre la parole générée par IA détectable. C’est rassurant sur le papier, mais ça ne règle pas tout : la détection dépend toujours des outils utilisés en face, et un fichier audio peut être réencodé, découpé ou republié dans des conditions moins propres.

Google prévoit aussi du remixage vocal, annoncé pour plus tard. L’idée sera de partir d’une voix existante et de modifier le timbre, la hauteur, le débit ou l’accent avec une instruction textuelle.

Les deux modèles sont disponibles dès ce mercredi 23 septembre dans l’API Gemini et Google AI Studio. Gemini 3.8 Flash TTS doit ensuite arriver dans Gemini Enterprise et Gemini Notebook, tandis que Flash-Lite TTS est annoncé pour Google Vids.


Utilisez-vous Google News (Actualités en France) ? Vous pouvez suivre vos médias favoris. Suivez Frandroid sur Google.

Recherche IA boostée par
Perplexity