Gemini 3.8 Flash personnalise les voix par IA

D'après Google DeepMind (23 septembre 2026 à 02h00)

Résumé

Google DeepMind lance Gemini 3.8 Flash TTS et Flash-Lite TTS, avec création de voix, direction détaillée, clonage encadré et prise en charge multilingue.

Les faits

Google DeepMind annonce Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de génération audio conçus pour remplacer les voix prédéfinies par un studio créatif dynamique. Ils sont accessibles via Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook et Google Vids. Gemini 3.8 Flash TTS cible la création de personnages et permet de concevoir des voix à partir d’instructions en langage naturel. Le modèle offre un contrôle détaillé de l’interprétation, notamment sur les indications de jeu, le rythme, les changements de dialecte et les éléments de conversation. Gemini 3.8 Flash-Lite TTS est destiné aux usages à grande échelle, comme le doublage, la création de contenus audio et les agents vocaux expressifs. Le modèle Flash TTS permet de personnaliser le rôle, l’accent et les caractéristiques vocales dans plus de 100 langues et dialectes. La bibliothèque comprend plus de 2 000 voix prêtes pour la production, avec notamment l’espagnol mexicain, le français québécois et l’anglais écossais. La réplication vocale peut être réalisée à partir d’un échantillon audio de 30 secondes, avec vérification du consentement, filigrane SynthID et informations d’identification C2PA. Les deux modèles prennent en charge la direction ligne par ligne, la génération de contenus longs, les scènes à deux interlocuteurs et des indications non verbales comme les rires, les soupirs ou les halètements. Gemini 3.8 Flash TTS obtient la première place du Voice Design Benchmark de Hume AI avec un score de 71,4 et de la modélisation des accents avec un score de 60,8. Google indique également que les deux modèles occupent les première et deuxième places de l’Overall Quality Index de Hume AI.

Pourquoi c’est important

Avec Gemini 3.8 Flash TTS, Google transforme la synthèse vocale en outil de direction artistique : les créateurs peuvent concevoir une voix, régler son interprétation et maintenir sa cohérence sur des productions longues. Cette approche vise directement les jeux vidéo, les livres audio immersifs, les podcasts, le doublage et les médias interactifs. L’annonce associe personnalisation avancée et mécanismes de contrôle. La vérification du consentement pour la réplication, le filigrane SynthID et les informations C2PA répondent aux enjeux d’identité vocale et de transparence, tandis que la prise en charge de plus de 100 langues et dialectes élargit la portée internationale des expériences audio.

Questions fréquentes

Quels modèles Google DeepMind annonce-t-il ?

Google DeepMind annonce Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de génération vocale expressive.

Combien de voix la bibliothèque propose-t-elle ?

La bibliothèque comprend plus de 2 000 voix prêtes pour la production, avec une large couverture linguistique et régionale.

Combien de langues et dialectes sont pris en charge ?

Gemini 3.8 Flash TTS permet de personnaliser des voix dans plus de 100 langues et dialectes.

La réplication vocale est-elle encadrée ?

Oui. Elle nécessite un enregistrement de consentement verbal correspondant au locuteur de référence et s’accompagne de SynthID et de références C2PA.

Sur quelles plateformes les modèles sont-ils disponibles ?

Ils sont accessibles via Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook et Google Vids.

Source

Google DeepMind

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.