Google nettoie les hésitations de son IA Gemini Audio
D'après The Verge (26 août 2026 à 19h00)
Résumé
Google met à jour Gemini Audio avec une transcription IA capable de détecter le jargon spécialisé, plus de 85 langues et de supprimer les « euh » et autres mots de remplissage.
Les faits
Google a mis à jour Gemini Audio en y intégrant de nouvelles capacités de transcription qui « détectent automatiquement le jargon spécialisé et plus de 85 langues ». Cette évolution s’inscrit dans la famille Gemini Audio, présentée comme une nouvelle étape dans la stratégie de Google autour de la voix et de la reconnaissance automatique de la parole. Le nouveau modèle de transcription IA est conçu pour nettoyer le texte produit à partir de la voix. L’article souligne que l’outil « supprime les “ums” et autres mots de remplissage pour vous », autrement dit les hésitations et tics de langage comme les « euh » et « ah » qui alourdissent généralement les transcriptions brutes. Ce modèle est présenté comme une nouvelle brique de Gemini Audio alors que Google n’a pas encore lancé le modèle Gemini 3.5 Pro. Le texte insiste sur le décalage entre l’arrivée de ce modèle audio et « l’attente du lancement désormais en retard de Gemini 3.5 Pro », ce qui montre que la feuille de route produits de Google avance d’abord sur l’audio avant le modèle phare annoncé.
Pourquoi c’est important
Cette mise à jour de Gemini Audio illustre la volonté de Google de rendre la dictée et la transcription plus naturelles en se rapprochant du langage parlé réel, tout en livrant un texte exploitable immédiatement. En supprimant automatiquement les mots de remplissage et en gérant le jargon spécialisé dans plus de 85 langues, le modèle vise à réduire la friction entre la parole et l’écrit pour les utilisateurs. Le choix de lancer ce nouveau modèle de transcription alors que Gemini 3.5 Pro se fait attendre montre aussi une priorité stratégique donnée aux usages audio et à la commande vocale. La capacité de produire un texte nettoyé, débarrassé des hésitations et adapté au vocabulaire spécialisé, peut renforcer la position de Google sur les interfaces vocales, les outils de productivité et, plus largement, sur le marché des services IA orientés vers la parole.
Questions fréquentes
Qu’est-ce que Google a ajouté à Gemini Audio ?
Google a ajouté à Gemini Audio des capacités de transcription IA qui détectent le jargon spécialisé et plus de 85 langues.
Que fait la nouvelle transcription IA de Google avec les hésitations ?
Le modèle de transcription IA supprime les « ums » et autres mots de remplissage issus des hésitations dans la parole.
Combien de langues la nouvelle transcription de Gemini Audio peut-elle gérer ?
Selon la description, la transcription IA de Gemini Audio gère plus de 85 langues.
Ce modèle fait-il partie de la famille Gemini Audio ?
Oui, la nouvelle transcription IA est présentée comme un modèle ajouté à la gamme Gemini Audio de Google.
Quel est le contexte produit autour de Gemini 3.5 Pro ?
L’article note que ce nouveau modèle Gemini Audio arrive alors que le lancement de Gemini 3.5 Pro se fait toujours attendre.
Source
The VergeAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.