Google lance Gemini, ses agents vocaux deviennent ultra-intelligents
D'après Google DeepMind (15 septembre 2026 à 02h00)
Résumé
Google lance Gemini 3.8 Live et 3.8 Live Extended Thinking, deux modèles audio conçus pour des agents vocaux plus fluides, intelligents et adaptés aux tâches complexes.
Les faits
Google présente Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking comme ses modèles de dialogue en temps réel les plus avancés, avec des améliorations majeures en intelligence et en raisonnement parallèle pour exécuter des tâches complexes à la voix. Gemini 3.8 Live est « conçu pour l'échelle et l'efficacité des coûts », en combinant intelligence conversationnelle, dialogue fluide et ancrage visuel. Gemini 3.8 Live Extended Thinking est « conçu pour des tâches à haute complexité », avec une intelligence accrue et un raisonnement multi‑étapes. Gemini 3.8 Live Extended Thinking atteint la première place globale de l’Speech to Speech Quality Index d’Artificial Analysis avec un score de 82,6, et domine l’exécution de tâches agentiques avec 68,6 % sur τ‑Voice et 35,1 % sur le benchmark τ‑Voice‑banking de Sierra. Il affiche également de fortes capacités de raisonnement avec 97,7 % sur Big Bench Audio, tout en conservant un positionnement tarifaire jugé très compétitif. Gemini 3.8 Live arrive deuxième dans le classement Speech Agent Arena et est présenté comme un modèle capable et efficace, conçu pour être déployé à grande échelle. Sur le benchmark EVA‑Bench de ServiceNow, dédié aux agents vocaux, les deux modèles repoussent la « frontière de Pareto » pour les workflows complexes en équilibrant précision et qualité conversationnelle.
Pourquoi c’est important
Avec Gemini 3.8 Live et 3.8 Live Extended Thinking, Google structure une offre d’agents vocaux temps réel qui combine performances de raisonnement, fluidité des échanges et maîtrise des coûts. Les scores élevés sur Artificial Analysis, τ‑Voice, Sierra et Big Bench Audio positionnent Extended Thinking comme un modèle de référence pour les workflows complexes. En faisant de ces modèles le socle de voix de la Gemini API, de Search Live, de Google Workspace et de Gemini Enterprise, Google renforce son écosystème d’agents vocaux prêts pour la production. Cette stratégie vise autant les développeurs et plateformes partenaires que les entreprises, avec des cas d’usage allant du support client à la productivité bureautique en passant par la recherche.
Questions fréquentes
Qu’est-ce que Gemini 3.8 Live Extended Thinking ?
C’est un modèle audio conçu pour des tâches à haute complexité, avec intelligence accrue, raisonnement multi‑étapes et scores élevés sur plusieurs benchmarks.
À quoi sert Gemini 3.8 Live ?
Gemini 3.8 Live vise l’échelle et l’efficacité des coûts, en combinant intelligence conversationnelle, dialogue fluide et ancrage visuel pour des agents vocaux temps réel.
Quels benchmarks sont mis en avant pour Extended Thinking ?
Il atteint 82,6 sur l’Speech to Speech Quality Index, 68,6 % sur τ‑Voice, 35,1 % sur τ‑Voice‑banking de Sierra et 97,7 % sur Big Bench Audio.
Comment Google positionne ces modèles pour les entreprises ?
Ils sont présentés comme des briques pour des agents vocaux fiables et prêts pour la production, dans Gemini Enterprise et les produits comme Search et Workspace.
Quel est l’objectif principal de ces nouveaux modèles audio ?
Rendre la conversation avec l’IA plus fluide et intelligente, et permettre aux agents vocaux de gérer des tâches complexes en quasi temps réel.
Source
Google DeepMindAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.