OpenAI lance GPT-Live, la voix continue sans coupure

D'après OpenAI (3 août 2026 à 09h00)

Résumé

OpenAI présente GPT‑Live, son troisième système vocal, conçu en six mois pour offrir une interaction continue, full‑duplex et à très faible latence dans ChatGPT Voice.

Les faits

OpenAI décrit GPT‑Live comme « notre troisième génération de système vocal », capable de supprimer le détecteur de tours de la chaîne audio grâce à un modèle de voix full‑duplex, « qui peut écouter et parler en même temps ». Ce choix permet, selon l’entreprise, de rendre la conversation « plus immédiate et naturelle » tout en laissant au modèle la maîtrise du flux de dialogue. L’architecture est repensée pour optimiser la latence, en remplaçant le schéma classique requête‑réponse par un système qui « diffuse l’audio entrant dans le modèle vocal et la parole sortante vers l’utilisateur », tandis que la délégation vers des modèles de frontière comme GPT‑5.5 et l’usage d’outils se font sur une voie asynchrone séparée. OpenAI explique avoir « retravaillé l’inférence de modèle, la gestion de contexte et le transport média » au cours des six derniers mois pour maintenir un flux vocal continu. GPT‑Live rompt avec les architectures vocales en cascade, où la reconnaissance, le LLM et la synthèse fonctionnent en série sur des « blobs audio » discrets, ce qui ajoute de la latence et néglige des signaux comme le ton ou le rythme. Le système positionne désormais le modèle vocal « aux commandes de la conversation » : l’audio circule en continu à l’intérieur du modèle, tandis que « le raisonnement plus profond et l’utilisation d’outils » sont délégués en arrière‑plan. Pour soutenir cette boucle média ininterrompue, OpenAI affirme avoir séparé explicitement le flux média de la logique applicative et métier. L’audio transite sur un « chemin rapide dédié » entre le client et le modèle de voix, tandis que la délégation et les appels d’outils passent « derrière une frontière RPC asynchrone ». Le code du frontal média et de l’inférence a été réécrit en Go, remplaçant une précédente implémentation Python asyncio, ce qui aurait « amélioré significativement la régularité de livraison des trames », avec un p95 correspondant à l’ancien p50. WebRTC sert de fondation de transport, conçu pour les médias à faible latence et capable de « continuer à fonctionner malgré la perte de paquets, la dérive d’horloge et les changements de connexion côté client ». OpenAI indique que ce socle alimente « une gamme croissante de capacités dans ChatGPT Voice », dont la nouvelle possibilité de « contrôler votre ordinateur et coordonner vos agents dans l’application desktop ChatGPT ». L’entreprise insiste sur le fait que le chemin live reste « petit, prévisible et axé sur le travail qui doit se produire en temps réel », l’objectif étant de « fournir la réactivité sous la seconde que les humains attendent d’une conversation ».

Pourquoi c’est important

La description détaillée de GPT‑Live éclaire la direction prise par OpenAI pour faire passer les assistants vocaux d’une logique de tours à une interaction continue, plus proche des échanges humains. En plaçant un modèle de voix full‑duplex au centre du système et en reléguant le raisonnement lourd et les outils sur un chemin asynchrone, l’entreprise revendique une combinaison inédite de réactivité conversationnelle et d’intelligence. Sur le plan stratégique, la séparation stricte entre flux média et logique applicative crée une frontière claire pour la personnalisation et pour l’évolution des outils sans compromettre la performance temps réel. Le choix de Go pour l’inférence, l’utilisation de WebRTC et la mise en avant de capacités comme le contrôle de l’ordinateur dans ChatGPT Voice montrent qu’OpenAI prépare une génération d’agents vocaux capables de piloter l’environnement numérique de l’utilisateur tout en maintenant une conversation fluide et continue.

Questions fréquentes

Qu’est‑ce que GPT‑Live selon OpenAI ?

OpenAI présente GPT‑Live comme son « troisième système vocal », conçu pour une interaction continue, avec un modèle de voix full‑duplex.

Comment GPT‑Live gère‑t‑il la prise de parole ?

Le modèle de voix full‑duplex « peut écouter et parler en même temps », supprimant le détecteur de tours et rendant la conversation plus naturelle.

Quel rôle joue GPT‑5.5 dans ce système ?

Lorsque un raisonnement plus profond ou l’usage d’outils est nécessaire, GPT‑Live « peut consulter nos modèles de frontière, comme GPT‑5.5 » de façon asynchrone.

Pourquoi OpenAI a‑t‑il séparé flux média et logique applicative ?

Pour éviter qu’un appel d’outil ou un service backend lent ne bloque le flux audio, en gardant le chemin live « petit, prévisible » et centré sur le temps réel.

Quels outils technologiques soutiennent le transport audio ?

OpenAI utilise WebRTC comme fondation de transport, conçu pour les médias à faible latence et capable de fonctionner malgré la perte de paquets.

Source

OpenAI

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.