OpenAI ouvre son IA vocale aux développeurs
D'après The Decoder (10 septembre 2026 à 19h47)
Résumé
OpenAI lance GPT-Live-1 en API, un modèle vocal en duplex intégral qui parle et écoute simultanément, avec des performances nettement améliorées mais un tarif de 0,05 $ la minute.
Les faits
OpenAI met désormais à disposition des développeurs GPT-Live-1 sous forme d’API, permettant de créer des applications capables de parler et d’écouter en même temps, en mode « full-duplex », la même technologie étant déjà utilisée dans ChatGPT. Les développeurs peuvent associer GPT-Live-1 à différents modèles de fond en fonction des tâches, afin d’ajuster profondeur de raisonnement, vitesse et coût à chaque cas d’usage, tandis que le modèle vocal est facturé 0,05 $ par minute. Sur les benchmarks internes d’OpenAI, GPT-Live-1 affiche un score d’interactivité de 80,1 %, contre 45,4 % pour son prédécesseur GPT-Realtime-2.1, réduit la latence de prise de parole de 1,4 seconde à 0,8 seconde et améliore la précision des appels d’outils de 60 % à 87 %. Dans un benchmark de support bancaire vocal, GPT-Live-1 atteint un taux de réussite de 32 %, contre 12,4 % pour le modèle précédent, et propose douze nouvelles voix couvrant divers accents, dialectes et langues, tout en fournissant automatiquement des transcriptions ASR et des textes de réponse.
Pourquoi c’est important
L’ouverture de GPT-Live-1 en API marque une étape importante pour les agents vocaux avancés, en apportant au monde des développeurs la même capacité de conversation naturelle en duplex intégral déjà intégrée à ChatGPT. Les gains de performance mesurés sur l’interactivité, la latence et la précision des appels d’outils renforcent la crédibilité des usages professionnels de la voix générative. Avec un tarif de 0,05 $ par minute et la possibilité de choisir le modèle de fond selon les besoins, GPT-Live-1 vise des scénarios exigeants comme le support bancaire ou les réservations téléphoniques. L’arrivée de douze nouvelles voix et de fonctions intégrées de transcription ouvre la voie à des services plus personnalisés et multilingues, tout en structurant un marché émergent des interfaces vocales pilotées par l’IA.
Questions fréquentes
Qu’est-ce que GPT-Live-1 ?
GPT-Live-1 est un modèle vocal d’OpenAI en duplex intégral, capable de parler et d’écouter simultanément, désormais accessible via une API.
Comment GPT-Live-1 est-il facturé ?
GPT-Live-1 est facturé 0,05 $ par minute pour la couche vocale lorsqu’il est utilisé via l’API.
Quelles performances affiche GPT-Live-1 par rapport au modèle précédent ?
Il atteint 80,1 % en interactivité contre 45,4 %, réduit la latence à 0,8 s et porte la précision des appels d’outils à 87 %.
Que montre le benchmark de support bancaire vocal ?
GPT-Live-1 obtient un taux de réussite de 32 %, contre 12,4 % pour le modèle précédent.
Combien de voix sont proposées avec GPT-Live-1 ?
GPT-Live-1 est livré avec douze nouvelles voix couvrant divers accents, dialectes et langues.
Source
The DecoderAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.