Nvidia lance un modèle IA gratuit pour identifier 8 voix
D'après The Decoder (27 septembre 2026 à 13h01)
Résumé
Nvidia publie Nemotron 3 Diarization, un modèle gratuit de 100 millions de paramètres qui distingue jusqu’à huit locuteurs en temps réel.
Les faits
Nvidia a publié Nemotron 3 Diarization, un modèle d’intelligence artificielle capable d’identifier le locuteur qui parle à chaque instant d’une conversation. Le modèle compte environ 100 millions de paramètres et ses poids sont accessibles gratuitement. Nemotron 3 Diarization peut distinguer jusqu’à huit locuteurs et détecter les prises de parole simultanées. Il fonctionne aussi bien avec des enregistrements qu’avec des flux audio en direct. En revanche, un nombre plus élevé de participants, un bruit de fond important ou la réverbération augmentent le taux d’erreur. Associé à un système de reconnaissance vocale comme Parakeet, le modèle peut produire des transcriptions accompagnées d’étiquettes de locuteurs. Ces étiquettes restent anonymes, sous la forme « speaker_2 », plutôt que d’identifier les personnes par leur nom. Le tampon audio peut être réglé sur quatre niveaux, de 30,4 à 0,32 seconde. Les tampons plus courts réduisent généralement la précision. Sur le Diarization-Bench de VoiceArena, Nemotron 3 Diarization affiche un taux d’erreur de 14,72 %, contre 19,3 % pour le système suivant. Avec un tampon de 1,04 seconde, il réduit en moyenne le taux d’erreur de 41 % par rapport à Streaming Sortformer, son prédécesseur, sur huit scénarios de test.
Pourquoi c’est important
Nemotron 3 Diarization combine une disponibilité gratuite des poids, la prise en charge de l’audio enregistré et en direct, ainsi que la détection des conversations à plusieurs voix. Associé à Parakeet, il peut faciliter la production de transcriptions distinguant automatiquement les différents intervenants. Ses résultats sur le Diarization-Bench de VoiceArena le placent devant le système suivant, mais les performances dépendent des conditions audio. Les conversations comportant davantage de participants, du bruit ou de la réverbération restent plus difficiles, tandis que le choix d’un tampon court favorise la réactivité au détriment de la précision.
Questions fréquentes
Que fait Nemotron 3 Diarization ?
Il identifie le locuteur qui parle à chaque instant et peut distinguer jusqu’à huit personnes, y compris lors de prises de parole simultanées.
Le modèle est-il gratuit ?
Oui. Ses poids sont accessibles gratuitement.
Peut-il fonctionner en temps réel ?
Oui. Il prend en charge l’audio en direct ainsi que les enregistrements.
Quels résultats obtient-il sur Diarization-Bench ?
Il affiche un taux d’erreur de 14,72 %, contre 19,3 % pour le système suivant.
Les transcriptions identifient-elles les personnes par leur nom ?
Non. Les étiquettes restent anonymes, par exemple « speaker_2 ».
Source
The DecoderAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.