Hugging Face lance un classement pour évaluer les voix IA

D'après Hugging Face (30 septembre 2026 à 02h00)

Résumé

Hugging Face lance un classement ouvert qui évalue les modèles de synthèse vocale multilingue et de clonage vocal à l’aide de métriques objectives.

Les faits

Hugging Face annonce l’Open TTS Leaderboard, un classement ouvert consacré à l’évaluation des modèles de synthèse vocale multilingue et de clonage vocal. L’initiative intervient alors que les sorties de modèles TTS open source se multiplient rapidement : au 30 septembre 2026, le Hub Hugging Face compte plus de 8 000 modèles TTS. Selon Hugging Face, l’évaluation reste fragmentée et peu standardisée. Les classements fondés sur les préférences humaines comparent généralement les sorties de deux modèles, puis calculent un score Elo après la collecte des votes, souvent avec le modèle de Bradley-Terry. Cette approche atteint toutefois des limites d’échelle. Au 30 septembre 2026, seuls 16 des 92 modèles répertoriés sur Artificial Analysis disposent de poids ouverts. Les modèles ouverts doivent être hébergés et servis par l’opérateur du classement, tandis que l’ajout d’un modèle accessible par API nécessite principalement une clé d’API. L’Open TTS Leaderboard s’appuie sur des métriques objectives portant sur plusieurs dimensions complémentaires. Le WER fondé sur la reconnaissance automatique de la parole fournit un indicateur indirect de l’intelligibilité, tandis que la similarité du locuteur estime la préservation de l’identité vocale. Hugging Face précise que ces mesures ne remplacent pas l’évaluation humaine de la naturalité, de l’expressivité ou de la préférence des auditeurs. Elles peuvent réduire l’évaluation d’un modèle de quelques semaines à quelques heures.

Pourquoi c’est important

Le classement vise à rapprocher le rythme d’évaluation de celui des sorties de modèles TTS. En remplaçant la seule collecte de votes par des métriques objectives, il doit permettre de comparer plus rapidement un nombre croissant de modèles, notamment ceux dont les poids sont ouverts. L’approche reste complémentaire des classements fondés sur les préférences humaines plutôt qu’un substitut. Le WER et la similarité du locuteur couvrent l’intelligibilité et la conservation de l’identité vocale, mais ne mesurent pas directement la naturalité, l’expressivité ni les préférences d’écoute. Hugging Face indique également vouloir faire évoluer le classement avec les retours de la communauté.

Questions fréquentes

Qu’est-ce que l’Open TTS Leaderboard ?

C’est un classement ouvert consacré à l’évaluation des modèles de synthèse vocale multilingue et de clonage vocal.

Combien de modèles TTS sont disponibles sur le Hub Hugging Face ?

Au 30 septembre 2026, le Hub Hugging Face compte plus de 8 000 modèles TTS.

Quelles métriques sont utilisées ?

Le WER fondé sur la reconnaissance automatique de la parole évalue indirectement l’intelligibilité, et la similarité du locuteur estime la préservation de l’identité vocale.

Le classement remplace-t-il les votes humains ?

Non. Les métriques objectives ne mesurent pas directement la naturalité, l’expressivité ou la préférence des auditeurs.

Source

Hugging Face

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l’analyse de l’actualité de l’intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.