Artificial Analysis revoit son classement après les critiques
D'après The Decoder (5 septembre 2026 à 20h21)
Résumé
Artificial Analysis publie la version 4.2 de son Intelligence Index, rehausse le score de GPT-6 Astra et confirme la domination de Claude Fable 5.1 dans son classement.
Les faits
Artificial Analysis a publié la version 4.2 de son Intelligence Index, présentée comme une réponse aux critiques selon lesquelles ses benchmarks ne reflétaient pas les progrès réels de GPT-6 Astra. Dans sa précédente version, l’index plaçait Astra au même niveau que son prédécesseur, alors que d’autres évaluations le situaient nettement en tête du secteur. Selon la nouvelle mouture de l’index, GPT-6 Astra affiche désormais un gain de quatre points par rapport au modèle précédent, tout en restant derrière Claude Fable 5.1 d’Anthropic, qui conserve la première place du classement. Astra se hisse au deuxième rang, suivi de Meta en troisième position, et Artificial Analysis souligne que le modèle utilise moins de jetons par tâche que les autres modèles de frontière. Le nouvel index introduit deux benchmarks supplémentaires : AA-Briefcase, centré sur le travail de connaissance en conditions réelles, et GDP.pdf, développé par Surge AI pour l’analyse de documents PDF. GPQA-Diamond est retiré de la batterie de tests, les modèles l’ayant « résolu », et des données de test privées représentent désormais 40 % de la pondération afin de rendre plus difficile toute manipulation des scores. Artificial Analysis indique avoir corrigé des erreurs de scoring sur plusieurs benchmarks et ajusté ses systèmes de notation pour obtenir des résultats plus stables. La société affirme avoir retardé les mises à jour pour préserver la stabilité des scores pendant les lancements de grands modèles, mais juge qu’une mise à jour intermédiaire était devenue nécessaire face à la rapidité des évolutions en tête de classement. Elle précise enfin que la version 5 de l’index est en préparation depuis huit mois et sera déployée par étapes.
Pourquoi c’est important
La refonte de l’Intelligence Index illustre la pression croissante sur les évaluateurs indépendants de modèles d’IA de frontière. Alors que plusieurs analyses, y compris celles d’OpenAI et d’Epoch AI, plaçaient GPT-6 Astra nettement en avance sur ses concurrents, Artificial Analysis maintenait jusque-là un diagnostic beaucoup plus réservé, ce qui a suscité des interrogations sur la pertinence de ses métriques et de ses pondérations. En renforçant le poids de données privées, en introduisant des benchmarks orientés vers le travail réel et l’analyse de documents, et en corrigeant des erreurs de scoring, Artificial Analysis cherche à rendre son index plus robuste face au « gaming » des benchmarks et mieux aligné sur les usages concrets. Le fait que Claude Fable 5.1 reste en tête, qu’Astra progresse mais demeure derrière, et que plusieurs acteurs — Anthropic, OpenAI, Meta et Zhipu AI — se retrouvent à égalité sur le rapport coût‑performance confirme que la compétition se joue désormais autant sur l’efficacité et les coûts que sur les seuls scores bruts.
Questions fréquentes
Qu’est-ce que la version 4.2 de l’Intelligence Index d’Artificial Analysis ?
C’est une mise à jour majeure de l’index qui revoit les pondérations, ajoute deux benchmarks et corrige des erreurs de scoring.
Comment GPT-6 Astra se classe-t-il dans la nouvelle version de l’index ?
Astra gagne quatre points par rapport à son prédécesseur et occupe la deuxième place, derrière Claude Fable 5.1.
Quel modèle reste en tête du classement Intelligence Index ?
Claude Fable 5.1 d’Anthropic demeure en première position du classement dans la version 4.2 de l’index.
Quelles nouvelles évaluations ont été ajoutées à l’Intelligence Index ?
Artificial Analysis ajoute AA-Briefcase pour le travail de connaissance réel et GDP.pdf de Surge AI pour l’analyse de PDF.
Pourquoi Artificial Analysis renforce l’usage de données privées dans l’index ?
Les données de test privées représentent désormais 40 % de la pondération pour rendre plus difficile la manipulation des benchmarks.
Source
The DecoderAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.