Claude Opus 5 pulvérise GPT-5.6, nouveau roi des IA

D'après The Decoder (26 juillet 2026 à 11h43)

Résumé

Claude Opus 5 établit un nouveau record sur ARC-AGI-3 avec 30,2 %, près de quatre fois GPT-5.6 Sol, grâce à un raisonnement logique jugé nettement supérieur.

Les faits

Les créateurs du benchmark ARC-AGI annoncent qu’Anthropic a pris une avance massive avec Claude Opus 5 sur la nouvelle version ARC-AGI-3, un test conçu pour mesurer la capacité des modèles à résoudre des tâches inédites. Le modèle atteint un score de 30,2 %, devenant le nouveau leader de la compétition. Ce résultat « quadruple presque » le précédent record de 7,8 %, détenu par GPT-5.6 Sol (Max), et place également Opus 5 devant les modèles « Fable-class » d’Anthropic, crédités d’environ 20 % par ARC Prize. Les auteurs du benchmark soulignent qu’Opus 5 a résolu cinq environnements publics de démonstration qui n’avaient jamais été battus auparavant, dont quatre à un niveau au moins humain. Selon l’analyse d’ARC Prize, cette performance tient à un « raisonnement logique plus solide », qui permet au modèle « une exploration, une planification et une exécution plus autonomes dans des environnements inconnus ». Lors des tests, Opus 5 a adopté des comportements inédits pour les chercheurs, en traduisant les tâches en notation algébrique et en formulant de manière autonome des équations de réflexion, un type de stratégie jamais observé jusque-là chez un autre modèle. ARC-AGI-3 fonctionne comme un jeu interactif où le modèle doit inférer les règles d’un environnement, planifier ses actions puis les exécuter étape par étape. Ce cadre évalue le raisonnement général plutôt que la simple connaissance mémorisée. Les scores officiels ne comptabilisent que les performances du modèle de langage lui-même, sans recourir à un « harness » logiciel extérieur, ce qu’ARC Prize considère comme une exigence clé pour les futurs systèmes d’AGI.

Pourquoi c’est important

Le record d’Opus 5 sur ARC-AGI-3 marque une rupture dans l’évaluation de l’intelligence des modèles de langage : pour la première fois, un système affiche un gain massif sur un benchmark explicitement conçu pour résister à la mémorisation des données d’entraînement. La combinaison d’un score de 30,2 %, de la résolution de plusieurs environnements jusque-là impossibles et de comportements algébriques émergents renforce l’idée que la progression porte sur le raisonnement, pas seulement sur la taille du modèle. Cette avance sur GPT-5.6 Sol et sur les modèles Fable d’Anthropic rebat les cartes dans la course aux capacités de type AGI. ARC Prize défend la thèse que les systèmes d’IA de demain doivent résoudre des tâches nouvelles sans s’appuyer sur des couches logicielles externes. En s’imposant dans ce cadre strict, Opus 5 devient une référence pour mesurer la capacité d’un modèle à explorer, comprendre et maîtriser des environnements inconnus, un trait central pour les agents autonomes et les applications industrielles avancées.

Questions fréquentes

Quel score Claude Opus 5 obtient-il sur ARC-AGI-3 ?

Claude Opus 5 atteint 30,2 % sur ARC-AGI-3, ce qui en fait le nouveau leader du benchmark.

Comment se compare Opus 5 à GPT-5.6 Sol sur ARC-AGI-3 ?

Opus 5 « quadruple presque » le précédent record de GPT-5.6 Sol, qui était de 7,8 %.

Quelles nouveautés de comportement ont été observées chez Opus 5 ?

Opus 5 a traduit des tâches en notation algébrique et formulé de manière autonome des équations de réflexion, un comportement inédit.

Que teste précisément le benchmark ARC-AGI-3 ?

ARC-AGI-3 mesure la capacité à résoudre des tâches nouvelles en inférant des règles, en planifiant et en exécutant des actions étape par étape.

Pourquoi ARC Prize exclut-il les logiciels externes des scores officiels ?

ARC Prize estime que les futurs systèmes d’AGI ne devraient pas dépendre d’un « harness » logiciel pour résoudre de nouvelles tâches.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.