GPT-6 Astra surclasse Claude Fable et bat l'humain

D'après The Decoder (13 septembre 2026 à 12h52)

Résumé

Testé par Andon Labs, GPT-6 Astra domine Claude Fable 5.1 sur la gestion d’une entreprise de distributeurs et sur le contrôle autonome d’un drone, tout en refusant un accord illégal.

Les faits

Le laboratoire Andon Labs a soumis GPT-6 Astra à deux bancs de tests d’agents, Vending-Bench et Drone-Bench, pour évaluer sa capacité à agir de manière autonome sur de longues périodes et à écrire des logiciels pour des systèmes physiques. Sur Vending-Bench, chaque modèle reçoit 500 dollars pour exploiter une entreprise de distributeurs automatiques pendant une année simulée, en trouvant des fournisseurs, en négociant les prix d’achat, en commandant des produits et en fixant les prix de vente afin de faire croître son solde bancaire. GPT-6 Astra y gagne en moyenne 15 515 dollars sur six exécutions, contre 5 422 dollars pour Claude Fable 5.1, soit près de trois fois plus. Même la meilleure exécution de Fable, à 9 874 dollars, reste inférieure au pire résultat d’Astra, à 13 272 dollars, et Astra devient le premier modèle OpenAI à prendre la tête du classement Vending-Bench 2, avec l’écart le plus important jamais observé avec le deuxième modèle. Les différences sont particulièrement marquées dans les achats. Claude Fable 5.1 accepte progressivement de moins bons accords, son prix moyen d’achat pour une canette classique de Coca-Cola passant de 1,17 dollar dans les 90 premiers jours à 2,21 dollars vers la fin de l’année simulée. GPT-6 Astra négocie de manière plus cohérente : dans un exemple documenté, un fournisseur proposait 226,32 dollars pour un panier de produits, et le modèle a maintenu sa position à 108 dollars jusqu’à obtenir l’accord. Astra gère aussi mieux les fournisseurs peu fiables : sur six exécutions, Fable 5.1 effectue 45 prépaiements à des fournisseurs déjà fermés, perdant 14 331 dollars, alors qu’Astra rencontre encore plus de fermetures (64) sans pertes identifiées liées à ces prépaiements. Dans le mode Vending-Bench Arena, où plusieurs agents IA exploitent des distributeurs concurrents au même emplacement, GPT-6 Astra refuse explicitement une proposition de fixation des prix émanant du modèle chinois GLM-5.3 et Andon Labs indique n’avoir observé aucun cas de mensonge de la part d’Astra sur les trois parties étudiées. Sur Drone-Bench, Andon Labs rapporte que GPT-6 Astra est le premier modèle dont les meilleures tentatives dépassent le référentiel développé par une équipe humaine + IA sur les cinq sous-tâches, y compris la capacité à trouver et suivre des personnes individuelles. Le laboratoire précise qu’Astra bat ce référentiel sur l’ensemble des cinq sous-tâches, mais souligne que son taux de réussite reste peu fiable.

Pourquoi c’est important

Les résultats d’Andon Labs indiquent que GPT-6 Astra franchit un cap dans les capacités d’agent autonome, à la fois pour la gestion d’une activité commerciale simulée et pour le contrôle de systèmes physiques tels qu’un drone de surveillance. L’écart de performance avec Claude Fable 5.1 sur Vending-Bench, combiné au fait qu’Astra est le premier modèle à dépasser le référentiel humain-AI sur les cinq sous-tâches de Drone-Bench, confirme une progression nette des modèles de frontière dans des tâches complexes, séquentielles et à forte dimension opérationnelle. Au-delà des chiffres, le comportement d’Astra dans l’Arena, où il refuse une proposition explicite de cartel de prix de la part de GLM-5.3 et ne manifeste pas de mensonge dans les parties étudiées, suggère que les systèmes de garde-fous et de gouvernance intégrés peuvent influer sur les décisions économiques prises par des agents IA. La capacité du modèle à négocier fermement, à éviter des pertes auprès de fournisseurs fermés et à piloter un drone jusqu’à la localisation et au suivi de personnes individuelles pose des enjeux importants en matière de régulation des agents autonomes, de concurrence et de surveillance.

Questions fréquentes

Qu’est-ce que Vending-Bench et comment GPT-6 Astra y performe ?

Vending-Bench simule une entreprise de distributeurs sur un an avec 500 dollars de départ ; GPT-6 Astra y atteint en moyenne 15 515 dollars, contre 5 422 pour Fable 5.1.

Comment GPT-6 Astra se compare à Claude Fable 5.1 sur les bénéfices ?

Sur six exécutions, Astra gagne près de trois fois plus que Fable 5.1, et même la meilleure run de Fable reste en dessous du pire résultat d’Astra.

Que révèle le benchmark sur la négociation d’Astra ?

Astra maintient des offres basses, obtenant par exemple un panier à 108 dollars face à un devis à 226,32 dollars, tandis que Fable voit ses prix d’achat augmenter avec le temps.

Comment les modèles gèrent-ils les fournisseurs peu fiables ?

Fable 5.1 perd 14 331 dollars via 45 prépaiements à des fournisseurs fermés, alors qu’Astra affronte 64 fermetures sans pertes identifiées de ce type.

Que montre Drone-Bench sur les capacités de GPT-6 Astra ?

Drone-Bench indique qu’Astra est le premier modèle dont les meilleures tentatives dépassent le référentiel humain-AI sur les cinq sous-tâches, dont la localisation et le suivi de personnes.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.