IBM et Hugging Face s'attaquent à l'inconstance des IA

D'après Hugging Face (15 septembre 2026 à 18h00)

Résumé

IBM Research et Hugging Face dévoilent des outils pour mesurer et réduire l’inconstance des agents IA, en divisant par deux l’écart entre précision moyenne et fiabilité.

Les faits

Les auteurs partent d’un constat simple : un agent conversationnel peut réussir une tâche en répétition, puis échouer en démonstration publique sur la même requête, transformant un succès initial en problème de fiabilité lorsqu’il s’agit par exemple de rapprocher une transaction financière ou de vérifier des obligations dans un contrat. Sur le benchmark AppWorld, un agent ReAct utilisant GPT-4.1 affiche une précision moyenne robuste avec un Mean@5 de 77,4 % sur cinq exécutions, mais ne parvient à réussir l’ensemble des cinq répétitions que pour 53,0 % des tâches, soit un « écart de cohérence » de 24,4 points qui révèle des tâches que l’agent résout de manière intermittente sans changement de contexte. L’article distingue clairement la métrique classique Mean@k d’une nouvelle mesure, Pass^k, définie comme la fraction de tâches où l’agent réussit toutes les k exécutions, en opposition à Pass@k, qui ne demande qu’au moins un succès sur k tentatives et reste donc plus optimiste dans les scénarios où l’on peut vérifier et relancer. Pour traiter cet écart, IBM Research et Hugging Face s’appuient sur ALTK-Evolve et introduisent le Consistency Analyzer et des « consistency guidelines » : ces directives dérivées automatiquement des trajectoires passées de l’agent sont réinjectées à l’inférence et permettent de réduire l’écart de cohérence de 24,4 à 12,0 points, avec un gain de 16,0 points sur les tâches identiques et de 13,0 points sur les tâches similaires, sans dégrader la précision moyenne.

Pourquoi c’est important

Cette contribution met en lumière un angle mort des évaluations d’agents IA : la fiabilité sur répétition de la même requête, qui n’est pas captée par les métriques de précision moyenne et devient critique dès que l’on confie à ces systèmes des tâches sensibles comme la conformité ou la supervision de flux financiers. En proposant des outils comme le Consistency Analyzer et des consistency guidelines, intégrés à ALTK-Evolve, IBM Research et Hugging Face déplacent le débat au-delà de la seule capacité brute des modèles et ouvrent la voie à des agents capables d’être à la fois puissants et cohérents, condition indispensable à leur adoption dans des environnements de production exigeants.

Questions fréquentes

Qu’est-ce que le « consistency gap » mis en avant par les chercheurs ?

C’est la différence entre la précision moyenne Mean@k et la métrique Pass^k, ici un écart de 24,4 points entre 77,4 % de réussite moyenne et 53,0 % de succès sur 5 répétitions.

Comment est défini Pass^k par rapport à Pass@k ?

Pass^k mesure la fraction de tâches où toutes les k exécutions réussissent, tandis que Pass@k ne demande qu’au moins un succès sur k tentatives, ce qui en fait une métrique plus optimiste.

Quel est le rôle d’ALTK-Evolve dans cette approche ?

ALTK-Evolve transforme les trajectoires passées de l’agent en directives réutilisables, injectées à l’inférence, et sert de base pour les nouvelles consistency guidelines.

Que fait le Consistency Analyzer pour les agents IA ?

Il rééchantillonne les décisions d’une trajectoire enregistrée pour repérer les points de décision sujets au basculement, sans relancer la tâche de bout en bout ni nécessiter de vérité terrain.

Les consistency guidelines affectent-elles la précision moyenne des agents ?

Les auteurs indiquent que ces directives réduisent l’écart de cohérence de moitié sans coût en termes de précision moyenne, qui reste inchangée.

Source

Hugging Face

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.