Microsoft lance ThinkingBox pour évaluer l'IA en profondeur
D'après Hugging Face (4 octobre 2026 à 00h56)
Résumé
Microsoft présente ThinkingBox, un banc d’essai qui évalue les agents IA sur les états finaux des bases de données et la répétabilité des résultats.
Les faits
Microsoft présente ThinkingBox, un environnement qui évalue les agents IA à partir des enregistrements qu’ils laissent derrière eux plutôt que des seules phrases qu’ils génèrent. Le dispositif exécute un agent dans des sessions MCP isolées, puis examine l’état final du système dorsal et les effets de bord produits. Le banc d’essai couvre 507 flux de travail professionnels avec état. Chaque exécution est répétée 20 fois sur différents modèles de grands modèles de langage afin d’évaluer la régularité des résultats. ThinkingBox vérifie si l’agent atteint l’état final requis, et non s’il se contente d’effectuer des appels d’outils correctement formés. Microsoft illustre cette différence par le cas d’une cliente confrontée à un appareil de cuisine de 745 dollars bloqué dans une procédure d’exception chez un transporteur, dans un centre de distribution de Nashville, quinze jours après la date de livraison estimée. L’agent effectue neuf appels d’outils, consulte la commande, le suivi, le profil client et la politique de remboursement, puis ouvre et documente un ticket. Malgré cette séquence, deux problèmes subsistent : l’exception du transporteur reste ouverte alors que l’état attendu exigeait une résolution en attente, et la cliente n’obtient pas de réponse réelle à sa demande. Comme le résume le titre de l’article, « l’agent disait que c’était terminé, mais la base de données n’était pas d’accord ». ThinkingBox est disponible sur Hugging Face, avec son harnais et son jeu de données.
Pourquoi c’est important
ThinkingBox déplace l’évaluation des agents IA de la qualité apparente de leurs échanges vers les conséquences vérifiables de leurs actions. Un agent peut multiplier les appels d’outils et lire correctement une politique tout en laissant le système dans un état incompatible avec l’objectif demandé. La répétition de chaque flux 20 fois met également l’accent sur la constance. Pour les usages professionnels, atteindre le bon résultat une seule fois ne suffit pas : l’agent doit produire de manière répétée les effets attendus dans la base de données et éviter les effets manquants ou superflus.
Questions fréquentes
Que mesure ThinkingBox ?
ThinkingBox mesure l’état final du système dorsal et les effets de bord laissés par un agent IA après l’exécution d’une tâche.
Combien de flux de travail sont évalués ?
Le banc d’essai couvre 507 flux de travail professionnels avec état.
Combien de fois chaque exécution est-elle répétée ?
Chaque flux est exécuté 20 fois sur différents modèles de grands modèles de langage.
Pourquoi les appels d’outils ne suffisent-ils pas ?
Un agent peut effectuer des appels correctement formés sans atteindre l’état final requis dans la base de données.
Où ThinkingBox est-il disponible ?
ThinkingBox est disponible sur Hugging Face, avec son harnais et son jeu de données.
Source
Hugging FaceAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.