Artificial Analysis lance Optima pour évaluer l'IA sur mesure

D'après The Decoder (16 août 2026 à 07h50)

Résumé

Artificial Analysis lance Optima, une plateforme qui permet de créer des benchmarks IA personnalisés à partir de ses propres données pour comparer qualité, coût et temps par tâche.

Les faits

Artificial Analysis dévoile Optima, une nouvelle plateforme qui permet aux utilisateurs de créer leurs propres benchmarks d’IA à partir de leurs données et de leurs flux de travail. L’objectif est de dépasser les limites des benchmarks publics, qui comparent les modèles sur des tâches prédéfinies sans toujours indiquer quel modèle convient le mieux à un cas d’usage précis. Optima entend combler cette lacune en proposant des comparaisons adaptées à chaque workflow. La plateforme permet de construire des benchmarks personnalisés à partir de données propriétaires, de workflows existants ou même d’une simple description de cas d’usage. Les utilisateurs peuvent ensuite tester des modèles d’IA parmi les modèles « leaders » du moment et les comparer selon trois dimensions : la qualité des résultats, le coût par tâche et le temps par tâche. Selon Artificial Analysis, Optima est d’ores et déjà disponible. Optima accepte plusieurs types de données sources. Les utilisateurs peuvent importer des jeux de données d’évaluation existants depuis leurs propres fichiers ou depuis Hugging Face, ainsi que des traces d’agents IA issues de plateformes comme Arize, Braintrust ou Langfuse. Les développeurs peuvent aussi installer une fonctionnalité qui collecte des informations depuis leur environnement de développement et leurs sessions passées. Pour les utilisateurs qui ne disposent pas de telles données, Optima permet de décrire le cas d’usage visé et de fournir des exemples d’entrées et de sorties. À partir de ces éléments, la plateforme génère des entrées de test suggérées, des critères d’évaluation et des exemples de tâches, que les utilisateurs peuvent ensuite revoir et affiner grâce à leurs retours avant de lancer le benchmark.

Pourquoi c’est important

Optima s’attaque à un défaut majeur des benchmarks d’IA actuels : leur déconnexion des situations réelles des entreprises. En permettant d’évaluer les modèles sur des données et des workflows propres à chaque organisation, la plateforme offre une vision plus opérationnelle des performances, au-delà des scores sur des jeux de tests publics standardisés. En suivant non seulement la qualité, mais aussi le coût par tâche et le temps par tâche, Optima apporte des indicateurs directement exploitables pour décider si les gains de performance d’un modèle justifient un coût ou un temps de traitement plus élevés. Pour les applications agentiques, où un modèle bon marché peut finalement coûter plus cher s’il échoue plus souvent ou requiert davantage de reprises, le « coût par tâche complétée » devient un indicateur central pour des choix technologiques et économiques mieux informés.

Questions fréquentes

Qu’est-ce qu’Optima d’Artificial Analysis ?

Optima est une plateforme qui permet de créer des benchmarks d’IA personnalisés à partir de ses propres données, workflows ou descriptions de cas d’usage.

Quels critères Optima permet-il de comparer entre les modèles ?

Optima compare les modèles sur la qualité des résultats, le coût par tâche et le temps par tâche pour des cas d’usage spécifiques.

Quelles sources de données Optima peut-il utiliser ?

Optima peut utiliser des jeux de données d’évaluation locaux, des jeux de Hugging Face et des traces d’agents IA d’Arize, Braintrust ou Langfuse.

Optima est-il adapté aux utilisateurs sans données d’évaluation existantes ?

Oui, les utilisateurs peuvent décrire leur cas d’usage et fournir quelques exemples, Optima générant alors des tests et critères suggérés.

Pourquoi le coût par tâche est-il mis en avant pour les applications agentiques ?

Parce qu’un modèle moins cher en prix par jeton peut coûter plus cher au final s’il nécessite davantage de tentatives ou de corrections.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.