Anthropic apprend à ses IA à s'améliorer seules
D'après TechCrunch (28 août 2026 à 21h30)
Résumé
Anthropic expérimente des systèmes d’IA automatiques qui améliorent leur performance sur dix benchmarks de comportements désalignés, sans sacrifier leurs capacités générales.
Les faits
Anthropic explore une nouvelle génération de systèmes d’intelligence artificielle capables d’agir comme des « chercheurs automatisés » pour améliorer leur propre alignement. L’entreprise a détaillé ce travail dans une étude consacrée à la manière dont des systèmes automatisés peuvent faire progresser des modèles sur des tests d’alignement. Au cœur de cette recherche, dix benchmarks ciblant des comportements précisément désalignés servent de référence pour évaluer la sécurité des modèles. Selon les auteurs, « étant donnés 10 benchmarks pour des comportements spécifiquement désalignés, les systèmes automatisés ont été capables d’améliorer les performances sur chacun d’entre eux ». Ces benchmarks couvrent différentes formes de comportements problématiques et constituent un cadre standardisé pour mesurer les progrès. Les résultats mis en avant montrent que ces systèmes d’IA parviennent à renforcer la performance sur l’ensemble des dix benchmarks sans détériorer les performances globales du modèle. L’étude insiste sur ce point : « les systèmes automatisés ont été capables d’améliorer les performances sur chacun d’entre eux sans dégrader les performances globales ». Le travail s’inscrit dans une réflexion plus large sur la possibilité pour des systèmes d’IA de contribuer eux‑mêmes à la réduction de leurs comportements risqués.
Pourquoi c’est important
Cette expérimentation marque une étape significative dans la recherche sur l’alignement, en suggérant qu’il est possible de confier à des systèmes d’IA une partie du travail de diagnostic et de correction de leurs propres défaillances. Le fait d’obtenir des améliorations sur dix benchmarks de comportements désalignés, sans perte de capacités générales, renforce l’idée qu’un alignement plus robuste peut être obtenu par des boucles automatisées. À moyen terme, cette approche pourrait ouvrir la voie à des formes de perfectionnement récursif, où des modèles contribuent de manière structurée à sécuriser d’autres modèles. Pour les acteurs industriels comme pour les régulateurs, la perspective de systèmes capables d’améliorer systématiquement leur alignement sur des batteries de tests standardisées constitue un élément clé pour rapprocher les avancées rapides en IA de exigences de sécurité plus strictes.
Questions fréquentes
Que teste Anthropic dans cette recherche sur l’IA auto‑améliorante ?
Anthropic évalue des systèmes automatisés capables d’améliorer un modèle sur dix benchmarks de comportements désalignés.
Combien de benchmarks de désalignement sont utilisés dans l’étude ?
L’étude s’appuie sur dix benchmarks ciblant des comportements spécifiquement désalignés.
Les améliorations d’alignement dégradent‑elles les capacités générales des modèles ?
Les auteurs indiquent que les systèmes automatisés n’ont pas dégradé les performances globales des modèles.
Quel est le principal résultat mis en avant par Anthropic ?
Les systèmes ont amélioré la performance sur chacun des dix benchmarks sans perte de performance globale.
Que signifie « comportements désalignés » dans ce contexte ?
Il s’agit de comportements problématiques mesurés par des benchmarks de sécurité spécifiques.
Source
TechCrunchAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.