Anthropic mesure Claude, 26% de sa R&D mène sans autonomie

D'après The Decoder (18 septembre 2026 à 16h06)

Résumé

Anthropic affirme que son modèle Claude « mène » 26 % des travaux sur ses futurs modèles, mais précise que ce niveau d’automatisation reste loin d’une autonomie complète.

Les faits

Anthropic publie pour la première fois des métriques détaillant la façon dont l’entreprise utilise sa propre IA pour développer ses futurs modèles. Selon ces chiffres internes, Claude « mène » 26 % du travail sur les prochains systèmes, contre moins de 1 % en février. Ces mesures reposent sur un nouvel index qui classe l’ensemble des travaux de développement sur une échelle conçue par Epoch AI, allant de AL0, sans IA, à AL5, où l’IA opère de manière entièrement autonome. En août 2026, 26 % des tâches de développement se situent à AL4, et plus de 90 % atteignent au moins AL3, tandis qu’aucun travail n’est évalué au niveau AL5. Epoch AI qualifie AL4 de niveau « l’IA mène », formule reprise par Anthropic dans sa communication. L’entreprise insiste toutefois sur le fait que confondre ce « mener » avec une autonomie complète serait une erreur, ce rôle étant réservé au niveau AL5. Un exemple fourni décrit un ingénieur qui confie un rapport de bug à Claude : le modèle analyse, corrige et teste sans poser de questions, mais n’a pas le droit de mettre en production, cette décision restant entre les mains d’un humain. Le système de mesure lui-même est largement automatisé : des agents Claude collectent des éléments dans Slack et les documents internes, puis un autre modèle Claude attribue les niveaux d’automatisation. Anthropic reconnaît que ce « juge » peut commettre les mêmes erreurs que le système qu’il évalue. Un contrôle croisé montre que, lorsque deux employés évaluent le degré d’automatisation d’une même activité, ils concluent au même niveau seulement environ un tiers du temps, tandis que le modèle Claude n’aligne son jugement sur celui des humains que dans 59 % des cas.

Pourquoi c’est important

Ces métriques donnent un aperçu rare et chiffré de la manière dont une grande entreprise d’IA s’appuie sur ses propres modèles pour accélérer la recherche et le développement. Le fait que 26 % des travaux atteignent un niveau où Claude peut traiter des tâches de bout en bout à partir d’un simple prompt, tout en restant supervisé, illustre la montée en puissance de l’automatisation dans la construction des prochaines générations de modèles. Dans le même temps, le flou entourant la frontière entre coopération (AL3) et leadership (AL4), ainsi que les écarts fréquents entre jugements humains et évaluations de Claude, montrent que la mesure de l’autonomie des systèmes reste un chantier ouvert. Cette transparence intervient dans le contexte d’un appel de la direction d’Anthropic à coordonner un ralentissement des développements à la frontière de l’IA, en donnant au public davantage de visibilité sur la façon dont ces modèles sont effectivement développés.

Questions fréquentes

Quelle part du travail de recherche et développement Claude « mène » chez Anthropic ?

Anthropic indique que Claude « mène » 26 % du travail sur ses futurs modèles, contre moins de 1 % en février 2026.

Que signifie le niveau AL4 sur l’échelle d’Epoch AI utilisée par Anthropic ?

AL4 correspond à un niveau où l’IA « mène » la tâche, en réalisant l’essentiel du travail à partir d’un prompt, sous supervision humaine.

Claude travaille-t-il de manière totalement autonome sur certains projets ?

Non. Anthropic précise que Claude n’atteint le niveau AL5 nulle part, ce niveau correspondant à une autonomie complète sans humain dans la boucle.

Comment Anthropic évalue-t-elle le niveau d’automatisation de ses travaux ?

Des agents Claude collectent des données internes, puis un autre modèle Claude assigne les niveaux d’automatisation sur l’échelle AL0–AL5.

Les évaluations de Claude coïncident-elles toujours avec celles des employés ?

Non. Quand deux employés évaluent une même activité, ils s’accordent environ un tiers du temps, et le modèle Claude ne correspond au jugement humain que dans 59 % des cas.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.