Anthropic immunise Opus 5 contre les attaques d'injection
D'après The Decoder (25 juillet 2026 à 12h43)
Résumé
Avec Auto Mode, Opus 5 affiche 0 % de réussite aux attaques de prompt injection sur navigateur, sur 129 scénarios testés. Sans ces protections, le taux monte à 3,7 %.
Les faits
Anthropic dit qu’Opus 5, combiné à Auto Mode, atteint un taux de réussite de 0 % face aux attaques de prompt injection pour les agents navigateur, sur 129 scénarios de test. Sans ces couches de protection supplémentaires, le taux est de 3,7 %. Selon l’extrait, ce résultat pourrait signaler une avancée majeure contre un risque central des agents IA qui opèrent dans le navigateur. L’extrait précise que le zéro n’est obtenu que lorsque Auto Mode est activé dans des produits comme Claude Cowork. Ce mode superpose deux couches de défense : l’une analyse les données entrantes pour détecter des instructions cachées avant traitement par le modèle, l’autre bloque les actions dangereuses avant exécution. L’attaque doit donc contourner ces deux protections séparément. Toujours selon l’extrait, Anthropic présente Opus 5 comme « presque immunisé » contre les prompt injections dans son propre logiciel. En test général de prompt injection mené par la société de sécurité Gray Swan, le taux de réussite après 15 tentatives tombe de 5,5 % pour Opus 4.8 à 2,0 % pour Opus 5. L’extrait ajoute que, sans Auto Mode, Sonnet 5 fait mieux qu’Opus 5 sur ce point, avec 0,93 %, et que seule la combinaison du modèle et du logiciel de protection permet d’atteindre 0 %. La menace est définie comme une attaque consistant à glisser des instructions malveillantes via des entrées manipulées, par exemple du texte caché sur une page web.
Pourquoi c’est important
Le chiffre de 0 % est important parce qu’il vise l’un des points les plus sensibles des agents IA : le navigateur. Dans ce contexte, un agent lit des pages, absorbe du contenu potentiellement hostile et agit ensuite à partir de ces informations. Si une protection peut faire tomber le succès des attaques à zéro dans un cadre précis, cela change la crédibilité des agents pour des usages plus autonomes. L’enjeu dépasse le seul cas d’Opus 5. L’extrait insiste sur le fait que le résultat dépend d’un empilement de défenses logicielles, pas seulement de la qualité du modèle. Cela signifie que la sécurité des agents IA ne repose pas uniquement sur le modèle lui-même, mais aussi sur l’architecture qui l’entoure, avec un modèle plus sûr lorsque les protections d’entrée et d’exécution travaillent ensemble.
Questions fréquentes
Quel est le taux d’attaque réussi avec Auto Mode ?
Il est de 0 % sur 129 scénarios de test pour les agents navigateur.
Quel est le taux sans ces protections ?
Sans Auto Mode et ses protections, le taux est de 3,7 %.
Combien de scénarios ont été testés ?
Le test couvre 129 scénarios pour les agents navigateur.
Quelle est la définition donnée de la prompt injection ?
C’est une attaque où un acteur glisse des instructions cachées dans des entrées manipulées, comme du texte dissimulé sur une page web.
Source
The DecoderAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.