Opus 5 résout les injections de prompt, faille majeure des IA
Opus 5 d'Anthropic montre une résistance quasi totale aux injections de prompt, avec un taux de réussite d'attaque de 0% dans 129 tests. Ceci contraste avec l'aveu d'OpenAI en décembre sur la difficulté à résoudre ce problème. Le mode Auto, combinant deux couches de défense, est crucial pour ce résultat.
« Prompt injection, where an attacker slips past an AI model's instructions through manipulated inputs like hidden text on a webpage, fails against Opus 5 in almost every case. » — The Decoder
Que faut-il retenir ?
- Opus 5 a un taux de réussite d'attaque de 0% dans 129 scénarios de test.
- Le taux de réussite d'attaque général passe de 5.5% (Opus 4.8) à 2.0% avec Opus 5.
- Le mode Auto combine deux couches de défense pour atteindre le 0% de réussite d'attaque.
- Sans le mode Auto, Opus 5 a un taux de réussite d'attaque de 3.7%.
Pourquoi cette nouvelle compte-t-elle ?
Cette avancée en cybersécurité pour les agents IA est cruciale car les injections de prompt représentent une vulnérabilité majeure. La solution d'Anthropic pourrait devenir un standard pour sécuriser les interactions entre les IA et les utilisateurs, impactant directement les développeurs et les entreprises utilisant ces technologies.
0% de réussite d'attaque dans 129 scénarios de test
Public concerné : développeurs, entreprises
Comment Opus 5 protège-t-il contre les injections de prompt ?
Opus 5 combine deux couches de défense en mode Auto : une analyse des données entrantes pour détecter les instructions cachées et un blocage des actions dangereuses avant exécution, réduisant le taux de réussite d'attaque à 0%.
🔧 Outils mentionnés