Le benchmark ExploitBench de Bugcrowd montre que Claude Mythos surpasse GPT5.5 dans l'exploitation des vulnérabilités Chrome (infosecurity-magazine.com)
- Mythos score moyen 9,90/16 contre GPT5.5 5,51/16 sur ExploitBench.
- Mythos a exploité complètement 21/41 vulnérabilités Chrome V8 ; GPT5.5 seulement 2.
- Bugcrowd appelle à une correction automatisée par IA face à l'accélération des attaquants.
"Bugcrowd a dévoilé ExploitBench, un benchmark indépendant évaluant la capacité des modèles d'IA à exploiter des vulnérabilités. Aux premiers résultats, le Claude Mythos d'Anthropic a obtenu une note moyenne de 9,90 sur 16, exploitant complètement 21 des 41 vulnérabilités du moteur V8 de Chrome. Le GPT5.5 d'OpenAI a obtenu une moyenne de 5,51 et n'a atteint le plus haut niveau que pour deux vulnérabilités. David Brumley de Bugcrowd a mis en garde contre une généralisation excessive, mais a noté que l'IA se rapproche des hackers humains d'élite. Le benchmark mesure cinq stades d'exploitation jusqu'à l'exécution de code arbitraire."
aucun commentaire pour l'instant.