Benchmark ExploitBench de Bugcrowd muestra que Claude Mythos supera a GPT5.5 en explotación de vulnerabilidades de Chrome (infosecurity-magazine.com)
- Mythos puntuación promedio 9,90/16 vs GPT5.5 5,51/16 en ExploitBench.
- Mythos explotó completamente 21/41 vulnerabilidades de Chrome V8; GPT5.5 solo 2.
- Bugcrowd insta a priorizar y parchear automáticamente con IA.
"Bugcrowd presentó ExploitBench, un benchmark independiente que evalúa la capacidad de los modelos de IA para explotar vulnerabilidades. En los primeros resultados, Anthropic's Claude Mythos obtuvo un promedio de 9,90 sobre 16, explotando completamente 21 de 41 vulnerabilidades del motor V8 de Chrome. OpenAI's GPT5.5 promedió 5,51 y alcanzó el nivel más alto solo en dos vulnerabilidades. David Brumley de Bugcrowd advirtió que los resultados no son generalizables, pero indican que la IA se acerca a los hackers humanos de élite. El benchmark mide cinco etapas de explotación hasta la ejecución de código arbitrario."
aún no hay comentarios.