0x

guest@0xbase ~$ modo de solo lectura. Publicar requiere ubicación en la UE.

Benchmark ExploitBench de Bugcrowd muestra que Claude Mythos supera a GPT5.5 en explotación de vulnerabilidades de Chrome (infosecurity-magazine.com)

· hace 53d · Informe · Destaca esto ·
RESUMEN DE INTELIGENCIA 0xBASE
  • Mythos puntuación promedio 9,90/16 vs GPT5.5 5,51/16 en ExploitBench.
  • Mythos explotó completamente 21/41 vulnerabilidades de Chrome V8; GPT5.5 solo 2.
  • Bugcrowd insta a priorizar y parchear automáticamente con IA.

"Bugcrowd presentó ExploitBench, un benchmark independiente que evalúa la capacidad de los modelos de IA para explotar vulnerabilidades. En los primeros resultados, Anthropic's Claude Mythos obtuvo un promedio de 9,90 sobre 16, explotando completamente 21 de 41 vulnerabilidades del motor V8 de Chrome. OpenAI's GPT5.5 promedió 5,51 y alcanzó el nivel más alto solo en dos vulnerabilidades. David Brumley de Bugcrowd advirtió que los resultados no son generalizables, pero indican que la IA se acerca a los hackers humanos de élite. El benchmark mide cinco etapas de explotación hasta la ejecución de código arbitrario."

#Benchmark ExploitBench #Capacidad de explotación IA #Motor V8 de Chrome

Matriz de discusión

0 segmentos

aún no hay comentarios.