Benchmark-ul ExploitBench de la Bugcrowd arată că Claude Mythos depășește GPT5.5 în exploatarea vulnerabilităților Chrome (infosecurity-magazine.com)
- Scor mediu Mythos 9,90/16 vs GPT5.5 5,51/16 pe ExploitBench.
- Mythos a exploatat complet 21/41 vulnerabilități Chrome V8; GPT5.5 doar 2.
- Bugcrowd solicită automatizarea remedierii bazată pe AI.
"Bugcrowd a dezvăluit ExploitBench, un benchmark independent care evaluează capacitatea modelelor AI de a exploata vulnerabilități. În primele rezultate, Claude Mythos de la Anthropic a obținut un scor mediu de 9,90 din 16, exploatând complet 21 din 41 de vulnerabilități ale motorului V8 Chrome. GPT5.5 de la OpenAI a obținut o medie de 5,51 și a atins cel mai înalt nivel doar la două vulnerabilități. David Brumley de la Bugcrowd a avertizat împotriva generalizării excesive, dar a observat că AI se apropie de hackerii umani de elită. Benchmark-ul măsoară cinci etape de exploatare până la execuția de cod arbitrar."
niciun comentariu momentan.