Il benchmark ExploitBench di Bugcrowd mostra che Claude Mythos supera GPT5.5 nello sfruttamento delle vulnerabilità di Chrome (infosecurity-magazine.com)
- Mythos punteggio medio 9,90/16 vs GPT5.5 5,51/16 su ExploitBench.
- Mythos ha sfruttato completamente 21/41 vulnerabilità Chrome V8; GPT5.5 solo 2.
- Bugcrowd sollecita automazione della correzione basata su IA.
"Bugcrowd ha presentato ExploitBench, un benchmark indipendente che valuta la capacità dei modelli di IA di sfruttare le vulnerabilità. Nei primi risultati, Claude Mythos di Anthropic ha ottenuto un punteggio medio di 9,90 su 16, sfruttando completamente 21 delle 41 vulnerabilità del motore V8 di Chrome. GPT5.5 di OpenAI ha ottenuto una media di 5,51 e ha raggiunto il livello più alto solo in due vulnerabilità. David Brumley di Bugcrowd ha avvertito di non generalizzare eccessivamente, ma ha notato che l'IA si sta avvicinando agli hacker umani d'élite. Il benchmark misura cinque fasi di sfruttamento fino all'esecuzione di codice arbitrario."
ancora nessun commento.