Bugcrowdin ExploitBench-vertailu osoittaa Claude Mythoksen päihittävän GPT5.5:n Chrome-haavoittuvuuksien hyödyntämisessä (infosecurity-magazine.com)
- Mythoksen keskimääräinen pistemäärä 9,90/16 vs GPT5.5 5,51/16 ExploitBenchissä.
- Mythos hyödynsi täysin 21/41 Chrome V8 -haavoittuvuudesta; GPT5.5 vain 2.
- Bugcrowd vaatii tekoälypohjaista automatisoitua korjaamista.
"Bugcrowd esitteli ExploitBench-nimisen riippumattoman vertailuarvion, joka arvioi tekoälymallien kykyä hyödyntää haavoittuvuuksia. Ensimmäisissä tuloksissa Anthropicin Claude Mythos sai keskimääräiseksi pistemääräksi 9,90/16, hyödyntäen täysin 21 Chrome V8 -moottorin 41 haavoittuvuudesta. OpenAI:n GPT5.5 sai keskimäärin 5,51 ja saavutti korkeimman tason vain kahdessa haavoittuvuudessa. Bugcrowdin David Brumley varoitti liiallisesta yleistämisestä, mutta totesi tekoälyn lähestyvän eliitti-ihmishakkereita. Vertailuarvio mittaa viittä hyödyntämisen vaihetta aina mielivaltaiseen koodin suorittamiseen asti."
ei vielä kommentteja.