Bugcrowd-Benchmark zeigt: Claude Mythos übertrifft GPT5.5 bei Chrome-Exploits (infosecurity-magazine.com)
- Claude Mythos erzielte 9,90 vs. GPT5.5 mit 5,51 Punkten im ExploitBench.
- Mythos exploitierte 21 von 41 Chrome-Schwachstellen vollständig; GPT5.5 nur 2.
- Bugcrowd fordert KI-gestützte Automatisierung der Schwachstellenbehebung.
"Ein neuer unabhängiger Benchmark namens ExploitBench bewertet die Fähigkeit von KI-Modellen, Sicherheitslücken auszunutzen. Anthropics Claude Mythos erreichte einen durchschnittlichen Score von 9,90 von 16 Punkten und exploitierte 21 von 41 Schwachstellen vollständig. OpenAIs GPT5.5 erzielte nur 5,51 Punkte und erreichte die höchste Stufe bei zwei Schwachstellen. Die Ergebnisse zeigen, dass KI-Modelle menschlichen Hackern bei der Ausnutzung von Chrome-V8-Engine-Fehlern näherkommen. Bugcrowd entwickelte den Benchmark mit Carnegie Mellon University und Chrome-Experten."
Noch keine Kommentare.