Benchmark ExploitBench firmy Bugcrowd pokazuje, że Claude Mythos przewyższa GPT5.5 w wykorzystywaniu luk w Chrome (infosecurity-magazine.com)
- Średni wynik Mythos 9,90/16 vs GPT5.5 5,51/16 w ExploitBench.
- Mythos w pełni wykorzystał 21/41 luk Chrome V8; GPT5.5 tylko 2.
- Bugcrowd wzywa do automatyzacji napraw z użyciem AI.
"Bugcrowd zaprezentował ExploitBench, niezależny benchmark oceniający zdolność modeli AI do wykorzystywania luk. W pierwszych wynikach, Claude Mythos od Anthropic uzyskał średni wynik 9,90 na 16, w pełni wykorzystując 21 z 41 luk w silniku V8 Chrome. GPT5.5 od OpenAI uzyskał średnio 5,51 i osiągnął najwyższy poziom tylko w dwóch przypadkach. David Brumley z Bugcrowd ostrzegł przed nadmiernym uogólnianiem, ale zauważył, że AI zbliża się do elitarnych ludzkich hakerów. Benchmark mierzy pięć etapów wykorzystania aż do wykonania dowolnego kodu."
brak komentarzy.