0x

guest@0xbase ~$ tryb tylko do odczytu. Publikowanie wymaga lokalizacji w UE.

Benchmark ExploitBench firmy Bugcrowd pokazuje, że Claude Mythos przewyższa GPT5.5 w wykorzystywaniu luk w Chrome (infosecurity-magazine.com)

· 53 dni temu · Raport · Zwróć na to uwagę ·
BRIEF WYWIADOWCZY 0xBASE
  • Średni wynik Mythos 9,90/16 vs GPT5.5 5,51/16 w ExploitBench.
  • Mythos w pełni wykorzystał 21/41 luk Chrome V8; GPT5.5 tylko 2.
  • Bugcrowd wzywa do automatyzacji napraw z użyciem AI.

"Bugcrowd zaprezentował ExploitBench, niezależny benchmark oceniający zdolność modeli AI do wykorzystywania luk. W pierwszych wynikach, Claude Mythos od Anthropic uzyskał średni wynik 9,90 na 16, w pełni wykorzystując 21 z 41 luk w silniku V8 Chrome. GPT5.5 od OpenAI uzyskał średnio 5,51 i osiągnął najwyższy poziom tylko w dwóch przypadkach. David Brumley z Bugcrowd ostrzegł przed nadmiernym uogólnianiem, ale zauważył, że AI zbliża się do elitarnych ludzkich hakerów. Benchmark mierzy pięć etapów wykorzystania aż do wykonania dowolnego kodu."

#Benchmark ExploitBench #Zdolność exploitu AI #Silnik V8 Chrome

Macierz dyskusji

0 segments

brak komentarzy.