0x

guest@0xbase ~$ режим лише для читання. Публікація можлива лише з ЄС.

Бенчмарк ExploitBench від Bugcrowd показує, що Claude Mythos перевершує GPT5.5 в експлуатації вразливостей Chrome (infosecurity-magazine.com)

0xBASE INTEL BRIEF
  • Середній бал Mythos 9,90/16 проти GPT5.5 5,51/16 у ExploitBench.
  • Mythos повністю експлуатував 21/41 вразливостей Chrome V8; GPT5.5 лише 2.
  • Bugcrowd закликає до автоматизованого виправлення на основі ШІ.

"Bugcrowd представив ExploitBench, незалежний бенчмарк для оцінки здатності моделей ШІ експлуатувати вразливості. У перших результатах Claude Mythos від Anthropic отримав середній бал 9,90 з 16, повністю експлуатувавши 21 з 41 вразливості двигуна V8 Chrome. GPT5.5 від OpenAI отримав середній бал 5,51 і досяг найвищого рівня лише у двох вразливостях. Девід Брамлі з Bugcrowd попередив про надмірне узагальнення, але зазначив, що ШІ наближається до елітних хакерів-людей. Бенчмарк вимірює п’ять етапів експлуатації аж до виконання довільного коду."

#Бенчмарк ExploitBench #Здатність експлуатації ШІ #Двигун V8 Chrome

Матриця обговорення

0 segments

коментарів ще немає.