Бенчмарк ExploitBench від Bugcrowd показує, що Claude Mythos перевершує GPT5.5 в експлуатації вразливостей Chrome (infosecurity-magazine.com)
- Середній бал Mythos 9,90/16 проти GPT5.5 5,51/16 у ExploitBench.
- Mythos повністю експлуатував 21/41 вразливостей Chrome V8; GPT5.5 лише 2.
- Bugcrowd закликає до автоматизованого виправлення на основі ШІ.
"Bugcrowd представив ExploitBench, незалежний бенчмарк для оцінки здатності моделей ШІ експлуатувати вразливості. У перших результатах Claude Mythos від Anthropic отримав середній бал 9,90 з 16, повністю експлуатувавши 21 з 41 вразливості двигуна V8 Chrome. GPT5.5 від OpenAI отримав середній бал 5,51 і досяг найвищого рівня лише у двох вразливостях. Девід Брамлі з Bugcrowd попередив про надмірне узагальнення, але зазначив, що ШІ наближається до елітних хакерів-людей. Бенчмарк вимірює п’ять етапів експлуатації аж до виконання довільного коду."
коментарів ще немає.