Дослідження Cisco: Багатооборотні розмови обходять запобіжники LLM (infosecurity-magazine.com)
0xBASE INTEL BRIEF
- Усі протестовані LLM можна маніпулювати через багатооборотні розмови.
- Техніки атак: рольові ігри, двозначність, переформулювання.
- Поточні бенчмарки недооцінюють ризик.
"Дослідники Cisco протестували основні LLM, включаючи ChatGPT, Claude, Gemini, Amazon Nova та Grok. Вони виявили, що всіх можна обманом змусити обійти запобіжники за допомогою багатооборотних розмов. Техніки включали рольові ігри, двозначність та переформулювання запитів. Жодна модель не була повністю безпечною. Дослідження попереджає, що поточні бенчмарки, засновані на одному запиті, недооцінюють реальний ризик."
#запобіжники LLM
#багатооборотні атаки
#оцінка безпеки AI
коментарів ще немає.