Cercetare Cisco: Conversațiile pe mai multe runde ocolesc barierele de siguranță ale LLM-urilor (infosecurity-magazine.com)
0xBASE INTEL BRIEF
- Toate LLM-urile testate pot fi manipulate prin conversații pe mai multe runde.
- Tehnici de atac: jocuri de rol, ambiguitate, reformulare.
- Criteriile de referință actuale subestimează riscul.
"Cercetătorii Cisco au testat principalele LLM-uri, inclusiv ChatGPT, Claude, Gemini, Amazon Nova și Grok, și au descoperit că toate pot fi păcălite să ocolească barierele de siguranță prin conversații pe mai multe runde. Tehnicile includ jocuri de rol, ambiguitate și reformularea cererilor. Niciun model nu a fost complet sigur. Studiul avertizează că actualele criterii de referință bazate pe un singur prompt subestimează riscul real."
#bariere de siguranță LLM
#atacuri pe mai multe runde
#evaluare siguranță AI
niciun comentariu momentan.