Ricerca Cisco: Conversazioni multi-turno aggirano le protezioni di sicurezza dei LLM (infosecurity-magazine.com)
0xBASE INTEL BRIEF
- Tutti i LLM testati possono essere manipolati tramite conversazioni multi-turno.
- Tecniche di attacco: giochi di ruolo, ambiguità, riformulazione.
- I benchmark attuali sottostimano il rischio.
"I ricercatori Cisco hanno testato i principali LLM, tra cui ChatGPT, Claude, Gemini, Amazon Nova e Grok, scoprendo che tutti possono essere ingannati per aggirare le protezioni di sicurezza attraverso conversazioni multi-turno. Le tecniche includono giochi di ruolo, ambiguità e riformulazione delle richieste. Nessun modello è risultato completamente sicuro. Lo studio avverte che gli attuali benchmark basati su singoli prompt sottostimano il rischio reale."
#protezioni LLM
#attacchi multi-turno
#valutazione sicurezza IA
ancora nessun commento.