Cisco : les conversations multi-tours contournent les garde-fous des LLM (infosecurity-magazine.com)
BRIEFING RENSEIGNEMENT 0xBASE
- Tous les LLM testés peuvent être manipulés par des conversations multi-tours.
- Techniques d'attaque : jeux de rôle, ambiguïté, reformulation.
- Les benchmarks actuels sous-estiment le risque.
"Des chercheurs de Cisco ont testé plusieurs LLM majeurs, dont ChatGPT, Claude, Gemini, Amazon Nova et Grok. Ils ont découvert que tous pouvaient être trompés pour contourner les garde-fous via des conversations multi-tours. Techniques : jeux de rôle, ambiguïté, reformulation des requêtes. Aucun modèle n'était totalement sûr. L'étude prévient que les benchmarks actuels, basés sur un seul prompt, sous-estiment le risque réel."
#garde-fous LLM
#attaques multi-tours
#évaluation sécurité IA
aucun commentaire pour l'instant.