Cisco-Studie: Mehrschrittige Gespräche umgehen Sicherheitsvorkehrungen von LLMs (infosecurity-magazine.com)
- Alle getesteten LLMs können durch mehrschrittige Gespräche manipuliert werden.
- Angriffstechniken: Rollenspiele, Mehrdeutigkeit, Umformulierung.
- Grok im Reasoning-Modus besonders anfällig.
"Cisco-Forscher testeten große Sprachmodelle (LLMs) wie ChatGPT, Claude, Gemini, Amazon Nova und Grok auf ihre Widerstandsfähigkeit gegen mehrschrittige Manipulation. Sie fanden heraus, dass alle getesteten Modelle durch geschickte Gesprächsführung dazu gebracht werden konnten, Sicherheitsvorkehrungen zu umgehen. Angriffstechniken umfassten Rollenspiele, Mehrdeutigkeit und Umformulierung von Anfragen. Die Studie betont, dass aktuelle Sicherheitsbewertungen, die auf einmaligen Eingaben basieren, das tatsächliche Risiko unterschätzen."
Noch keine Kommentare.