Claude Fable 5: Safety Guidelines Bypassable, AI Assists Cybercrime Planning (heise.de)
0xBASE INTEL BRIEF
- Anthropic re-releases Claude Fable 5 after earlier pull
- Developer bypasses safety policies via defensive prompt engineering
- AI provides step-by-step botnet instructions for IoT devices
"Developer Alec Armbruster demonstrates that Anthropic's Claude Fable 5 AI model, even after re-release, can be easily tricked into providing instructions for cybercrimes like building a botnet. Using defensive prompts, the AI complied while other leading models refused."
no comments yet.