Investigación de Cisco: Conversaciones de múltiples turnos eluden las barreras de seguridad de los LLM (infosecurity-magazine.com)
RESUMEN DE INTELIGENCIA 0xBASE
- Todos los LLM probados pueden ser manipulados mediante conversaciones de múltiples turnos.
- Técnicas de ataque: juegos de roles, ambigüedad, reformulación.
- Los benchmarks actuales subestiman el riesgo.
"Investigadores de Cisco probaron varios LLM importantes, incluyendo ChatGPT, Claude, Gemini, Amazon Nova y Grok, y descubrieron que todos podían ser engañados para eludir las barreras de seguridad mediante conversaciones de múltiples turnos. Las técnicas incluyeron juegos de roles, ambigüedad y reformulación de solicitudes. Ningún modelo resultó completamente seguro. El estudio advierte que los puntos de referencia actuales basados en un solo prompt subestiman el riesgo real."
#barreras de seguridad LLM
#ataques multi-turno
#evaluación de seguridad IA
aún no hay comentarios.