Los investigadores han identificado múltiples métodos para eludir las salvaguardas de seguridad de Anthropic y generar...
Instrucciones para investigación biológica peligrosa. Los exploits demuestran cómo las consultas científicas legítimas pueden ser estructuralmente indistinguibles de las solicitudes maliciosas, lo que complica la moderación automatizada de contenido. Este hallazgo subraya el desafío persistente de hacer cumplir los límites de seguridad en los modelos de lenguaje avanzados.
Resumen fuente
Los investigadores han identificado múltiples métodos para eludir las salvaguardas de seguridad de Anthropic y generar instrucciones para investigación biológica peligrosa. Los exploits demuestran cómo las consultas científicas legítimas pueden ser estructuralmente indistinguibles de las solicitudes maliciosas, lo que complica la moderación automatizada de contenido. Este hallazgo subraya el desafío persistente de hacer cumplir los límites de seguridad en los modelos de lenguaje avanzados.