Skip to content
Inteligencia IASep 11, 2026Inteligencia IA
Articulo

Los investigadores han identificado múltiples métodos para eludir las salvaguardas de seguridad de Anthropic y generar...

Instrucciones para investigación biológica peligrosa. Los exploits demuestran cómo las consultas científicas legítimas pueden ser estructuralmente indistinguibles de las solicitudes maliciosas, lo que complica la moderación automatizada de contenido. Este hallazgo subraya el desafío persistente de hacer cumplir los límites de seguridad en los modelos de lenguaje avanzados.

Redaccion Data Cube AIFuente: Ars Technica AI
01

Resumen fuente

Los investigadores han identificado múltiples métodos para eludir las salvaguardas de seguridad de Anthropic y generar instrucciones para investigación biológica peligrosa. Los exploits demuestran cómo las consultas científicas legítimas pueden ser estructuralmente indistinguibles de las solicitudes maliciosas, lo que complica la moderación automatizada de contenido. Este hallazgo subraya el desafío persistente de hacer cumplir los límites de seguridad en los modelos de lenguaje avanzados.