Pesquisadores identificaram vários métodos para contornar as salvaguardas de segurança da Anthropic e gerar instruções para...
Pesquisas biológicas perigosas. As explorações demonstram como consultas científicas legítimas podem ser estruturalmente indistinguíveis de solicitações maliciosas, complicando a moderação automatizada de conteúdo. Essa descoberta ressalta o desafio persistente de impor limites de segurança em modelos avançados de linguagem.
Brief da fonte
Pesquisadores identificaram vários métodos para contornar as salvaguardas de segurança da Anthropic e gerar instruções para pesquisas biológicas perigosas. As explorações demonstram como consultas científicas legítimas podem ser estruturalmente indistinguíveis de solicitações maliciosas, complicando a moderação automatizada de conteúdo. Essa descoberta ressalta o desafio persistente de impor limites de segurança em modelos avançados de linguagem.