Des chercheurs ont identifié plusieurs méthodes pour contourner les garde-fous de sécurité d'Anthropic afin de générer des...
Instructions pour des recherches biologiques dangereuses. Ces exploits montrent comment des requêtes scientifiques légitimes peuvent être structurellement impossibles à distinguer de demandes malveillantes, ce qui complique la modération automatisée du contenu. Cette découverte souligne le défi persistant que représente l'application des limites de sécurité dans les modèles de langage avancés.
Brief source
Des chercheurs ont identifié plusieurs méthodes pour contourner les garde-fous de sécurité d'Anthropic afin de générer des instructions pour des recherches biologiques dangereuses. Ces exploits montrent comment des requêtes scientifiques légitimes peuvent être structurellement impossibles à distinguer de demandes malveillantes, ce qui complique la modération automatisée du contenu. Cette découverte souligne le défi persistant que représente l'application des limites de sécurité dans les modèles de langage avancés.