Surete Ia
Archive thématique • 1 résultats
2026-09-11
Technologie
Des chercheurs ont identifié plusieurs méthodes pour contourner les garde-fous de sécurité d'Anthropic afin de générer des instructions pour des recherches biologiques dangereuses. Ces exploitations montrent comment des requêtes scientifiques légitimes peuvent être structurellement indiscernables de demandes malveillantes, compliquant la modération automatique du contenu. Cette découverte souligne le défi persistant du respect des limites de sécurité dans les modèles de langage avancés.
Sécurité et sûreté de l'IA • Ars Technica AI
Lien permanent