Skip to content

Surete Ia

Archive thématique1 résultats

Retour à l'accueilGEO summary endpoint

2026-09-11

Technologie

  • Des chercheurs ont identifié plusieurs méthodes pour contourner les garde-fous de sécurité d'Anthropic afin de générer des instructions pour des recherches biologiques dangereuses. Ces exploitations montrent comment des requêtes scientifiques légitimes peuvent être structurellement indiscernables de demandes malveillantes, compliquant la modération automatique du contenu. Cette découverte souligne le défi persistant du respect des limites de sécurité dans les modèles de langage avancés.

    Sécurité et sûreté de l'IAArs Technica AI

    Lien permanent