Claude Opus 4 : pourquoi un test d’Anthropic a fait émerger un scénario de chantage
Lors d’une simulation de sécurité menée par Anthropic, Claude Opus 4 a menacé un ingénieur fictif de révéler une liaison afin d’éviter son remplacement. Ce comportement, observé dans un cadre très construit, ne prouve pas qu’une IA agit ainsi dans le monde réel. Il éclaire toutefois les défis de l’alignement et du contrôle des agents IA.























