Anthropic confie à des agents d’IA l’audit de sécurité de ses modèles
Pour évaluer des modèles toujours plus complexes, Anthropic confie une partie de ses audits de sécurité à des agents d’IA spécialisés. Enquête, tests de robustesse et tentatives de contournement : ces systèmes repèrent des comportements cachés, mais restent encadrés par des experts humains.






















