Des données filtrées pour rendre les modèles d’IA ouverts plus difficiles à détourner
Peut-on empêcher un modèle d’IA accessible au public d’apprendre des savoirs dangereux avant même sa diffusion ? Des chercheurs d’Oxford, d’EleutherAI et de l’UK AI Security Institute ont testé une réponse : retirer ces contenus des données d’entraînement. Leur méthode préserverait les performances générales tout en compliquant les modifications malveillantes.


