Empoisonnement des LLM : 250 documents peuvent suffire, quelle que soit leur taille
Les grands modèles de langage ne deviennent pas automatiquement plus sûrs à mesure qu’ils grossissent. Des travaux menés notamment par Anthropic et l’Alan Turing Institute indiquent qu’environ 250 documents malveillants peuvent suffire à leur inculquer un comportement caché. Un résultat qui déplace l’attention vers la sécurité des données d’entraînement.


