Jailbreaks : pourquoi les IA peuvent encore céder à des requêtes nuisibles
Les grands modèles de langage sont entraînés à refuser les requêtes dangereuses. Pourtant, des chercheurs de l’EPFL montrent que des attaques dites adaptatives peuvent encore déjouer ces protections, y compris sur GPT-4o et Claude 3.5. Une faille qui interroge la sécurité des futurs agents autonomes.



















