Les modèles vision-langage butent encore sur un mot clé : la négation
Les modèles capables d’analyser une image et une consigne écrite restent déstabilisés par des formulations aussi courantes que « sans » ou « n’est pas ». Une étude menée au MIT montre que cette faiblesse peut compromettre leur usage dans des domaines sensibles, mais qu’un entraînement mieux ciblé permet déjà de la réduire.




