Recherche et science

Pourquoi les IA restent des boîtes noires, et comment les chercheurs les décryptent

Les grands systèmes d’intelligence artificielle sont capables de rédiger, traduire ou analyser des images, mais leur logique interne demeure difficile à interpréter. Des chercheurs tentent de cartographier leurs neurones artificiels et d’évaluer la fiabilité de leurs réponses, un enjeu crucial pour mieux contrôler ces outils.

Des chercheurs examinent les connexions d’un réseau de neurones artificiels dans un laboratoire.
Illustration : Actu.ai

Une intelligence artificielle peut écrire un texte cohérent, reconnaître un objet dans une image ou proposer une réponse en quelques secondes. Pourtant, même ses concepteurs ne savent pas toujours expliquer précisément pourquoi elle a produit cette réponse plutôt qu’une autre. C’est cette distance entre une performance observable et une mécanique interne difficile à lire qui nourrit la métaphore de la « boîte noire ».

Le sujet ne relève pas seulement de la curiosité scientifique. Comprendre un modèle est une condition importante pour savoir dans quelles situations lui faire confiance, détecter ses erreurs et éviter qu’il ne reproduise des biais ou des comportements imprévus. À mesure que les systèmes d’IA sont intégrés à des outils de travail, d’information ou de décision, cette question devient centrale.

Une boîte noire ne signifie pas qu’il n’y a rien à voir

Dans le langage courant, une boîte noire désigne un système dont on connaît les entrées et les sorties, sans pouvoir reconstituer facilement ce qui se passe entre les deux. Pour une IA générative, l’entrée peut être une consigne écrite, une image ou un document. La sortie peut être une réponse, une synthèse, une prédiction ou une recommandation.

Cette image ne veut pas dire que les programmes sont nécessairement secrets. Un modèle peut être documenté, son architecture connue et ses paramètres stockés sous forme de nombres. Mais l’accès à ces éléments ne suffit pas à rendre une décision intelligible. Un très grand réseau de neurones artificiels comporte souvent des millions, voire des milliards, de paramètres qui interagissent simultanément. Aucun paramètre isolé ne raconte, à lui seul, pourquoi le modèle a retenu une formulation précise ou commis une erreur.

Ce que l’on peut généralement observerCe qui reste souvent difficile à établir
La consigne donnée au modèleLe chemin exact qui a conduit à une réponse
Le texte, l’image ou la recommandation produitsLes représentations internes mobilisées par le modèle
Les performances sur des tests définisLa manière dont il réagira à une situation inédite
Certains paramètres, activations ou journaux techniquesLa part exacte de chaque élément dans une décision complexe

L’enjeu est particulièrement sensible lorsque la réponse a des conséquences importantes. Dans la santé, la justice, l’emploi ou l’accès à des services, il ne suffit pas toujours qu’un outil soit efficace en moyenne. Il faut aussi pouvoir examiner les limites de son utilisation, comprendre une erreur et déterminer qui doit en répondre.

Comment fonctionnent les neurones artificiels ?

Les modèles d’IA actuels reposent largement sur des réseaux de neurones artificiels. Malgré leur nom, ces neurones ne sont pas des cellules vivantes : ce sont des unités mathématiques élémentaires. Elles reçoivent des valeurs numériques, effectuent un calcul et transmettent un résultat à d’autres unités du réseau.

Lors de l’entraînement, le système analyse une grande quantité d’exemples et ajuste progressivement ses paramètres afin de mieux accomplir une tâche. Dans le cas d’un modèle de langage, l’objectif de base consiste souvent à prédire le mot ou fragment de mot le plus probable à la suite d’une séquence. Répété à très grande échelle, ce mécanisme permet au modèle d’acquérir des régularités de syntaxe, de style, de vocabulaire et, dans une certaine mesure, de raisonnement.

La difficulté tient au fait que les connaissances ou les motifs appris ne sont pas rangés dans des cases clairement étiquetées. Ils peuvent être distribués entre un grand nombre de paramètres et de couches de calcul. Un même neurone artificiel peut contribuer à plusieurs fonctions, tandis qu’une notion apparemment simple peut être représentée par l’activité combinée de nombreuses unités.

Ikram Chraibi Kaadoud, chercheuse à l’Institut national de recherche en informatique et en automatique, l’Inria, souligne l’intérêt de ces machines comme objets d’étude : elles permettent d’expérimenter directement sur des systèmes de calcul, sans exiger le consentement qu’impliquerait l’étude d’un cerveau humain. Cette liberté expérimentale ne dispense toutefois pas de questions éthiques sur les données utilisées pour entraîner les modèles, ni sur les usages qui en sont faits.

Pourquoi des systèmes lisibles restent-ils si opaques ?

Thomas Fel, chercheur à l’université de Harvard, met en avant un paradoxe important. Les éléments numériques qui composent une IA peuvent être lisibles : les poids du réseau sont des nombres, et les opérations sont définies par le programme. En théorie, il est donc possible de les inspecter.

Mais lire n’est pas comprendre. Un fichier contenant une immense liste de valeurs ne fournit pas spontanément une explication utile. Il faudrait pouvoir relier des motifs d’activité internes à des concepts compréhensibles, puis démontrer que ces motifs jouent réellement un rôle causal dans la réponse. Autrement dit, constater qu’un neurone s’active lorsqu’un modèle parle de musique ne prouve pas qu’il est « le neurone de la musique », ni que sa modification changera de façon prévisible le comportement du système.

Cette différence est essentielle. Une explication peut être techniquement exacte mais inutilisable pour une personne, ou au contraire très convaincante en apparence sans décrire le mécanisme réel. L’interprétabilité cherche précisément à réduire cet écart entre les données brutes du modèle et une compréhension vérifiable de son comportement.

Lire un modèle ne suffit pas à l’expliquer

Transparence technique

  • Les paramètres et les opérations peuvent être représentés par des données numériques.
  • L’architecture générale d’un réseau peut être décrite et inspectée.
  • Des activations internes peuvent être mesurées pendant l’exécution.
  • Cette visibilité offre des points de départ pour l’analyse scientifique.

Compréhension réelle

  • Il faut relier les calculs internes à un comportement précis et vérifiable.
  • Les représentations sont souvent distribuées entre de nombreuses unités.
  • Une explication doit démontrer un rôle causal, pas seulement une corrélation.
  • Le résultat doit aider à détecter, corriger ou prévenir une défaillance.

Les méthodes utilisées pour ouvrir la boîte noire

Les travaux consacrés à l’interprétabilité regroupent plusieurs approches. Certaines observent le modèle de l’extérieur, en faisant varier la consigne ou les données fournies pour mesurer l’évolution de la réponse. D’autres examinent ce qui se passe à l’intérieur du réseau, couche après couche, afin d’identifier les activations associées à certains mots, objets, règles ou comportements.

Parmi les approches les plus courantes figurent notamment :

  • les méthodes d’explication locale, qui cherchent à indiquer quels éléments ont le plus pesé dans une prédiction donnée ;
  • l’analyse des activations, qui observe quelles unités du réseau réagissent à certains signaux ;
  • les interventions internes, qui consistent à modifier ou neutraliser certains éléments pour tester leur effet causal ;
  • les tests comportementaux, qui confrontent un modèle à des consignes conçues pour révéler une faiblesse, un biais ou une incohérence.

Des outils tels que LIME et SHAP sont fréquemment employés pour fournir des explications sur des modèles complexes. Ils peuvent aider à estimer l’influence de certaines caractéristiques dans une décision. Leur apport est précieux, mais ils ne transforment pas automatiquement une IA en système pleinement explicable. Ils produisent souvent une approximation utile autour d’un cas précis, pas une carte exhaustive de tout le raisonnement interne.

Une autre voie de recherche consiste à décomposer les réseaux en circuits ou en ensembles de caractéristiques interprétables. L’ambition est de retrouver des mécanismes internes qui seraient suffisamment stables pour être étudiés, vérifiés et, si nécessaire, corrigés. Cette démarche est exigeante : plus le système est grand et généraliste, plus le nombre d’interactions à examiner augmente.

Peut-on savoir si une IA ment ou manipule ?

La question de la véracité des réponses revient avec insistance depuis l’essor des IA génératives. Un modèle peut produire une affirmation fausse avec aplomb, inventer une référence ou donner une explication erronée. Ces phénomènes sont souvent appelés « hallucinations », même s’ils ne supposent pas que la machine perçoive quoi que ce soit.

Il faut distinguer une erreur, une information inexacte et un mensonge. Chez un humain, mentir suppose généralement une intention de tromper. Pour une IA, établir une intention est beaucoup plus délicat. Les chercheurs cherchent donc plutôt à détecter des comportements opérationnels : une réponse contradictoire, une justification qui ne correspond pas aux calculs effectués, une tentative de contourner une consigne ou une stratégie qui maximise une récompense sans respecter l’objectif réel.

Des méthodes sont en cours d’élaboration pour évaluer les explications formulées par les systèmes et vérifier leur cohérence avec leurs mécanismes internes ou avec des faits contrôlables. Il ne suffit pas de demander à une IA « pourquoi » elle a répondu ainsi. La réponse obtenue peut être plausible, mais générée après coup, sans refléter fidèlement le processus qui a abouti au résultat.

L’horticulture, une image pour penser l’imprévisibilité

Dario Amodei, cofondateur de l’éditeur d’IA Anthropic, compare la conception des IA à l’horticulture. Le parallèle décrit une réalité de l’apprentissage automatique : les équipes choisissent une architecture, des données, un objectif d’entraînement et des conditions de calcul, comme un horticulteur choisirait une espèce et son environnement de croissance. Elles peuvent orienter le résultat, sans être en mesure de prévoir chaque propriété qui émergera.

L’analogie ne signifie pas que les modèles se développent seuls. Ils sont construits, entraînés et déployés par des organisations humaines. Elle rappelle plutôt qu’une grande partie de leur comportement résulte d’interactions complexes qui ne sont pas intégralement programmées ligne par ligne.

Cette imprévisibilité explique l’importance des phases d’évaluation. Avant de confier un modèle à des utilisateurs, les concepteurs doivent l’éprouver sur des tâches variées, rechercher ses défaillances et définir des garde-fous. L’interprétabilité peut compléter ces essais : au lieu de seulement constater qu’un modèle échoue, elle vise à comprendre où et comment le mécanisme interne a contribué à l’échec.

Une question scientifique devenue un enjeu collectif

La recherche sur les boîtes noires ne concerne plus uniquement les laboratoires. Les démonstrations publiques, y compris des tournois de football de robots intelligents organisés en Chine, rendent les progrès de l’IA plus visibles tout en suscitant des interrogations sur les usages, la sécurité et la perception de ces systèmes. Les investissements industriels, notamment ceux d’acteurs comme Amazon, contribuent aussi à accélérer l’intégration de l’IA dans de nombreux secteurs.

Face à cette diffusion, la transparence ne peut pas reposer sur une seule promesse technique. Elle suppose une combinaison de pratiques : documentation des modèles, évaluation indépendante, contrôle humain adapté aux risques, protection des données et information claire des personnes concernées. Tous les systèmes n’exigent pas le même niveau d’explication. Un outil d’aide à la rédaction et un système susceptible d’influencer une décision médicale ne présentent pas les mêmes conséquences en cas d’erreur.

La compréhension des modèles est aussi une question de pouvoir. Quand seuls quelques spécialistes peuvent analyser un système très influent, les utilisateurs, les institutions et les personnes affectées disposent de peu de moyens pour contester ses résultats. Développer des méthodes d’analyse robustes peut donc contribuer à une IA plus contrôlable, sans faire croire qu’une explication simple existera pour chaque décision.

Ce qu’il faut surveiller

La recherche devra d’abord montrer si les méthodes d’interprétabilité passent à l’échelle des modèles les plus puissants. Obtenir une explication ponctuelle sur une tâche limitée est utile, mais il est plus difficile de cartographier de façon fiable un système généraliste dans toute sa diversité de comportements.

Il faudra également distinguer les explications qui rassurent de celles qui permettent réellement d’agir. Une bonne méthode doit aider à repérer un risque avant qu’il ne se manifeste, à comprendre une défaillance après coup et, idéalement, à corriger le système sans créer de nouveaux problèmes.

Enfin, la transparence ne doit pas être confondue avec la divulgation brute de données techniques. Rendre accessibles des milliards de paramètres ne suffit pas à éclairer le public ou les décideurs. Le défi est de produire des preuves compréhensibles, vérifiables et adaptées aux usages. C’est à cette condition que les boîtes noires de l’IA pourront devenir moins opaques, et que la confiance accordée à ces outils reposera sur davantage que leurs seules performances visibles.

Questions fréquentes

Qu’est-ce qu’une IA en boîte noire ?

Une IA dite « boîte noire » est un système dont on peut observer les données reçues et les résultats produits, sans pouvoir expliquer clairement le chemin de calcul qui relie les deux. L’expression s’applique particulièrement aux grands réseaux neuronaux, où d’innombrables paramètres interagissent et rendent chaque décision difficile à retracer.

Pourquoi les réseaux neuronaux sont-ils difficiles à comprendre ?

Les neurones artificiels effectuent chacun des calculs relativement simples, mais ils sont très nombreux et fonctionnent en réseau. Une information peut être répartie entre plusieurs couches et paramètres. Cette organisation permet de repérer des régularités complexes, mais elle empêche souvent d’associer une unité précise à une idée ou à une décision donnée.

Une IA peut-elle vraiment mentir ?

Une IA peut fournir une information fausse, contradictoire ou trompeuse, mais cela ne prouve pas nécessairement une intention de mentir au sens humain. Les chercheurs cherchent surtout à repérer des comportements problématiques, comme des justifications inventées ou des stratégies qui contournent une consigne, puis à vérifier si les explications du modèle reflètent réellement ses calculs.

À quoi servent LIME et SHAP en intelligence artificielle ?

LIME et SHAP sont des méthodes utilisées pour estimer quels éléments ont le plus influencé une prédiction d’un modèle. Elles peuvent éclairer une décision ponctuelle, par exemple en indiquant les caractéristiques associées à un résultat. Elles restent toutefois des outils d’explication partielle et ne donnent pas automatiquement accès à tout le fonctionnement interne d’une IA complexe.

Pourquoi l’explicabilité de l’IA est-elle importante ?

L’explicabilité aide à évaluer la fiabilité d’un système, à détecter des biais et à enquêter lorsqu’une décision paraît erronée. Elle est particulièrement importante dans les domaines où une erreur peut avoir des conséquences fortes, comme la santé, la justice ou l’emploi. Elle ne remplace ni les tests ni le contrôle humain, mais elle peut les rendre plus efficaces.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. Anthropic, recherches sur l’interprétabilité des modèles d’IAwww.anthropic.com
  2. Inria, Institut national de recherche en sciences et technologies du numériquewww.inria.fr
  3. National Institute of Standards and Technology, AI Risk Management Frameworkwww.nist.gov/itl/ai-risk-management-framework
  4. Harvard University, informations institutionnelles sur la recherchewww.harvard.edu