Recherche et science

Une règle pliable aide à comprendre l’apprentissage des réseaux neuronaux

Une équipe de l’Université de Bâle propose une analogie étonnante pour étudier l’apprentissage profond : une règle pliable dont chaque segment représente une couche neuronale. Ses mouvements permettent de visualiser pourquoi les données ne sont pas toujours transformées de façon égale à chaque étape d’un réseau d’IA.

Une règle pliable dont les segments se déploient de façon inégale, symbole des couches d’un réseau neuronal.
Illustration : Actu.ai

Une règle pliable peut sembler bien loin de ChatGPT ou de la reconnaissance d’images. Pourtant, ce simple objet mécanique offre une manière concrète de visualiser un problème central de l’intelligence artificielle : la façon dont l’apprentissage se répartit, ou non, entre les nombreuses couches d’un réseau neuronal profond. Des chercheurs de l’Université de Bâle, menés par le professeur Ivan Dokmanić, ont développé cette analogie pour mieux étudier des dynamiques qui demeurent difficiles à lire directement dans les modèles d’IA.

Leur travail, publié dans la revue scientifique Physical Review Letters, ne prétend pas réduire un réseau neuronal à un objet que l’on pourrait manipuler à la main. Il propose plutôt un modèle physique simplifié, capable de reproduire certaines de ses propriétés essentielles. L’intérêt est considérable : lorsqu’un réseau apprend, ses milliards ou millions de paramètres évoluent selon des mécanismes mathématiques difficiles à interpréter. Observer une règle qui se déploie permet, lui, de rendre visibles des phénomènes abstraits, comme la contribution inégale de certaines couches ou l’effet contre-intuitif du bruit.

Pourquoi les réseaux neuronaux sont organisés en couches

Les réseaux neuronaux profonds sont à la base de nombreuses applications d’IA. Ils servent notamment à reconnaître des objets dans une image, traiter la parole ou produire du texte. Les grands modèles de langage tels que ChatGPT reposent eux aussi sur des architectures composées de couches successives, même si leur fonctionnement précis diffère d’un système de vision artificielle.

Chaque couche reçoit une représentation des données, la transforme, puis transmet le résultat à la suivante. Pour une tâche de classification d’images, on peut imaginer qu’un réseau doit apprendre à distinguer des photographies de chats et de chiens. Les premières transformations peuvent isoler des motifs simples, tandis que les suivantes combinent progressivement ces indices afin de mieux séparer les deux catégories.

L’apprentissage consiste à ajuster les paramètres des neurones artificiels à partir d’exemples. Le réseau produit une réponse, mesure son écart avec la réponse attendue, puis modifie ses paramètres afin de réduire cet écart. Répété sur de très nombreux exemples, ce processus permet au modèle d’exécuter la tâche pour laquelle il a été entraîné.

Mais une question importante subsiste : toutes les couches participent-elles de manière comparable à la séparation des données ? Dans un réseau idéalement équilibré, chacune contribuerait à rendre les catégories un peu plus distinctes. En pratique, cette répartition peut se révéler très inégale. À certains moments, les couches les plus proches de l’entrée, dites superficielles, prennent une place prépondérante. Dans d’autres cas, les couches plus profondes effectuent l’essentiel de la transformation.

Cette différence n’est pas anodine. Elle dépend notamment de l’architecture du réseau et de la nature des calculs effectués par ses neurones. Comprendre ce partage du travail pourrait aider les chercheurs à concevoir des systèmes dont l’entraînement est plus maîtrisé.

Non-linéarité : la propriété qui rend l’IA plus expressive

Un élément joue un rôle déterminant dans cette histoire : la non-linéarité. Sans elle, multiplier les couches ne suffirait pas à donner au réseau une capacité d’analyse beaucoup plus riche. Une succession de transformations strictement linéaires reste, dans son ensemble, une transformation linéaire. Elle serait trop limitée pour distinguer des relations complexes dans des images, des sons ou du langage.

Les fonctions non linéaires, insérées entre les couches, permettent au réseau de construire des frontières de décision beaucoup plus sophistiquées. Elles aident notamment à séparer des données qui se chevauchent ou qui ne peuvent pas être distinguées par une simple ligne, ou un simple plan, dans une représentation mathématique.

L’équipe d’Ivan Dokmanić s’intéresse à la façon dont cette non-linéarité influence la distribution de l’apprentissage entre les couches. Selon les résultats présentés, il ne suffit pas de regarder les performances finales d’un modèle. Il faut aussi observer comment les différentes étapes internes ont contribué à organiser les données.

Élément du réseau neuronalRôle pendant l’apprentissageÉquivalent dans le modèle mécanique
Couches successivesTransforment progressivement les donnéesSections successives de la règle pliable
Non-linéaritéPermet des transformations complexes et influence la répartition du travailFrottement entre les sections
Bruit d’entraînementIntroduit de l’aléa dans le processus d’apprentissageMouvement léger associé à la traction
Séparation des donnéesDistingue de mieux en mieux deux catégories, comme chats et chiensDéploiement plus ou moins réparti des sections

Pourquoi le bruit peut améliorer un modèle

L’idée qu’un peu d’aléa puisse aider une machine à apprendre paraît paradoxale. Pourtant, le bruit est fréquemment intégré à l’entraînement des réseaux neuronaux. L’exemple évoqué par les chercheurs consiste à ignorer, à chaque cycle d’entraînement, un sous-ensemble choisi aléatoirement de neurones, indépendamment de leur contribution à l’entrée. Cette forme d’aléa peut améliorer la performance globale du réseau.

L’intérêt de ce procédé est qu’il évite, dans certains cas, qu’un modèle s’appuie trop fortement sur une partie précise de son architecture. Il l’incite à apprendre des représentations plus robustes, au lieu de mémoriser trop étroitement les exemples vus durant l’entraînement. On parle souvent, dans ce contexte, de capacité à généraliser : un modèle généralise bien lorsqu’il reste efficace face à de nouvelles données qui ne figuraient pas exactement dans son jeu d’entraînement.

Toute la difficulté est que le bruit n’agit pas isolément. Son effet dépend de la non-linéarité du réseau, de sa structure et de ses paramètres. Une même dose d’aléa ne produit donc pas nécessairement le même résultat d’une architecture à l’autre. Ivan Dokmanić souligne précisément cette interaction complexe entre bruit et non-linéarité, qui reste difficile à appréhender avec les seuls outils habituels d’analyse des réseaux profonds.

Une règle pliable comme laboratoire de l’apprentissage

C’est là qu’intervient le modèle mécanique imaginé à Bâle. Les chercheurs ont conçu des systèmes macroscopiques inspirés des théories de la mécanique. Dans l’un d’eux, une règle pliable est divisée en sections : chacune correspond, par analogie, à une couche d’un réseau neuronal. Lorsqu’on tire la règle par une extrémité, les frottements mécaniques entre les sections jouent le rôle de la non-linéarité.

Cette représentation ne reproduit pas chaque opération numérique d’un réseau, ni chaque détail de l’optimisation de ses paramètres. Elle vise à faire apparaître un comportement collectif : selon la manière dont l’objet est sollicité, certaines sections se déploient davantage que d’autres. Cela donne une image intuitive de la manière dont certaines couches peuvent, elles aussi, contribuer davantage à la séparation des données.

Lorsque la règle est tirée lentement et de façon continue, certaines sections se déploient progressivement tandis que d’autres restent presque fermées. Dans l’analogie, cela correspond à un réseau où la séparation des données est principalement réalisée dans les couches superficielles.

À l’inverse, lorsque la règle est tirée rapidement avec un léger mouvement, son déploiement devient plus homogène. Cette fois, le comportement évoque un réseau où la séparation des données est mieux répartie entre les couches. L’objet mécanique met donc en scène deux régimes d’apprentissage, non pas pour fournir une recette immédiate, mais pour aider à comprendre les conditions qui favorisent une organisation plus équilibrée.

Deux façons de tirer la règle, deux répartitions de l’apprentissage

Traction lente et continue

  • Certaines sections se déploient progressivement.
  • D’autres segments restent presque fermés.
  • L’analogie renvoie à une contribution inégale des couches.
  • La séparation des données est surtout portée par les couches superficielles.

Traction rapide avec léger mouvement

  • Le déploiement des sections devient plus homogène.
  • L’effet d’aléa modifie la dynamique mécanique.
  • L’analogie évoque une meilleure répartition entre les couches.
  • La séparation des données est distribuée plus uniformément.

Des ressorts et des simulations pour vérifier l’analogie

L’expérience de la règle n’est pas une simple démonstration visuelle. Les chercheurs de Bâle ont également mené des simulations ainsi que des analyses mathématiques de modèles composés de blocs reliés par des ressorts. Ces systèmes permettent d’étudier de façon contrôlée les mécanismes de déploiement et de redistribution entre éléments interconnectés.

Les résultats obtenus présentent une forte concordance avec les comportements observés dans de véritables réseaux neuronaux. C’est le point le plus important de la démarche : un objet physique très simplifié peut reproduire des dynamiques pertinentes d’un système informatique beaucoup plus complexe.

Cette correspondance permet de formuler des hypothèses plus lisibles. Plutôt que de tester de très nombreuses combinaisons de paramètres de manière empirique, les chercheurs pourraient s’appuyer sur les enseignements du modèle mécanique pour anticiper certains effets. Dans un domaine où entraîner les plus grands réseaux demande des moyens de calcul considérables, mieux comprendre les paramètres avant de lancer une expérience complète est un avantage potentiel.

Que pourrait apporter cette approche aux modèles de langage ?

Les travaux de l’équipe ouvrent une piste pour l’étude des grands modèles de langage. Ces systèmes traitent le texte au travers de nombreuses couches successives et reposent sur un très grand nombre de paramètres. Identifier pourquoi certaines couches jouent un rôle plus marqué que d’autres, ou comment les réglages d’entraînement modifient cette répartition, représente un sujet de recherche important.

Il serait prématuré d’affirmer qu’une règle pliable permettra directement d’améliorer les assistants conversationnels. La recherche présentée décrit une voie d’approfondissement, pas une solution prête à être déployée. Elle suggère toutefois que des concepts empruntés à la physique peuvent éclairer le comportement de modèles de plus en plus vastes.

L’objectif, à terme, serait de mieux déterminer les valeurs pertinentes de paramètres tels que le niveau de bruit ou les propriétés liées à la non-linéarité. Une telle compréhension pourrait réduire la part d’essais et d’erreurs dans la mise au point des réseaux performants. Elle pourrait aussi aider à expliquer pourquoi deux modèles apparemment proches n’apprennent pas de la même manière.

Ce qu’il faut surveiller

Cette recherche rappelle que les progrès de l’IA ne passent pas uniquement par des modèles plus grands ou davantage de données. Ils reposent aussi sur une compréhension plus fine de ce qui se produit à l’intérieur des architectures existantes. Savoir comment les couches se répartissent la transformation des données est essentiel pour rendre les réseaux plus efficaces, mais aussi plus interprétables.

La prochaine étape consistera à déterminer dans quelles conditions les intuitions tirées de ces modèles mécaniques se vérifient sur des architectures de grande taille. Les chercheurs devront notamment évaluer leur portée pour les modèles de langage et préciser comment ces résultats peuvent guider le choix de paramètres concrets.

L’image de la règle pliable a au moins une vertu immédiate : elle rend accessible un phénomène habituellement enfoui dans des calculs. En IA comme en physique, une analogie réussie ne remplace pas la démonstration. Mais elle peut révéler où regarder, quelles variables comparer et pourquoi un peu de bruit, loin d’être toujours un défaut, peut parfois contribuer à mieux apprendre.

Questions fréquentes

Comment une règle pliable peut-elle représenter un réseau neuronal ?

Dans le modèle des chercheurs de l’Université de Bâle, chaque section de la règle correspond à une couche d’un réseau neuronal. Les frottements entre les sections représentent les effets de non-linéarité. La façon dont la règle se déploie rend visible une répartition plus ou moins équilibrée de l’apprentissage entre ces couches.

Pourquoi la non-linéarité est-elle indispensable aux réseaux neuronaux ?

La non-linéarité permet à un réseau de traiter des relations complexes dans les données. Sans elle, empiler des couches de calcul ne suffirait pas à dépasser les limites d’une simple transformation linéaire. Elle est donc essentielle pour distinguer des catégories difficiles à séparer, par exemple dans des images ou du texte.

Le bruit améliore-t-il vraiment l’entraînement d’une IA ?

Il peut améliorer les performances dans certaines conditions. Pendant l’entraînement, on peut par exemple ignorer aléatoirement une partie des neurones à chaque cycle. Cet aléa peut rendre le réseau plus robuste et l’aider à mieux généraliser. Son effet dépend toutefois fortement de l’architecture et de la non-linéarité du modèle.

Toutes les couches d’un réseau profond apprennent-elles autant ?

Non. Les travaux évoqués montrent que la séparation des données peut être concentrée dans certaines couches, superficielles ou profondes, selon la construction du réseau et ses paramètres. L’une des ambitions de cette recherche est précisément de comprendre comment favoriser une contribution plus équilibrée des différentes couches.

Cette recherche peut-elle améliorer ChatGPT ou d’autres modèles de langage ?

Elle ouvre une piste de recherche, mais ne constitue pas une amélioration immédiatement applicable. Les grands modèles de langage utilisent eux aussi de nombreuses couches. Le modèle mécanique pourrait aider à étudier comment l’apprentissage se répartit entre elles et à mieux choisir certains paramètres d’entraînement, notamment ceux liés au bruit et à la non-linéarité.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. Université de Bâle, actualités et rechercheswww.unibas.ch/en/News-Events/News.html
  2. Physical Review Letters, revue de l’American Physical Societyjournals.aps.org/prl