Recherche et science

Au MIT, l’IA aide à ouvrir la boîte noire des modèles de protéines

Les modèles linguistiques protéiques peuvent prédire des propriétés essentielles des protéines, mais leurs mécanismes internes restent difficiles à lire. Des chercheurs du MIT utilisent un autoencodeur sparse et l’assistant Claude pour identifier les informations encodées, une étape utile pour mieux choisir ces outils en biologie.

Visualisation d’une chaîne protéique reliée à des nœuds de réseau neuronal analysés en laboratoire
Illustration : Actu.ai

Une séquence de protéines peut désormais être traitée par une intelligence artificielle un peu comme une phrase est traitée par un grand modèle de langage. Ces systèmes repèrent des régularités dans de très grandes collections de séquences et peuvent prédire des éléments liés à la structure ou à la fonction des protéines. Leur efficacité est prometteuse pour la biologie, mais elle laisse une question décisive : qu’ont-ils réellement appris ? En août 2025, des chercheurs du MIT présentent une méthode pour mieux lire les mécanismes internes de ces modèles et réduire l’opacité de leurs résultats.

Les protéines comme langage, sans les confondre avec des mots

Les protéines sont de longues chaînes d’acides aminés. Leur séquence contribue à déterminer la manière dont elles se replient dans l’espace, les molécules auxquelles elles peuvent se lier et la fonction qu’elles remplissent dans un organisme. Elles participent ainsi à une multitude de phénomènes biologiques, des réactions métaboliques au transport de molécules à travers une membrane.

Les modèles linguistiques protéiques utilisent cette séquence comme donnée d’entrée. Chaque acide aminé est représenté par un symbole, à la manière dont un modèle linguistique traite les éléments d’une phrase. En analysant de nombreuses séquences, le système apprend des associations statistiques entre certains motifs et des propriétés biologiques. Il peut alors produire des prédictions sur des protéines qu’il n’avait pas rencontrées auparavant.

L’analogie avec le langage a toutefois ses limites. Une protéine n’est pas un texte et le modèle ne remplace ni un biologiste ni une expérience. Il s’agit d’un outil de calcul qui extrait des régularités à partir de données. Ses prédictions peuvent aider les équipes scientifiques à prioriser des pistes, par exemple pour identifier des cibles médicamenteuses ou contribuer à la conception d’anticorps thérapeutiques. Elles ne constituent pas, à elles seules, une démonstration de l’efficacité d’un médicament ou d’un traitement.

C’est précisément parce que ces modèles peuvent influencer le choix des pistes étudiées que comprendre leurs raisonnements apparents devient important. Un résultat précis peut être utile, mais il est encore plus utile de savoir à quelles caractéristiques de la protéine le modèle semble sensible.

Pourquoi la boîte noire pose problème

Dans un réseau de neurones, une protéine n’est pas conservée sous la forme d’une simple liste d’acides aminés. À chaque étape de traitement, le modèle produit des représentations numériques internes. Ces représentations regroupent une grande quantité d’informations dans des ensembles de valeurs, parfois appelés vecteurs ou activations.

Cette compression est efficace pour faire des prédictions. En revanche, elle rend l’interprétation difficile. Une même composante numérique peut refléter plusieurs propriétés à la fois. Inversement, une propriété biologique donnée peut être dispersée dans de nombreux nœuds du réseau. Les chercheurs peuvent donc observer une prédiction, mais ne pas parvenir facilement à déterminer si elle repose sur une famille de protéines, une fonction moléculaire, un motif de séquence ou une corrélation moins pertinente.

Cette difficulté est souvent décrite comme le problème de la « boîte noire ». Elle ne signifie pas que le fonctionnement mathématique du modèle serait secret. Les calculs sont bien exécutés par le réseau. Le problème est que les représentations internes sont trop denses et trop complexes pour être directement traduites en concepts biologiques compréhensibles.

Bonnie Berger, professeure au MIT, souligne que ces travaux dépassent le seul cas des protéines. Ils concernent plus largement l’explicabilité des tâches réalisées à partir de représentations internes produites par des modèles d’intelligence artificielle.

ÉtapeCe que fait le modèleCe qui est difficile à interpréter
Séquence en entréeIl traite une succession d’acides aminés.Les motifs réellement jugés importants ne sont pas immédiatement visibles.
Représentation interneIl encode la protéine dans de nombreux nœuds du réseau.Les informations biologiques sont souvent mêlées dans des codages denses.
PrédictionIl estime une structure, une fonction ou une autre propriété.Une prédiction ne révèle pas automatiquement les caractéristiques qui l’ont motivée.
Analyse proposée par le MITElle rend certaines composantes plus séparables et plus lisibles.L’interprétation doit encore être confrontée aux connaissances biologiques.

L’autoencodeur sparse pour séparer les informations

L’approche étudiée par l’équipe du MIT s’appuie sur un algorithme appelé autoencodeur sparse. Le terme anglais sparse renvoie ici à l’idée de parcimonie : plutôt que d’activer fortement un grand nombre de composantes en même temps, la méthode cherche à faire apparaître une représentation où un nombre limité de nœuds est mobilisé pour une information donnée.

L’idée centrale est de modifier la manière dont les représentations d’une protéine sont lues après leur production par le modèle linguistique protéique. Au lieu de s’en tenir à un nombre contraint de neurones dont les signaux peuvent être très mélangés, l’autoencodeur étend la représentation vers un plus grand nombre de nœuds. Cette représentation plus large est aussi plus clairsemée : chaque nœud a davantage de chances de correspondre à une caractéristique identifiable.

Il ne s’agit pas de simplifier artificiellement la biologie. Les protéines restent des objets extrêmement complexes, dont une même propriété peut dépendre de nombreux éléments. La méthode vise plutôt à obtenir une sorte de carte plus lisible des informations que le modèle a encodées. Là où un codage dense forme un bloc difficile à démêler, une représentation sparse peut isoler des signaux associés à des propriétés plus précises.

Dans les travaux rapportés, cette contrainte de parcimonie a permis aux chercheurs d’isoler des caractéristiques de protéines à partir des nœuds du réseau. Selon Gujral, l’un des principaux chercheurs, c’est cette incitation à produire une représentation sparse qui a contribué à faire émerger une interprétabilité accrue.

Claude mobilisé pour annoter les représentations

Obtenir des nœuds plus distincts ne suffit pas : encore faut-il comprendre ce qu’ils représentent. L’équipe a donc utilisé Claude, un assistant d’IA, afin de comparer les représentations issues de la méthode avec des caractéristiques déjà connues des protéines. Il peut s’agir, par exemple, de leur fonction moléculaire ou de leur appartenance à une famille de protéines.

Ce travail de rapprochement permet d’associer certains nœuds à des descriptions biologiques plutôt que de les laisser sous la forme de simples valeurs numériques. Les résultats indiquent que les caractéristiques les plus fréquemment encodées concernent les familles de protéines et certaines de leurs fonctions, notamment en lien avec divers processus métaboliques.

Cette utilisation de Claude ne signifie pas que l’assistant décide seul de la signification biologique d’un signal. Son rôle, dans cette démarche, est d’aider à analyser et à comparer les représentations avec des caractéristiques établies. L’intérêt est de rendre l’examen d’un très grand nombre de nœuds plus praticable pour les scientifiques, qui peuvent ensuite évaluer la pertinence des associations identifiées.

L’enjeu est particulièrement important pour les modèles de protéines, car une sortie correcte peut parfois masquer un raisonnement interne difficile à justifier. Si un modèle semble reconnaître une famille protéique ou une fonction cohérente, les chercheurs disposent d’un indice plus utile pour vérifier sa robustesse. Si, au contraire, les signaux internes paraissent reposer sur des associations obscures ou peu plausibles, ils peuvent être plus prudents dans l’usage du système.

Mieux choisir un modèle pour une question biologique

Pour les laboratoires, tous les modèles linguistiques protéiques ne sont pas nécessairement équivalents. Deux systèmes peuvent fournir des résultats de qualité sur une même tâche tout en mettant l’accent sur des informations internes différentes. L’un peut mieux distinguer des familles de protéines, tandis qu’un autre peut se révéler plus pertinent pour une fonction particulière.

L’interprétabilité proposée par le MIT pourrait donc compléter les évaluations habituelles. Au lieu de choisir un outil uniquement à partir d’un score de performance, les chercheurs pourraient aussi observer quelles caractéristiques biologiques il encode le plus clairement. Ils pourraient ainsi sélectionner un modèle plus adapté à leur question, ajuster les entrées qu’ils lui fournissent et mieux interpréter les résultats obtenus.

Performance prédictive et interprétabilité : deux critères complémentaires

Évaluer la performance

  • Mesure la capacité du modèle à réussir une tâche définie.
  • Compare les prédictions à des résultats ou annotations de référence.
  • Aide à repérer les systèmes les plus précis dans un contexte donné.
  • Ne dit pas nécessairement quelles informations internes ont motivé la réponse.

Examiner l’interprétabilité

  • Cherche à relier les nœuds du modèle à des caractéristiques biologiques identifiables.
  • Peut révéler l’encodage de familles de protéines ou de fonctions moléculaires.
  • Aide à choisir un outil selon les informations qu’il semble exploiter.
  • Ne dispense pas de validations biologiques et expérimentales indépendantes.

Une telle visibilité peut aussi favoriser la formulation de nouvelles hypothèses. Si une représentation interne fait apparaître un regroupement inattendu de protéines ou une caractéristique fonctionnelle jusqu’alors peu étudiée, elle peut orienter des travaux expérimentaux. Dans ce cas, l’IA ne livre pas une vérité biologique définitive : elle aide à mettre en évidence une piste qui devra être testée.

Des applications possibles, mais aucune thérapie immédiate

Les auteurs évoquent notamment la découverte de médicaments et la conception d’anticorps thérapeutiques. Dans ces domaines, les modèles protéiques peuvent contribuer à identifier des protéines d’intérêt et à mieux comprendre les relations entre une séquence, une structure et une fonction.

Dans la recherche pharmaceutique, une cible médicamenteuse est généralement une molécule, souvent une protéine, sur laquelle on espère agir pour modifier un mécanisme biologique. Repérer une cible plausible est une étape essentielle, mais elle n’est qu’un début. Il faut ensuite vérifier son rôle dans la maladie concernée, évaluer les interactions avec des molécules candidates, puis mener les études nécessaires avant toute utilisation chez l’être humain.

La conception d’anticorps thérapeutiques suit la même logique de prudence. Des prédictions sur les protéines peuvent aider à explorer des interactions ou à mieux classer des candidats, mais elles ne remplacent ni les validations en laboratoire ni les exigences de sécurité associées au développement biomédical.

La recherche décrite est soutenue par les Instituts nationaux de la santé. Son apport le plus immédiat n’est pas l’annonce d’un nouveau traitement, mais l’amélioration d’un outil de compréhension. Savoir ce qu’un modèle encode peut rendre son emploi plus rationnel dans des programmes de recherche où chaque hypothèse expérimentale demande du temps et des ressources.

Les limites de l’interprétabilité restent importantes

Rendre les nœuds d’un réseau plus faciles à lire ne résout pas toutes les questions. Une caractéristique identifiée peut être corrélée à une fonction sans en être la cause. Une famille de protéines, par exemple, peut partager plusieurs propriétés, et le modèle peut avoir appris un signal indirect plutôt que le mécanisme biologique recherché.

Il faut également éviter de considérer un nœud comme l’équivalent exact d’un concept biologique. Les représentations neuronales sont des constructions mathématiques. Même lorsqu’elles semblent correspondre à une fonction connue, cette correspondance doit être évaluée avec des jeux de données, des annotations biologiques et, lorsque c’est possible, des expériences indépendantes.

L’intervention d’un assistant d’IA dans l’analyse impose la même exigence. Claude peut accélérer la comparaison entre des composantes du réseau et des descriptions de protéines, mais les associations proposées doivent rester vérifiables par les chercheurs. Dans un domaine aussi sensible que la biologie médicale, la traçabilité des interprétations compte autant que la rapidité de leur production.

Enfin, une méthode qui fonctionne bien sur certains modèles ou certaines tâches devra être éprouvée sur d’autres architectures et d’autres jeux de données. L’objectif scientifique n’est pas seulement d’obtenir une explication séduisante, mais de déterminer si cette explication demeure utile, stable et biologiquement pertinente dans des situations variées.

Ce qu’il faut surveiller

Les modèles linguistiques protéiques devraient devenir plus puissants à mesure que les données biologiques et les méthodes d’apprentissage progressent. Leur potentiel ne dépendra pas seulement de leur capacité à prédire correctement une structure ou une fonction. Il dépendra aussi de la possibilité de comprendre pourquoi ils produisent telle ou telle réponse, d’identifier leurs limites et de les utiliser au bon endroit dans la chaîne de recherche.

Les travaux du MIT mettent en avant une direction concrète : passer de représentations internes difficiles à exploiter à des signaux davantage reliés à des notions biologiques connues. À terme, cette démarche pourrait aider les scientifiques à apprendre de nouveaux éléments sur les protéines, y compris des connaissances que les modèles seraient capables de faire émerger avant qu’elles ne soient pleinement caractérisées.

La question décisive sera alors de distinguer deux choses : une régularité statistique intéressante et une découverte biologique confirmée. C’est dans le dialogue entre modèles d’IA, expertise des biologistes et validation expérimentale que ces outils pourront apporter leur contribution la plus solide aux biotechnologies et à la recherche médicale.

Questions fréquentes

Qu’est-ce qu’un modèle linguistique protéique ?

C’est un modèle d’IA qui traite une séquence d’acides aminés comme une suite de symboles. En repérant des régularités dans de nombreuses séquences, il peut produire des prédictions sur des propriétés de protéines, notamment leur structure ou leur fonction. Il s’agit d’un outil d’aide à la recherche, et non d’une preuve biologique à lui seul.

Pourquoi les modèles de protéines sont-ils considérés comme des boîtes noires ?

Leurs calculs internes reposent sur de très nombreuses représentations numériques. Ces représentations peuvent mélanger plusieurs caractéristiques biologiques dans les mêmes nœuds du réseau neuronal. Une prédiction peut donc être correcte sans que les chercheurs sachent facilement si le modèle s’est appuyé sur une famille protéique, une fonction ou un autre signal.

À quoi sert un autoencodeur sparse en biologie ?

Un autoencodeur sparse cherche à produire une représentation plus parcimonieuse des informations internes d’un modèle. Dans l’approche du MIT, il étend la représentation vers davantage de nœuds tout en limitant ceux qui sont actifs pour une caractéristique. Cela peut aider à isoler des signaux plus faciles à rapprocher de propriétés connues des protéines.

Quel rôle Claude joue-t-il dans cette recherche du MIT ?

Claude a été utilisé pour analyser les représentations rendues plus lisibles par l’autoencodeur sparse et les comparer à des caractéristiques connues des protéines. Cette étape aide à associer certains nœuds du réseau à des familles protéiques ou à des fonctions moléculaires. Ces interprétations doivent ensuite être évaluées avec rigueur par les chercheurs.

Cette méthode peut-elle accélérer la découverte de médicaments ?

Elle pourrait aider les équipes à sélectionner un modèle mieux adapté à une question biologique, à identifier des protéines d’intérêt ou à générer des hypothèses plus ciblées. Mais elle ne permet pas de développer directement un médicament. Toute piste doit être validée par des expériences, puis par les étapes de développement et de sécurité propres à la recherche biomédicale.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. MIT News, actualités et recherches de l’Institut de technologie du Massachusettsnews.mit.edu
  2. MIT, site institutionnelwww.mit.edu
  3. National Institutes of Health, organisme américain de recherche en santéwww.nih.gov
  4. Anthropic, présentation de Claudewww.anthropic.com/claude