Recherche et science

Le sudoku met à l’épreuve la logique et les explications des modèles d’IA

Résoudre une grille de sudoku ne suffit pas à prouver qu’une IA raisonne vraiment. Des chercheurs de l’Université du Colorado à Boulder ont testé des modèles de langage sur près de 2 300 casse-têtes et constaté un écart net entre la capacité à trouver une réponse et celle à l’expliquer de manière fiable.

Grille de sudoku annotée, comparée à des étapes de raisonnement pour évaluer la fiabilité d’une IA.
Illustration : Actu.ai

Un sudoku peut sembler bien éloigné des grands débats sur l’intelligence artificielle. Pourtant, cette grille de chiffres constitue un test particulièrement révélateur : pour la compléter, il ne suffit pas d’avoir déjà vu beaucoup de chiffres. Il faut respecter simultanément un ensemble de contraintes, éliminer des possibilités et, idéalement, pouvoir expliquer chaque déduction. C’est précisément ce que des chercheurs de l’Université du Colorado à Boulder ont voulu examiner avec des modèles de langage.

Publiée dans les Findings of the Association for Computational Linguistics, leur étude ne cherche pas à sacrer une IA championne de sudoku. Elle interroge une question plus importante pour les utilisateurs de ChatGPT et d’outils comparables : lorsqu’un modèle fournit la bonne réponse, a-t-il suivi une démarche logique fiable, ou a-t-il simplement produit une suite de mots et de chiffres plausible ? Les résultats montrent que ces deux choses ne coïncident pas toujours.

Pourquoi le sudoku est un bon test pour l’IA

Le sudoku repose sur une règle simple à énoncer, mais exigeante à appliquer : chaque chiffre doit être placé sans créer de doublon dans les zones prévues par la grille. Une solution correcte peut être vérifiée objectivement. À l’inverse, une seule erreur suffit à invalider l’ensemble.

Cette propriété en fait un terrain d’essai utile pour les modèles de langage de grande taille, souvent désignés par l’acronyme LLM. Ces systèmes sont entraînés sur d’immenses quantités de textes afin de prédire la suite la plus probable d’une séquence. Ils peuvent rédiger, résumer, traduire ou dialoguer avec une grande fluidité. Mais leur aisance verbale ne garantit pas qu’ils appliquent de façon stable des règles formelles.

Dans un sudoku, les chercheurs peuvent donc regarder deux aspects distincts : la grille finale est-elle correcte ? Et l’explication donnée pour parvenir à cette solution correspond-elle réellement aux opérations effectuées ? Cette seconde question est décisive. Une réponse juste, accompagnée d’une justification fausse, ne permet pas à un utilisateur de contrôler le résultat ni de faire confiance au système dans une situation plus sensible.

Près de 2 300 grilles originales pour comparer les modèles

Pour éviter de mesurer seulement la capacité des systèmes à retrouver des exemples déjà présents dans leurs données d’entraînement, l’équipe de Boulder a créé près de 2 300 puzzles originaux. Les grilles, soumises à des règles strictes, ont permis d’évaluer différents outils d’IA, notamment des modèles développés par OpenAI et Google.

L’intérêt d’un tel protocole est de placer les systèmes face à des problèmes dont la solution demande de tenir compte de contraintes précises. Il ne s’agit pas simplement de reconnaître une formulation familière ou de reproduire un texte vu en ligne. L’IA doit conserver les informations pertinentes, les mettre à jour au fil des choix et éviter de contredire une règle déjà établie.

Les chercheurs ne se sont pas limités à la production d’une grille complétée. Ils ont également examiné la qualité des explications : le modèle décrit-il une déduction utilisable ? Les étapes annoncées sont-elles compatibles avec les chiffres présents dans la grille ? Et son discours permet-il à une personne de comprendre ou de vérifier le cheminement ?

Élément évaluéCe que le test permet d’observerPourquoi c’est important
Résolution de la grilleLa capacité à produire une solution respectant les règlesUne erreur locale peut rendre toute la solution invalide
Difficulté des puzzlesLa stabilité des performances lorsque les contraintes se multiplientUn système fiable doit éviter de se dégrader de manière imprévisible
Explication fournieLa cohérence entre le discours du modèle et les étapes logiques annoncéesL’utilisateur doit pouvoir vérifier une décision importante
Réponses aberrantesLes sorties sans rapport avec la consigne demandéeElles révèlent les limites du contrôle du modèle sur sa génération

Des solutions parfois justes, des justifications souvent fragiles

Les performances relevées sont contrastées. Certains modèles parviennent à résoudre des grilles simples et, selon les résultats rapportés par l’étude, peuvent atteindre environ 65 % de réussite sur certains puzzles. Ce niveau montre qu’ils sont capables, dans certains cas, de manipuler correctement des contraintes logiques.

Mais l’étude souligne une faiblesse essentielle : même les modèles les plus performants rencontrent des difficultés lorsqu’il faut expliquer clairement leur solution. Maria Pacheco, co-autrice des travaux, relève que les descriptions produites sont souvent incohérentes ou complètement erronées. Autrement dit, le système peut donner une réponse correcte tout en racontant une procédure qui ne justifie pas cette réponse.

Cette différence est loin d’être anecdotique. Dans un jeu, une explication bancale prête surtout à sourire. Dans des domaines où une décision doit être relue, contestée ou validée, la situation change. Une déclaration fiscale, un calcul administratif, une recommandation scientifique ou une analyse technique ne peuvent pas reposer sur une réponse dont le raisonnement demeure opaque ou faux.

Les chercheurs ont aussi observé des incohérences frappantes. Dans l’une des interactions, un modèle a répondu par un bulletin météorologique au lieu de résoudre le puzzle demandé. Ce type de sortie hors sujet rappelle que la génération de texte n’est pas un processus infailliblement guidé par l’intention de l’utilisateur, même lorsque la question paraît très cadrée.

Résoudre et expliquer : deux compétences différentes

Un piège courant consiste à assimiler une réponse bien formulée à une démonstration. Les LLM excellent à produire un texte qui a les codes du raisonnement humain : connecteurs logiques, étapes numérotées, vocabulaire explicatif. Mais une explication fluide n’est pas nécessairement une preuve.

Dans le cas du sudoku, cette distinction peut être vérifiée ligne par ligne. Si le modèle affirme qu’un chiffre est imposé parce qu’il est absent d’une zone, il doit être possible de contrôler cette affirmation sur la grille. Lorsque l’explication évoque un élément qui n’existe pas, contredit un chiffre déjà placé ou saute sans raison à une conclusion, le discours ne constitue plus une aide fiable.

Trouver la réponse ou démontrer le raisonnement

Résoudre une grille

  • Le modèle produit une série de chiffres compatible avec le puzzle.
  • Certains systèmes atteignent environ 65 % de réussite sur certains casse-têtes.
  • La validité peut être contrôlée en vérifiant les règles de la grille.
  • Une réponse juste peut parfois résulter d’un processus difficile à interpréter.

Expliquer la solution

  • Le modèle doit décrire des déductions compatibles avec la grille.
  • Les explications observées sont souvent incohérentes ou erronées.
  • Un texte fluide peut masquer une justification qui ne prouve rien.
  • Cette capacité est indispensable lorsque l’humain doit auditer une décision.

Cette difficulté vient en partie de la nature des modèles testés. Les systèmes comme ChatGPT sont entraînés à partir de très vastes collections de textes. Ils apprennent des régularités statistiques extrêmement riches et conservent de nombreuses associations utiles. Toutefois, ce mécanisme ne leur donne pas automatiquement un registre de règles explicites qu’ils appliqueraient méthodiquement dans chaque situation.

Le terme de mémorisation mécanique, ou rote memory en anglais, est employé pour décrire cette limite : un système peut restituer des structures rencontrées durant l’entraînement sans disposer d’une compréhension profonde des règles sous-jacentes. Il ne faut pas en conclure qu’un modèle de langage ne peut jamais raisonner. L’étude montre plutôt que son raisonnement apparent peut être instable, difficile à auditer et parfois détaché de la réponse finale.

Ce que l’étude révèle sur la fiabilité des assistants IA

Les assistants conversationnels sont souvent utilisés parce qu’ils rendent une réponse immédiate et lisible. Cette commodité peut faire oublier une différence fondamentale entre une aide à l’exploration et un outil de décision. Pour chercher des idées, reformuler un texte ou obtenir une première piste, une approximation peut être repérée puis corrigée. Pour une tâche où une seule erreur a des conséquences concrètes, les conditions de confiance doivent être plus strictes.

L’étude sur le sudoku apporte un cadre simple pour penser cette question. Un système digne de confiance devrait au minimum :

  • respecter les contraintes qui lui sont données ;
  • produire une réponse vérifiable ;
  • signaler une incertitude plutôt qu’inventer une justification ;
  • rester concentré sur la tâche demandée ;
  • permettre à un humain de contrôler les étapes importantes.

Le sudoku n’est évidemment pas une réplique exacte d’une décision médicale, juridique, fiscale ou scientifique. Dans ces domaines, les informations sont plus ambiguës, les sources parfois contradictoires et les conséquences variables selon le contexte. Mais précisément, si un modèle peine à expliquer son raisonnement sur un problème aux règles fixes, il faut redoubler de prudence lorsqu’il traite des situations moins structurées.

Cette recherche ne dit donc pas que les IA conversationnelles sont inutiles. Elle invite à ne pas les confondre avec des systèmes formels de résolution, conçus pour garantir le respect de règles précises. Elle rappelle aussi la responsabilité de l’utilisateur : vérifier les résultats, ne pas déléguer aveuglément une décision importante et demander des éléments contrôlables plutôt qu’une explication seulement persuasive.

L’IA neurosymbolique, une piste pour relier mémoire et logique

Pour dépasser ces limites, les chercheurs s’intéressent à une approche appelée IA neurosymbolique. Son principe général est d’associer deux familles de méthodes. D’un côté, les réseaux de neurones et les modèles de langage, très efficaces pour apprendre à partir de grandes masses de données et traiter le langage. De l’autre, des mécanismes symboliques, fondés sur des règles, des contraintes et des opérations logiques explicites.

L’ambition est de combiner la souplesse des systèmes statistiques avec la rigueur de méthodes capables de vérifier qu’une conclusion respecte bien les règles établies. Dans un problème comme le sudoku, un composant symbolique pourrait contrôler les contraintes de la grille, tandis qu’un modèle de langage aiderait à formuler des instructions ou à expliquer les étapes à un utilisateur.

Les casse-têtes servent ainsi de microcosme. Ils permettent d’observer, dans un cadre limité et vérifiable, comment la mémoire, l’attention aux contraintes et l’explication interagissent. Pour les chercheurs, l’enjeu n’est pas uniquement d’obtenir davantage de grilles correctement résolues. Il est de comprendre comment concevoir des systèmes qui savent quand ils ont une réponse solide et qui peuvent en rendre compte de façon fidèle.

Ce qu’il faut surveiller dans les prochains travaux

L’équipe envisage d’étendre l’évaluation à d’autres jeux de logique, dont le hitori. Changer de type de puzzle permettra de vérifier si les difficultés relevées proviennent d’une particularité du sudoku ou d’une limite plus générale dans la manière dont les modèles abordent les contraintes formelles.

La suite des recherches devra également préciser quelles méthodes améliorent réellement l’explicabilité. Il ne suffit pas d’entraîner un modèle à produire des explications plus longues ou plus élégantes. Il faut établir que chacune de ses affirmations correspond au processus ayant conduit au résultat, et qu’elle peut être contrôlée de manière indépendante.

Pour le grand public, le message est clair : les capacités impressionnantes des IA génératives ne doivent pas être évaluées à leur seule éloquence. La bonne question n’est pas seulement « l’outil a-t-il trouvé une réponse ? », mais aussi « cette réponse respecte-t-elle les règles, peut-elle être vérifiée et l’explication fournie est-elle réellement cohérente ? ». Le sudoku, avec ses chiffres modestes et ses règles implacables, offre une réponse concrète à ce défi majeur de l’intelligence artificielle.

Questions fréquentes

Pourquoi utiliser le sudoku pour tester une intelligence artificielle ?

Le sudoku est utile parce que ses règles sont précises et qu’une solution peut être vérifiée objectivement. Il oblige un système à respecter plusieurs contraintes en même temps. Les chercheurs peuvent ainsi mesurer non seulement si l’IA trouve la bonne grille, mais aussi si les étapes de raisonnement qu’elle fournit correspondent réellement à la solution.

Quel score les modèles d’IA ont-ils obtenu aux sudokus ?

Selon les résultats rapportés par l’étude, certains modèles ont réussi environ 65 % des casse-têtes. Ce résultat varie selon les grilles et ne signifie pas que les systèmes sont fiables dans toutes les situations. Surtout, la capacité à résoudre un puzzle ne s’est pas accompagnée systématiquement d’explications logiques cohérentes et vérifiables.

Pourquoi une IA peut-elle donner la bonne réponse avec une mauvaise explication ?

Les modèles de langage génèrent du texte en s’appuyant sur des régularités apprises dans de vastes corpus. Ils peuvent donc produire une solution correcte, puis une explication qui paraît plausible sans refléter le cheminement ayant mené à cette solution. L’étude a relevé des justifications incohérentes ou erronées, y compris chez des modèles performants.

Qu’est-ce que l’IA neurosymbolique ?

L’IA neurosymbolique cherche à combiner l’apprentissage statistique des réseaux de neurones avec des règles explicites et des mécanismes logiques. L’objectif est de conserver la capacité des modèles à traiter le langage et de renforcer leur aptitude à respecter, vérifier et expliquer des contraintes. Les puzzles logiques constituent un terrain utile pour évaluer cette approche.

Cette étude signifie-t-elle qu’il ne faut pas utiliser ChatGPT ou les autres IA ?

Non. Elle rappelle plutôt qu’il faut adapter son niveau de confiance au type de tâche. Les assistants IA peuvent aider à explorer, rédiger ou obtenir une première réponse. En revanche, pour une décision fiscale, scientifique, technique ou administrative, un résultat doit être vérifié avec des sources et des méthodes appropriées, même si l’explication semble convaincante.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. Association for Computational Linguistics, publications Findings of ACLaclanthology.org
  2. Université du Colorado à Boulder, recherche et actualitéswww.colorado.edu/research
  3. Université du Colorado Boulder, département d’informatiquewww.colorado.edu/cs