Modèles et LLM

Classement LMArena d’octobre 2025 : Claude devant Gemini et GPT-5

Le palmarès LMArena d’octobre 2025 place les versions « thinking » de Claude en tête des modèles conversationnels. Gemini 2.5 Pro complète le podium, tandis que GPT-5 se classe huitième, derrière deux modèles OpenAI plus anciens. Ce résultat reflète des préférences d’utilisateurs en duel, et non une mesure absolue de l’intelligence artificielle.

Utilisateur comparant des réponses de modèles d’IA anonymes dans un classement de performances
Illustration : Actu.ai

Le classement d’un modèle d’intelligence artificielle ne se résume plus à une course aux annonces ou à la taille des infrastructures. En octobre 2025, les préférences exprimées par les utilisateurs de LMArena dessinent une hiérarchie différente : Anthropic occupe les deux premières places, Google complète le podium avec Gemini 2.5 Pro, et le récent GPT-5 d’OpenAI apparaît plus loin, à la huitième position.

Ce palmarès est particulièrement révélateur parce qu’il compare des réponses de modèles placés dans les mêmes conditions de dialogue. Il ne désigne pas une IA « la plus intelligente » dans tous les contextes. Il indique plutôt quelles réponses ont été jugées les plus convaincantes dans une série de confrontations anonymes. Nuance essentielle : une IA qui plaît davantage dans une conversation générale peut être dépassée dans un usage précis, comme la création d’images, la recherche web ou le développement d’un site.

Claude s’installe en tête du classement général

La première place revient à Claude Opus 4.1 « thinking », devant Claude Sonnet 4.5 « thinking ». Ces deux versions d’Anthropic, conçues pour accorder davantage de place au raisonnement avant la réponse, devancent Gemini 2.5 Pro de Google. Les modèles « thinking » et leurs versions standards sont comptabilisés séparément, car leur comportement et leur vitesse de réponse peuvent différer.

Le classement met également en évidence une situation inhabituelle chez OpenAI. GPT-4.5 Preview, quatrième, et ChatGPT-4o, cinquième, devancent GPT-5 « high », huitième. Cette photographie ne signifie pas que GPT-5 est moins capable pour chaque tâche. Elle signifie que, dans les duels pris en compte par LMArena, ses réponses ont recueilli moins de préférences que celles de plusieurs concurrents, mais aussi que celles de deux générations précédentes de la même entreprise.

Voici les dix premières positions détaillées dans les données de classement publiées pour octobre 2025.

RangModèleOrganisation associée
1Claude Opus 4.1 « thinking »Anthropic
2Claude Sonnet 4.5 « thinking »Anthropic
3Gemini 2.5 ProGoogle
4GPT-4.5 PreviewOpenAI
5ChatGPT-4oOpenAI
6Claude Opus 4.1Anthropic
7Claude Sonnet 4.5Anthropic
8GPT-5 « high »OpenAI
9o3OpenAI
10Qwen3 PreviewAlibaba

La liste détaillée fournie ici s’arrête au top 10. Deux autres positions sont néanmoins citées dans les éléments disponibles : DeepSeek est 16e et Mistral AI 34e. Sans la liste complète des rangs intermédiaires, il serait trompeur de reconstituer artificiellement un top 20.

Pourquoi GPT-5 se retrouve-t-il derrière GPT-4.5 et GPT-4o ?

La huitième place de GPT-5 constitue l’un des faits marquants de ce tableau. Dévoilé durant l’été 2025, le modèle ne surpasse pas automatiquement ses prédécesseurs dans les votes de LMArena. GPT-4.5 Preview et ChatGPT-4o conservent une avance de trois rangs sur GPT-5 « high » dans la hiérarchie générale.

Il faut toutefois éviter une interprétation hâtive. Les préférences des utilisateurs agrègent de nombreux critères, parfois implicites : la clarté, le ton, la précision apparente, la longueur de la réponse, le respect des consignes ou encore l’utilité immédiate. Un modèle peut produire une réponse techniquement solide mais moins appréciée si elle est trop longue, trop prudente ou moins adaptée à l’attente de la personne qui vote.

LMArena ne mesure donc pas directement des éléments comme le coût d’utilisation, la rapidité d’une API, la consommation de ressources, la confidentialité d’un service ou la capacité à traiter des documents d’entreprise. Ce sont pourtant des critères décisifs lorsqu’une organisation choisit un modèle pour un produit ou un usage professionnel.

Le classement par spécialité apporte une précision importante : GPT-5 arrive en tête pour le développement web. Autrement dit, sa position générale ne résume pas ses performances dans tous les domaines. Pour une personne qui code une interface ou demande la structure d’une page web, cette catégorie spécialisée peut être plus pertinente que le palmarès global.

Gemini, Claude et Qwen : ce que révèle le haut du tableau

Avec Gemini 2.5 Pro à la troisième place, Google reste au contact direct d’Anthropic. Selon LMArena, Gemini 2.5 Pro est le leader de la génération de texte. Il devance dans cette catégorie les modèles Claude, et l’écart avec GPT-5 y est notable, ce dernier occupant là encore la huitième position.

Cette distinction entre classement général et génération de texte peut sembler surprenante, mais elle est logique. Une réponse textuelle peut être évaluée dans des contextes très variés : explication pédagogique, reformulation, rédaction, raisonnement, résumé ou conversation. Le classement général, lui, agrège un ensemble plus large de confrontations et de préférences.

Anthropic place quatre entrées parmi les sept premières : les versions « thinking » de Claude Opus 4.1 et Claude Sonnet 4.5, puis leurs versions standards. Cette densité traduit la régularité perçue de la famille Claude dans les duels proposés sur la plateforme.

La dixième place de Qwen3 Preview, modèle associé à Alibaba, signale aussi l’importance croissante des acteurs non états-uniens dans la compétition des grands modèles de langage. Les premières places restent largement occupées par Anthropic, Google et OpenAI, mais le marché des modèles ne se limite plus à ces trois entreprises. La présence citée de DeepSeek au 16e rang va dans le même sens.

Des champions différents pour le texte, l’image et le web

Chercher « le meilleur modèle d’IA » n’a de sens qu’à condition de préciser l’usage. LMArena propose des catégories qui rendent visibles ces écarts de spécialisation.

Pour la création d’images à partir d’un texte, Hunyuan Image 3.0 de Tencent occupe la première position. Il devance les outils de Google Gemini 2.5 Flash Image et Imagen 4.0 Ultra. Dans cette même catégorie, GPT-Image est septième. Cela illustre un point souvent mal compris : l’excellence d’un assistant conversationnel ne garantit pas une domination en génération visuelle.

Côté recherche web, Grok-4 reste premier, devant Gemini 2.5 Pro et o3. Perplexity, longtemps identifié à cet usage, se situe à la cinquième place dans le classement mentionné. Une IA de recherche web doit non seulement formuler une réponse lisible, mais aussi orienter efficacement l’utilisateur dans l’information accessible en ligne. Les critères de préférence y diffèrent donc d’une simple tâche d’écriture.

Un classement général ne remplace pas un choix par usage

Ce que mesure le classement général

  • La préférence des utilisateurs lors de duels anonymes.
  • La qualité perçue des réponses dans un ensemble de prompts.
  • La performance relative, traduite par un score Elo.
  • Une photographie évolutive des versions disponibles.

Ce que montrent les classements spécialisés

  • Gemini 2.5 Pro domine la génération de texte.
  • Hunyuan Image 3.0 mène le text-to-image.
  • Grok-4 est premier pour la recherche web.
  • GPT-5 arrive en tête pour le développement web.

Comment LMArena établit-elle ses classements ?

Le fonctionnement de LMArena repose sur des duels anonymes. Un même prompt est soumis à deux modèles, sans que l’utilisateur sache à quel éditeur ou à quelle version correspondent les réponses affichées. La personne choisit ensuite celle qu’elle juge meilleure. Cette anonymisation vise à limiter l’effet de réputation lié à une marque connue.

Les résultats sont ensuite synthétisés avec un score Elo. Ce système, célèbre dans les compétitions d’échecs, permet d’ajuster un classement en fonction des victoires et des défaites. Battre régulièrement des adversaires bien classés améliore davantage le score que gagner contre des modèles moins bien placés. À l’inverse, une série de défaites entraîne une baisse.

ÉtapeCe qui se passeCe que cela évalue surtout
1Le même prompt est adressé à deux modèlesLa capacité à répondre à une demande identique
2Les modèles sont masqués pour le votantLa préférence sans effet de marque affichée
3L’utilisateur choisit la réponse la plus convaincanteL’utilité perçue, la qualité rédactionnelle et le respect de la demande
4Les duels alimentent un score EloLa performance relative face aux autres modèles

Cette méthode possède un avantage concret : elle capte l’expérience de personnes confrontées à des réponses réelles, plutôt que de s’appuyer uniquement sur des tests automatisés. Elle a aussi des limites. Les résultats dépendent des prompts soumis, du profil des votants, du nombre de duels disponibles et des versions précises déployées par les éditeurs. Comme les modèles évoluent fréquemment, les positions peuvent changer rapidement.

Comment utiliser ce palmarès sans se tromper de modèle ?

Pour un usage courant, le classement peut servir de point de départ, mais pas de verdict définitif. Une personne qui veut rédiger, résumer ou obtenir des explications peut s’intéresser aux performances générales et à la catégorie texte. Un développeur web aura intérêt à considérer la première place de GPT-5 dans cette spécialité. Pour l’illustration, le classement text-to-image est plus approprié.

Le meilleur réflexe consiste à tester un petit nombre de modèles avec les demandes qui ressemblent réellement à son besoin. Par exemple :

  • demander la reformulation d’un texte dans le ton attendu ;
  • soumettre une question complexe dont on connaît les éléments de réponse ;
  • essayer une consigne de code ou de développement web si c’est l’objectif ;
  • comparer les images générées à partir d’une même description ;
  • vérifier systématiquement les faits, les calculs et les sources évoquées par l’IA.

Ce dernier point reste indispensable. Un bon classement de préférences ne garantit pas qu’une réponse est exacte. Les grands modèles de langage produisent du texte en prédisant les suites les plus plausibles au regard de leur entraînement et de la demande reçue. Ils peuvent donc présenter avec assurance une information erronée, incomplète ou datée.

Ce qu’il faut surveiller dans les prochains classements

Le palmarès d’octobre 2025 confirme une compétition devenue plus fragmentée. Anthropic domine le classement général avec Claude, Google s’impose dans la génération de texte avec Gemini 2.5 Pro, Tencent mène en image avec Hunyuan Image 3.0, et Grok-4 garde l’avantage en recherche web. Aucun acteur ne paraît en mesure de s’imposer sans partage sur tous les usages.

La trajectoire de GPT-5 sera particulièrement observée. Sa huitième position générale contraste avec son avance dans le développement web et avec les rangs élevés de GPT-4.5 Preview, ChatGPT-4o et o3. OpenAI dispose ainsi de plusieurs modèles présents dans le top 10, mais aucun ne prend la tête du classement général à cette date.

Enfin, il faudra suivre la stabilité des résultats. Dans un secteur où les éditeurs modifient régulièrement leurs modèles, où de nouveaux modes de raisonnement apparaissent et où les utilisateurs peuvent privilégier des qualités différentes selon les tâches, un classement est avant tout une photographie. Celle d’octobre 2025 montre clairement que la qualité perçue par les utilisateurs se joue désormais dans le détail des usages, bien plus que dans le seul numéro de version d’un modèle.

Questions fréquentes

Quel est le meilleur modèle d’IA en octobre 2025 ?

Selon le classement général de LMArena en octobre 2025, Claude Opus 4.1 « thinking » occupe la première place. Claude Sonnet 4.5 « thinking » est deuxième et Gemini 2.5 Pro troisième. Ce résultat reflète des préférences d’utilisateurs confrontés à des réponses anonymes, pas une mesure universelle valable pour tous les usages.

Pourquoi GPT-5 est-il derrière GPT-4o et GPT-4.5 ?

Dans le classement général LMArena d’octobre 2025, GPT-5 « high » est huitième, tandis que GPT-4.5 Preview est quatrième et ChatGPT-4o cinquième. Les duels évaluent la réponse jugée la plus convaincante par les utilisateurs. Ce rang ne prouve pas que GPT-5 est inférieur dans chaque tâche : il est notamment premier en développement web.

Comment fonctionne le classement LMArena ?

LMArena confronte anonymement deux modèles qui répondent au même prompt. L’utilisateur choisit la réponse qu’il préfère sans connaître l’identité des modèles. Les résultats sont agrégés au moyen d’un score Elo : les victoires contre des adversaires bien classés font davantage progresser le score, tandis que les défaites le réduisent.

Quelle IA est la meilleure pour générer des images en octobre 2025 ?

Dans la catégorie text-to-image mentionnée par LMArena, Hunyuan Image 3.0 de Tencent arrive en première position. Il devance Gemini 2.5 Flash Image et Imagen 4.0 Ultra de Google. GPT-Image se classe septième. Ce palmarès concerne la génération d’images et ne doit pas être confondu avec le classement général des assistants conversationnels.

Quels modèles non américains figurent dans le classement IA ?

Qwen3 Preview, modèle associé à Alibaba, se classe dixième du classement général détaillé en octobre 2025. Les éléments disponibles citent également DeepSeek à la 16e place et Mistral AI à la 34e. Leur présence montre que la compétition ne se limite pas aux entreprises américaines, même si Anthropic, Google et OpenAI dominent le haut du tableau.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. LMArena, plateforme et classements comparatifs de modèles d’intelligence artificiellelmarena.ai