Modèles et LLM

Classement des modèles d’IA en mai 2025 : Gemini devance OpenAI

En mai 2025, Google place Gemini 2.5 Pro et Gemini 2.5 Flash aux deux premières places de la Chatbot Arena. OpenAI reste très présent avec o3 et GPT-4o, tandis que Tencent fait une entrée remarquée. Voici comment lire ce classement et ce qu’il révèle de la course aux modèles d’IA.

Écran comparant deux réponses d’IA anonymes devant un classement de modèles en compétition.
Illustration : Actu.ai

À la fin du printemps 2025, la hiérarchie des grands modèles d’intelligence artificielle est plus disputée que jamais. Le classement de la Chatbot Arena, fondé sur des comparaisons directes entre réponses produites par des IA, place deux modèles de Google en tête : Gemini 2.5 Pro et Gemini 2.5 Flash. OpenAI n’est pas loin, avec plusieurs systèmes dans les premières positions, tandis que Tencent s’invite dans le top 10.

Ce palmarès ne répond pas à une question aussi simple que « quelle est la meilleure IA du monde ? ». Il photographie plutôt les préférences exprimées par des utilisateurs face à des réponses anonymisées, dans des duels portant sur une grande variété de requêtes. C’est un indicateur précieux de la qualité perçue, mais il faut le lire comme un classement situé dans le temps et dépendant de sa méthode.

Gemini prend les deux premières places

Le premier enseignement du classement de mai 2025 est la double victoire de Google. Gemini 2.5 Pro obtient 1 446 points Elo, devant Gemini 2.5 Flash avec 1 418 points. Ces deux modèles devancent donc les offres d’OpenAI dans les confrontations recensées par la Chatbot Arena à cette date.

Gemini 2.5 Pro est conçu pour les demandes complexes, celles qui exigent d’articuler plusieurs étapes, de relier des informations ou de traiter un problème long. Gemini 2.5 Flash vise pour sa part un équilibre entre capacités avancées et rapidité d’exécution. Leur présence aux deux premières places souligne l’importance prise par le raisonnement structuré dans la compétition entre modèles : il ne s’agit plus seulement de produire un texte fluide, mais de traiter une consigne en plusieurs sous-problèmes cohérents.

La progression de Gemini s’inscrit aussi dans une séquence stratégique pour Google. En mai 2025, la conférence Google I/O a largement mis l’accent sur les outils et services dopés à l’IA. Dans ce contexte, les performances de la famille Gemini constituent autant un enjeu technique qu’un signal envoyé aux utilisateurs et aux entreprises.

OpenAI reste au contact avec o3 et GPT-4o

La domination de Gemini ne fait pas disparaître OpenAI du paysage. Au contraire, l’éditeur américain conserve une présence dense parmi les modèles les mieux classés. OpenAI o3 se classe troisième avec 1 409 points, suivi de GPT-4o, appelé ChatGPT 4o dans le classement source, avec 1 405 points. L’écart entre ces deux modèles est de seulement quatre points.

Plus bas dans le tableau, GPT-4.5 atteint 1 394 points, à la sixième place, et GPT-4.1 obtient 1 365 points, à la neuvième position. OpenAI compte ainsi quatre entrées dans ce top 10 si l’on considère les différentes versions de ses modèles. Cette densité traduit une offre qui reste très compétitive, même si les deux premières places échappent alors à l’entreprise.

En mai 2025, l’attention se porte aussi sur la prochaine génération attendue sous le nom de GPT-5. Son arrivée est alors envisagée comme une possible occasion pour OpenAI de reprendre l’avantage dans une course où chaque publication de modèle peut modifier rapidement les positions établies. Mais un classement ponctuel ne suffit pas à juger de l’évolution future d’un acteur : la qualité, le coût, la vitesse, les capacités multimodales et l’intégration dans les produits comptent aussi dans l’adoption réelle.

Le top 10 des modèles d’IA en mai 2025

Voici le classement communiqué par la Chatbot Arena pour cette photographie de mai 2025. Les scores reposent sur le système Elo, un mécanisme de notation dynamique issu du monde des échecs.

RangModèleOrganisationScore Elo
1Gemini 2.5 ProGoogle1 446
2Gemini 2.5 FlashGoogle1 418
3OpenAI o3OpenAI1 409
4GPT-4oOpenAI1 405
5Grok-3xAI1 399
6GPT-4.5OpenAI1 394
7Gemini 2.5 Flash, version antérieureGoogle1 387
8DeepSeek V3DeepSeek1 368
9GPT-4.1OpenAI1 365
10Hunyuan TurboSTencent1 356

Le tableau fait apparaître plusieurs phénomènes. Google occupe trois rangs, dont les deux premiers. OpenAI place quatre versions ou déclinaisons de ses systèmes dans les dix premières positions. xAI, DeepSeek et Tencent complètent la liste, preuve qu’aucun duopole parfaitement verrouillé ne s’impose dans cette mesure précise des performances conversationnelles.

Google et OpenAI dans le classement de mai 2025

Gemini de Google

  • Gemini 2.5 Pro occupe la première place avec 1 446 points Elo.
  • Gemini 2.5 Flash est deuxième avec 1 418 points Elo.
  • Une version antérieure de Gemini 2.5 Flash se classe septième.
  • Google place trois entrées dans le top 10.

Modèles d’OpenAI

  • OpenAI o3 arrive troisième avec 1 409 points Elo.
  • GPT-4o se place quatrième avec 1 405 points Elo.
  • GPT-4.5 est sixième, avec 1 394 points Elo.
  • GPT-4.1 complète le top 10 à la neuvième place.

Comment fonctionne la Chatbot Arena ?

La Chatbot Arena repose sur une idée simple : plutôt que de noter les modèles à partir d’un seul examen standardisé, elle les fait s’affronter deux par deux. Un utilisateur soumet une demande et reçoit deux réponses générées par des modèles dont l’identité n’est pas affichée au moment du choix. Il sélectionne ensuite la réponse qu’il préfère.

Cette procédure cherche à limiter l’influence de la réputation d’une marque. Une réponse est donc évaluée pour ce qu’elle apporte à la requête, par exemple sa clarté, sa pertinence, sa capacité à suivre les consignes ou son utilité pratique. Le résultat agrège un grand nombre de préférences plutôt que l’avis d’un seul évaluateur.

Le classement utilise ensuite le score Elo. À l’origine, ce système sert à classer les joueurs d’échecs. Appliqué à l’IA, il évolue après chaque duel : battre un adversaire bien classé apporte davantage qu’une victoire contre un modèle plus bas dans le tableau. Les modèles ne sont donc pas jugés sur une note fixe, mais sur leur capacité relative à convaincre face aux autres participants.

Ce que le score Elo permet d’observerCe qu’il ne permet pas d’affirmer à lui seul
Les préférences des votants lors de duels directsQu’un modèle est meilleur dans toutes les situations
L’évolution d’un modèle face à des concurrents précisLa précision absolue de ses réponses factuelles
Une hiérarchie régulièrement actualiséeLe coût, la confidentialité ou la facilité d’intégration
L’intérêt d’un modèle pour des usages conversationnelsLa qualité exhaustive dans un métier ou un secteur donné

Cette nuance est essentielle. Un écart de quelques dizaines de points ne peut pas être traduit mécaniquement en pourcentage de qualité ou de fiabilité. Il signale une différence dans les préférences observées au sein de cette arène, pas une mesure universelle de l’intelligence.

Hunyuan TurboS et DeepSeek, les challengers qui comptent

Le top 10 ne se limite pas aux noms les plus familiers du grand public. Hunyuan TurboS, développé par Tencent, entre au classement avec 1 356 points Elo. Cette apparition est notable, car elle confirme que la compétition ne se joue pas uniquement entre Google et OpenAI.

Le modèle s’inscrit dans la tendance des IA capables d’organiser une réponse complexe en étapes de raisonnement. Cette approche est souvent désignée par l’expression anglaise chain-of-thought, ou chaîne de pensée. L’idée générale consiste à décomposer une question difficile, à vérifier les liens entre ses différentes parties, puis à formuler une réponse plus structurée. Cela peut aider pour la logique, les mathématiques, la programmation ou l’analyse de problèmes à plusieurs contraintes.

Il faut toutefois éviter d’y voir une garantie infaillible. Un modèle peut dérouler un raisonnement apparemment convaincant tout en partant d’une information erronée ou en inventant un détail. Les réponses doivent donc rester vérifiées lorsque l’enjeu est important, notamment dans les domaines juridiques, médicaux, financiers ou professionnels.

La huitième place de DeepSeek V3, avec 1 368 points, contribue elle aussi à élargir le paysage. Avec Grok-3 de xAI en cinquième position, ces modèles montrent que la qualité perçue des assistants conversationnels progresse chez plusieurs acteurs à la fois. Pour les utilisateurs, cette diversité peut favoriser davantage de choix, mais elle rend aussi les comparaisons plus nécessaires.

Quel modèle choisir selon son besoin ?

Le premier du classement n’est pas automatiquement le meilleur choix pour chaque personne. Le bon modèle dépend de la tâche, du volume de travail, du budget, de la vitesse attendue et du niveau de confidentialité requis. La Chatbot Arena apporte un point de départ utile, mais pas un verdict définitif.

Pour une demande nécessitant l’analyse de longs documents ou la résolution d’un problème en plusieurs étapes, les modèles les mieux placés sur le raisonnement constituent des candidats naturels à essayer. Pour des échanges rapides, des reformulations ou des synthèses courtes, la latence et la simplicité d’accès peuvent peser davantage qu’un écart dans le score Elo. Pour le code, la rédaction, la recherche ou la traduction, l’idéal est de préparer quelques exemples représentatifs de son usage et de comparer les réponses obtenues.

Avant d’adopter un modèle, quatre questions méritent d’être posées :

  • Le système suit-il correctement les consignes et le format demandés ?
  • Ses erreurs sont-elles faciles à détecter et à corriger dans mon contexte ?
  • La vitesse de réponse est-elle adaptée à l’usage envisagé ?
  • Les données saisies peuvent-elles être partagées avec ce service selon les règles de mon organisation ?

Cette démarche évite de confondre performance générale et adéquation concrète. Un classement mesure une tendance collective. Un test sur une tâche réelle mesure, lui, l’utilité pour un utilisateur donné.

Ce qu’il faut surveiller après ce classement

La photographie de mai 2025 illustre une accélération de la concurrence. Google mène avec Gemini, OpenAI reste solidement installé dans le groupe de tête, et de nouveaux concurrents gagnent en visibilité. La place de Hunyuan TurboS rappelle notamment que les grands laboratoires chinois peuvent peser dans les comparaisons internationales de modèles.

Les prochains mouvements dépendront autant des nouvelles versions que de leur déploiement. Un modèle peut progresser grâce à une mise à jour, apparaître dans l’arène avec une déclinaison plus rapide, ou reculer lorsque les utilisateurs confrontent ses réponses à celles d’un concurrent. Il faut donc toujours associer ce top 10 à sa date : le 27 mai 2025, Gemini 2.5 Pro et Gemini 2.5 Flash occupent les deux premières places, mais cette hiérarchie demeure par nature évolutive.

Pour le public comme pour les entreprises, le véritable enjeu dépasse désormais la seule question du leader. Il consiste à comprendre les forces, les limites et les conditions d’usage de modèles de plus en plus nombreux, afin de tirer parti de leurs progrès sans leur accorder une confiance aveugle.

Questions fréquentes

Quel est le meilleur modèle d’IA en mai 2025 ?

Selon le classement de la Chatbot Arena utilisé ici, Gemini 2.5 Pro de Google arrive en première position en mai 2025 avec 1 446 points Elo. Gemini 2.5 Flash suit avec 1 418 points. Ce résultat reflète les préférences d’utilisateurs lors de duels anonymes, et non une supériorité automatique pour chaque usage possible.

Pourquoi Gemini 2.5 Pro est-il devant OpenAI o3 et GPT-4o ?

Gemini 2.5 Pro obtient le meilleur score Elo dans les confrontations enregistrées par la Chatbot Arena, devant OpenAI o3 et GPT-4o. Il est notamment mis en avant pour sa capacité à traiter des tâches complexes en les décomposant en plusieurs étapes. Le classement mesure néanmoins des préférences comparatives, pas une vérité universelle sur toutes les tâches.

Comment est calculé le classement Chatbot Arena des modèles d’IA ?

Les utilisateurs comparent anonymement deux réponses générées par des modèles différents à partir d’une même demande. Ils choisissent celle qu’ils jugent la meilleure. Ces duels alimentent un score Elo, inspiré des échecs : un modèle gagne ou perd des points selon ses résultats et le niveau relatif de son adversaire.

Quels modèles OpenAI figurent dans le top 10 de mai 2025 ?

OpenAI place quatre modèles dans le top 10 de mai 2025 : o3, troisième avec 1 409 points Elo, GPT-4o, quatrième avec 1 405 points, GPT-4.5, sixième avec 1 394 points, et GPT-4.1, neuvième avec 1 365 points. L’entreprise reste donc l’un des acteurs les plus présents du classement.

Hunyuan TurboS de Tencent est-il un nouveau modèle important ?

Hunyuan TurboS se distingue par son entrée dans le top 10 de la Chatbot Arena, à la dixième place avec 1 356 points Elo. Son arrivée confirme que des acteurs moins connus du grand public occidental peuvent rivaliser dans les comparaisons conversationnelles. Le modèle est associé à des approches de raisonnement par étapes, dites chain-of-thought.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. LM Arena, classement des modèles et méthode d’évaluation par duelslmarena.ai
  2. Google, présentation des évolutions de Gemini 2.5 au printemps 2025blog.google/technology/google-deepmind/gemini-model-thinking-updates-march-2025
  3. OpenAI, présentation des modèles et travaux de rechercheopenai.com/index
  4. Tencent Hunyuan, plateforme officielle de modèles d’IAhunyuan.tencent.com