Modèles et LLM

Gemini prend la tête de Chatbot Arena devant ChatGPT-4o, en novembre 2024

Le modèle expérimental Gemini-Exp-1121 de Google s’installe en tête de la Chatbot Arena avec 1 365 points Elo, devant ChatGPT-4o-latest. Ce classement issu de duels anonymes entre assistants illustre le retour de Google dans la course, mais il ne résume pas à lui seul toutes les qualités d’un modèle d’IA.

Des utilisateurs comparent anonymement deux réponses d’assistants IA dans une arène d’évaluation.
Illustration : Actu.ai

Un écart de 4 points Elo suffit à changer la photo de tête du marché des grands modèles de langage. En novembre 2024, Gemini-Exp-1121, un modèle expérimental de Google, atteint 1 365 points dans la Chatbot Arena et dépasse ChatGPT-4o-latest, crédité de 1 361 points. Le mouvement est symbolique : Google place aussi deux autres modèles dans le top 10, alors qu’OpenAI, longtemps au premier plan, reste néanmoins très solidement représenté.

Ce palmarès doit toutefois être lu pour ce qu’il est : le résultat d’un très grand nombre de préférences exprimées par des utilisateurs devant deux réponses anonymisées. Il mesure donc la capacité des modèles à convaincre dans ce cadre précis, et non une vérité absolue sur l’intelligence artificielle.

Gemini passe devant de justesse

La Chatbot Arena, mise au point par la Large Model Systems Organization, organise des confrontations directes entre modèles. Un utilisateur soumet une demande, reçoit deux réponses sans connaître leur provenance, puis désigne celle qu’il juge la meilleure. Les votes successifs alimentent un score Elo, une méthode connue dans les compétitions où des adversaires s’affrontent deux à deux.

Dans ce contexte, Gemini-Exp-1121 prend la première place du classement de novembre 2024. Le modèle, lancé le 21 octobre 2024, est présenté par Google comme une amélioration en matière de codage, de raisonnement et de vision. Ces trois dimensions sont devenues décisives pour les assistants modernes : produire ou corriger du code, enchaîner les étapes d’un problème complexe et interpréter les éléments visuels transmis dans une conversation.

Le succès de Gemini ne repose pas sur un modèle isolé. Gemini-Exp-1114 s’installe à la troisième place, tandis que Gemini-1.5-Pro-002 arrive sixième. Cette présence groupée suggère que Google a retrouvé une place centrale dans la compétition des modèles généralistes, au moins selon les préférences relevées dans l’Arena.

Le top 10 des modèles d’IA en novembre 2024

Voici le classement observé en novembre 2024 dans la Chatbot Arena. Il s’agit d’un instantané : les scores évoluent à mesure que les utilisateurs réalisent de nouveaux duels et que les éditeurs publient des versions mises à jour.

RangModèleScore Elo
1Gemini-Exp-11211 365
2ChatGPT-4o-latest, version du 20 novembre 20241 361
3Gemini-Exp-11141 344
4o1-preview1 334
5o1-mini1 308
6Gemini-1.5-Pro-0021 301
7Grok-2-08-131 289
8Yi-Lightning1 287
9GPT-4o, version du 13 mai 20241 285
10Claude 3.5 Sonnet, version du 22 octobre 20241 282

Le sommet reste particulièrement serré. Entre la première et la deuxième position, seuls 4 points séparent Gemini-Exp-1121 de ChatGPT-4o-latest. Le troisième, Gemini-Exp-1114, se situe à 21 points du leader. À ce niveau, un classement ne doit pas être compris comme un écart catégorique entre un excellent modèle et un modèle médiocre : les dix systèmes retenus figurent tous parmi les assistants les mieux classés par les votants de la plateforme.

Google et OpenAI dans le top 10 de novembre 2024

Google, famille Gemini

  • Gemini-Exp-1121 est premier avec 1 365 points Elo.
  • Gemini-Exp-1114 prend la troisième position avec 1 344 points.
  • Gemini-1.5-Pro-002 est sixième avec 1 301 points.
  • Google place trois modèles parmi les six premiers.

OpenAI, famille GPT et o1

  • ChatGPT-4o-latest est deuxième avec 1 361 points Elo.
  • o1-preview occupe la quatrième place avec 1 334 points.
  • o1-mini est cinquième avec 1 308 points.
  • GPT-4o, version du 13 mai 2024, reste neuvième.

Google et OpenAI dominent le haut du tableau

La première place de Gemini ne fait pas disparaître OpenAI du paysage. L’entreprise occupe trois rangs du top 10 avec ChatGPT-4o-latest à la deuxième place, o1-preview à la quatrième et o1-mini à la cinquième. Une précédente version datée de GPT-4o reste également neuvième. Cette diversité illustre la rapidité des cycles de publication : selon la version exacte comparée, un même nom de famille peut occuper une place différente.

La distinction est importante pour les lecteurs qui cherchent « le meilleur ChatGPT » ou « la meilleure IA ». Dans le tableau, ChatGPT-4o-latest désigne une version récente et évolutive, datée du 20 novembre 2024, tandis que GPT-4o-2024-05-13 correspond à une version identifiée par sa date. Comparer les deux revient donc à observer la progression d’une même lignée de modèles à différents moments.

Google affiche pour sa part une remarquable densité dans les premières places : trois Gemini sont présents dans les six premiers. Le modèle de tête est expérimentel, comme l’indique le préfixe « Exp ». Cela ne signifie pas qu’il faut assimiler automatiquement le premier modèle de l’Arena au meilleur outil pour chaque situation. Un utilisateur qui rédige, programme, traduit, analyse des documents ou traite des images n’a pas nécessairement les mêmes critères de qualité qu’un autre.

Derrière les deux principaux rivaux, le classement révèle aussi une concurrence plus large. Grok-2-08-13, développé par xAI, est septième. Yi-Lightning est huitième. Claude 3.5 Sonnet, le modèle d’Anthropic, se trouve dixième, alors que Claude a régulièrement figuré parmi les concurrents les plus en vue de ChatGPT et Gemini.

Comment fonctionne exactement le score Elo ?

Le principe du score Elo est simple : deux adversaires se rencontrent, le résultat modifie leur évaluation, puis les affrontements suivants ajustent progressivement le classement. Un modèle qui bat un concurrent très bien noté gagne davantage de crédit qu’en dominant un modèle plus bas dans le tableau. À l’inverse, une défaite contre un adversaire moins bien classé pèse plus lourdement.

Appliqué à l’IA conversationnelle, ce mécanisme repose sur des duels à l’aveugle. L’utilisateur formule une requête, par exemple une question de culture générale, une demande de reformulation, un problème logique ou un extrait de code à expliquer. Deux assistants répondent. Le votant choisit la réponse qu’il préfère, sans que le nom du modèle soit affiché au moment du choix.

Cette anonymisation vise à limiter l’effet des marques. Elle n’efface pas toutes les limites de l’exercice. Les réponses sont évaluées par des personnes aux attentes différentes, sur des requêtes différentes. Une réponse courte et directe peut séduire certains utilisateurs, tandis que d’autres privilégieront une explication plus détaillée, une structure plus claire ou une meilleure prise en compte de la consigne.

Le score Elo est donc utile pour suivre les rapports de force et repérer les modèles qui plaisent le plus dans des échanges réels. Il est moins adapté pour décider seul quel service déployer dans une entreprise, dans une classe ou pour un usage sensible. Dans ces cas, des essais sur les documents, les tâches et les contraintes réelles de l’utilisateur restent indispensables.

Pourquoi ce classement ne désigne pas un vainqueur universel

Le mot « performant » recouvre plusieurs réalités. Un modèle peut être très convaincant dans une conversation généraliste, mais moins approprié pour une tâche professionnelle déterminée. La rédaction d’un texte, l’analyse d’une image, la génération de code et la résolution d’un raisonnement en plusieurs étapes ne sollicitent pas exactement les mêmes capacités.

Les qualités mises en avant pour Gemini-Exp-1121, codage, raisonnement et vision, répondent précisément à cette diversification des usages. La vision désigne ici la faculté d’interpréter des informations visuelles, par exemple les éléments contenus dans une image fournie dans l’échange. Le raisonnement renvoie à la capacité à décomposer un problème plutôt qu’à produire seulement une réponse immédiate. Quant au codage, il concerne l’aide à l’écriture, à la compréhension ou à la correction de programmes.

Mais l’Arena ne permet pas, à elle seule, de mesurer tous les enjeux pratiques. Avant de choisir un assistant, il faut aussi examiner les points suivants :

  • la qualité obtenue dans la langue et le domaine concernés ;
  • la capacité du modèle à suivre des consignes précises et à reconnaître ses incertitudes ;
  • les règles de traitement des données, particulièrement pour des informations confidentielles ;
  • la disponibilité du service, son prix et son intégration avec les logiciels déjà utilisés.

Cette prudence est particulièrement utile face à des écarts restreints. Les 4 points entre Gemini-Exp-1121 et ChatGPT-4o-latest signalent une tête de classement très disputée, pas un fossé de qualité entre les deux modèles.

Claude recule, Mistral sort du top 20

La hiérarchie de novembre 2024 est aussi marquée par les positions moins favorables de certains acteurs. Claude 3.5 Sonnet occupe la dixième place avec 1 282 points Elo. Le modèle d’Anthropic reste donc dans le top 10, mais il se trouve derrière les trois Gemini de Google et les trois modèles d’OpenAI présents dans ce groupe.

Côté français, Mistral ne conserve pas de modèle dans le top 20 de l’Arena à cette date. Ce recul intervient malgré une mise à jour significative de son interface, Le Chat. Le constat rappelle une caractéristique majeure de ce marché : quelques semaines peuvent suffire à modifier l’ordre d’un classement, tant les modèles et leurs versions se succèdent rapidement.

Il serait néanmoins réducteur d’assimiler l’absence du top 20 à une absence de pertinence. Les classements généralistes ne couvrent pas nécessairement tous les usages, toutes les langues ni toutes les contraintes de déploiement. Ils permettent de suivre une compétition mondiale, mais ne dispensent pas d’évaluer un outil dans son contexte d’utilisation.

Ce qu’il faut surveiller dans les prochains classements

La première place de Gemini-Exp-1121 confirme que la bataille entre Google et OpenAI reste ouverte. L’avance est minime, et l’Arena est par nature mouvante : chaque nouveau vote peut faire évoluer les scores, tandis que chaque nouvelle version peut redistribuer les cartes.

Trois éléments méritent particulièrement l’attention. D’abord, la capacité de Google à transformer les performances de ses modèles expérimentaux en produits accessibles et cohérents. Ensuite, la réponse d’OpenAI, qui conserve une présence très forte avec plusieurs modèles dans le top 10. Enfin, la faculté des autres acteurs, dont xAI, Anthropic, Yi et Mistral, à se distinguer dans une course où la qualité conversationnelle ne cesse de progresser.

Pour le public, le meilleur réflexe consiste à considérer ces palmarès comme un baromètre. Ils renseignent sur l’état de la concurrence et sur les préférences observées auprès des utilisateurs. Ils ne remplacent pas un test concret : pour savoir quelle IA est la plus utile, il faut la confronter aux questions, aux documents et aux objectifs qui comptent réellement pour soi.

Questions fréquentes

Quel est le meilleur modèle d’IA en novembre 2024 ?

Selon le classement de la Chatbot Arena en novembre 2024, Gemini-Exp-1121 est premier avec 1 365 points Elo. Il devance ChatGPT-4o-latest, à 1 361 points. Cet écart de 4 points est faible : il indique une compétition très serrée dans les duels de réponses évalués par les utilisateurs, plutôt qu’une supériorité absolue dans tous les usages.

Pourquoi Gemini dépasse-t-il ChatGPT-4o dans la Chatbot Arena ?

Gemini-Exp-1121 arrive devant ChatGPT-4o-latest grâce aux votes recueillis dans les confrontations anonymes de la Chatbot Arena. Google met en avant des améliorations en codage, raisonnement et vision pour ce modèle expérimental. Le classement ne permet toutefois pas d’isoler une seule cause technique : il agrège les préférences des utilisateurs sur de nombreuses requêtes différentes.

Comment fonctionne le classement Chatbot Arena ?

La Chatbot Arena propose à un utilisateur deux réponses générées anonymement à partir d’une même requête. L’utilisateur choisit celle qu’il préfère. Ces duels alimentent un score Elo : battre un modèle très bien classé augmente davantage le score, tandis qu’une défaite contre un modèle moins bien classé le fait davantage reculer. Le tableau évolue continuellement avec les votes.

Le score Elo permet-il de choisir la meilleure IA pour travailler ?

Pas à lui seul. Un score Elo élevé indique qu’un modèle est souvent préféré dans des échanges conversationnels comparatifs. Il ne mesure pas directement la confidentialité des données, le prix, la vitesse, la disponibilité, la qualité dans un domaine professionnel précis ou la compatibilité avec les outils d’une organisation. Un essai sur des tâches réelles demeure nécessaire avant tout choix.

Quels modèles figurent dans le top 10 de l’IA en novembre 2024 ?

Le top 10 réunit Gemini-Exp-1121, ChatGPT-4o-latest, Gemini-Exp-1114, o1-preview, o1-mini, Gemini-1.5-Pro-002, Grok-2-08-13, Yi-Lightning, GPT-4o dans sa version du 13 mai 2024 et Claude 3.5 Sonnet. Google et OpenAI y comptent chacun plusieurs modèles, ce qui confirme leur poids dans ce classement.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. LMArena, plateforme de classement et de comparaison de modèles conversationnelslmarena.ai