Classement IA de décembre 2024 : Google passe devant OpenAI sur la Chatbot Arena
En décembre 2024, Google occupe les deux premières places de la Chatbot Arena avec Gemini-Exp-1206 et Gemini 2.0. OpenAI reste au contact grâce à ChatGPT 4o Latest, troisième. Ce classement fondé sur des duels anonymes éclaire la rivalité entre modèles, sans suffire à résumer toutes leurs capacités.

Au 27 décembre 2024, la course aux assistants d’intelligence artificielle change de tête dans l’un des palmarès les plus suivis du secteur. Google place ses modèles Gemini-Exp-1206 et Gemini 2.0 aux deux premières positions de la Chatbot Arena, devant ChatGPT 4o Latest d’OpenAI. L’écart est faible, mais le signal est clair : dans les duels de réponses soumis aux utilisateurs de cette plateforme, Google a pris l’avantage.
Cette photographie ne désigne pas un vainqueur définitif de l’IA. Elle montre plutôt quels modèles sont le plus souvent préférés dans des conversations comparatives, à un moment donné. Les classements évoluent rapidement au fil des mises à jour, des nouveaux modèles et des votes. Ils restent néanmoins précieux pour comprendre l’intensité de la compétition entre Google, OpenAI et des acteurs plus récents comme xAI ou 01.ai.
Le top 10 des modèles sur la Chatbot Arena
Le classement de décembre 2024 repose sur le score Elo, un indice qui progresse ou recule selon l’issue de duels entre modèles anonymisés. Dans cette édition, Gemini-Exp-1206 obtient 1 372 points, quatre points devant Gemini 2.0. ChatGPT 4o Latest suit à 1 364 points, à seulement huit points du leader.
| Rang | Modèle | Score Elo |
|---|---|---|
| 1 | Gemini-Exp-1206 | 1 372 |
| 2 | Gemini 2.0 | 1 368 |
| 3 | ChatGPT 4o Latest | 1 364 |
| 4 | Gemini 2.0 Flash | 1 354 |
| 5 | o1-preview | 1 335 |
| 6 | o1-mini | 1 306 |
| 7 | Gemini 1.5 Pro | 1 302 |
| 8 | Grok-2-08-13 | 1 288 |
| 9 | Yi-Lightning | 1 287 |
| 10 | GPT 4o | 1 285 |
La répartition des dix premières places est particulièrement parlante. Quatre modèles de Google figurent dans le top 10 : Gemini-Exp-1206, Gemini 2.0, Gemini 2.0 Flash et Gemini 1.5 Pro. Quatre modèles d’OpenAI y apparaissent également : ChatGPT 4o Latest, o1-preview, o1-mini et GPT 4o. Les deux places restantes reviennent à Grok-2-08-13 de xAI et à Yi-Lightning de 01.ai.
Cette concentration ne signifie pas que seuls ces groupes produisent des modèles de qualité. Elle traduit le résultat d’un mode d’évaluation précis, centré sur les réponses conversationnelles comparées sur la plateforme. Les modèles peuvent aussi différer par leur prix, leur vitesse, les langues prises en charge, leurs outils intégrés ou leur aptitude à traiter des documents et des images.
Pourquoi Gemini devance OpenAI en décembre 2024
La percée de Google est nette : ses modèles occupent simultanément les deux premières places et quatre positions parmi les dix premières. La présence de Gemini 2.0 Flash au quatrième rang renforce cette impression. Un modèle dit « Flash » vise généralement une utilisation plus rapide et plus légère, ce qui rend sa position notable face à des systèmes pensés pour des usages plus exigeants.
OpenAI n’est toutefois pas distancé. Avec ChatGPT 4o Latest troisième, puis o1-preview et o1-mini aux cinquième et sixième rangs, l’entreprise conserve une présence centrale. L’écart entre le premier et le troisième modèle, seulement 8 points Elo, invite d’ailleurs à éviter les interprétations trop catégoriques. Dans un classement issu de préférences humaines, quelques points ne suffisent pas à établir qu’un outil serait meilleur dans tous les contextes.
Le résultat reflète aussi la cadence de renouvellement du secteur. Un modèle expérimental ou une nouvelle version peut faire varier la hiérarchie, tandis que les réponses de ses concurrents restent évaluées par les utilisateurs. C’est ce mouvement continu qui explique qu’un classement mensuel soit utile, à condition de le lire comme une photographie et non comme un verdict définitif.
Google et OpenAI dans le top 10 de décembre 2024
- Quatre modèles dans le top 10 de la Chatbot Arena.
- Gemini-Exp-1206 est premier avec 1 372 points Elo.
- Gemini 2.0 est deuxième avec 1 368 points.
- Gemini 2.0 Flash atteint la quatrième place.
- Gemini 1.5 Pro se classe septième.
OpenAI
- Quatre modèles dans le top 10 de la Chatbot Arena.
- ChatGPT 4o Latest est troisième avec 1 364 points Elo.
- o1-preview occupe la cinquième place.
- o1-mini se place au sixième rang.
- GPT 4o complète le classement à la dixième place.
Comment fonctionne le score Elo de la Chatbot Arena ?
La Chatbot Arena est organisée par la Large Model Systems Organization, ou LMSYS. Son principe est simple à comprendre : un utilisateur formule une demande, puis reçoit deux réponses générées par des modèles dont l’identité n’est pas affichée. Il choisit la réponse qu’il préfère. Les modèles s’affrontent ainsi dans une série de duels anonymes.
Le système transforme ensuite ces préférences en score Elo. Ce mécanisme de classement compare des adversaires entre eux : battre un modèle bien classé rapporte davantage que l’emporter face à un modèle moins bien noté. À l’inverse, une défaite face à un adversaire moins bien classé peut avoir davantage d’effet sur le score. L’intérêt est de produire une échelle relative à partir d’un grand nombre de confrontations.
L’anonymisation est importante. Sans elle, une partie des votants pourrait être influencée par la réputation de Google, OpenAI ou xAI, plutôt que par la qualité de la réponse affichée. En masquant le nom du modèle, la plateforme cherche à ramener le jugement au résultat fourni pour une requête donnée : clarté, pertinence, utilité, ton ou capacité à suivre une consigne.
Ce que le classement mesure, et ce qu’il ne mesure pas
La méthode comporte aussi des limites qu’il faut garder à l’esprit. Une réponse agréable à lire peut être préférée à une réponse plus prudente mais plus exacte. La composition des requêtes proposées par les utilisateurs influence nécessairement les résultats. Enfin, un assistant peut exceller dans une tâche particulière, par exemple le raisonnement, la programmation ou une langue donnée, sans dominer pour autant les échanges généralistes.
| Ce que les duels permettent d’observer | Ce qu’ils ne suffisent pas à établir |
|---|---|
| La préférence des votants entre deux réponses anonymes | L’exactitude systématique de toutes les réponses |
| La qualité perçue dans des échanges conversationnels | Les performances sur chaque métier ou domaine spécialisé |
| L’évolution relative des modèles présents sur la plateforme | Le coût, la vitesse ou les conditions d’accès à chaque modèle |
| La compétitivité de versions et de mises à jour récentes | L’absence de biais, d’erreurs ou de contenus problématiques |
Claude sort du top 10, Grok et Yi-Lightning résistent
Le changement le plus visible hors du podium concerne Claude, habituellement parmi les concurrents les mieux placés, mais classé onzième en décembre 2024. Cette position ne permet pas de conclure à une baisse générale de ses capacités. Elle indique que, dans les duels pris en compte ce mois-ci, d’autres modèles ont davantage convaincu les votants.
À la huitième place, Grok-2-08-13 affiche 1 288 points. Le modèle de xAI recule d’une position par rapport au mois précédent, selon ce classement. Son maintien dans le top 10 confirme néanmoins que la compétition ne se réduit pas à Google et OpenAI.
Juste derrière, Yi-Lightning obtient 1 287 points. Développé par 01.ai, il se maintient dans les dix premiers modèles et représente la montée en puissance d’acteurs établis en Chine. Son score est très proche de celui de Grok, avec seulement un point d’écart, un bon rappel de la densité du classement à ces niveaux.
Cette diversité, encore limitée dans les premières places, compte pour l’avenir du marché. Elle évite que l’évaluation publique des grands modèles conversationnels ne se résume à un face-à-face strict entre deux entreprises américaines. Elle montre aussi que les laboratoires et entreprises qui déploient de nouvelles générations de modèles peuvent rapidement se faire une place dans les préférences des utilisateurs.
Quel modèle choisir pour un usage concret ?
Pour un particulier, un professionnel ou une équipe, le premier du classement n’est pas automatiquement le meilleur choix. Le bon outil dépend de la tâche, du budget, de l’environnement de travail et du niveau de contrôle attendu sur les données partagées. Une personne qui rédige, résume des documents ou prépare des idées n’a pas nécessairement les mêmes besoins qu’un développeur ou qu’une entreprise.
Avant d’adopter un assistant, il est utile de le tester sur quelques demandes représentatives de son propre usage. On peut notamment vérifier :
- la capacité à suivre précisément une consigne en français ;
- la qualité des réponses sur les sujets réellement traités au quotidien ;
- la tendance à signaler ses incertitudes plutôt qu’à inventer une information ;
- la rapidité de réponse et les conditions d’accès ;
- les règles applicables aux données saisies dans le service.
Cette démarche est plus éclairante qu’un simple numéro de rang. Les systèmes génératifs peuvent produire des erreurs plausibles, y compris lorsqu’ils occupent les premières places d’un palmarès. Pour des décisions importantes, notamment juridiques, médicales, financières ou professionnelles, leurs réponses doivent donc être vérifiées à partir de sources fiables.
Ce qu’il faut surveiller après décembre 2024
Le classement de décembre met en lumière une rivalité désormais très resserrée. Google dispose de l’avantage sur cette édition de la Chatbot Arena, mais OpenAI occupe encore quatre places dans le top 10 et reste à proximité immédiate du sommet. La bataille se joue autant sur les nouvelles générations de modèles que sur leur déploiement effectif auprès du public.
Les prochains mouvements seront à observer sur plusieurs fronts : la capacité de Google à conserver l’élan de Gemini, la réponse d’OpenAI avec ses familles GPT et o1, la stabilité de Claude dans les classements, ainsi que la progression de Grok et de Yi-Lightning. Chaque nouvelle version peut modifier les préférences observées dans les duels.
Pour les utilisateurs, le principal enseignement est moins l’existence d’un champion unique que la multiplication d’outils de haut niveau. La Chatbot Arena offre un indicateur concret de cette concurrence, à condition de ne pas lui demander plus qu’elle ne peut fournir. Elle mesure une préférence comparative dans des conversations, pas une vérité définitive sur la valeur de chaque modèle.
Questions fréquentes
Quel est le meilleur modèle d’IA en décembre 2024 ?
Selon le classement de la Chatbot Arena observé en décembre 2024, Gemini-Exp-1206 de Google occupe la première place avec 1 372 points Elo. Ce résultat reflète les préférences d’utilisateurs lors de duels anonymes entre réponses. Il ne signifie pas que ce modèle est le meilleur pour toutes les tâches, tous les métiers ou toutes les langues.
Pourquoi Gemini est-il devant ChatGPT dans ce classement ?
Gemini-Exp-1206 et Gemini 2.0 ont obtenu davantage de points Elo que ChatGPT 4o Latest dans les duels anonymes de la Chatbot Arena. Les votants ont donc plus souvent préféré leurs réponses sur les requêtes soumises à la plateforme. L’écart entre le premier et le troisième reste faible, avec seulement 8 points Elo.
Comment la Chatbot Arena classe-t-elle les modèles d’intelligence artificielle ?
La Chatbot Arena présente à un utilisateur deux réponses anonymes à une même demande. L’utilisateur choisit celle qu’il préfère, puis le résultat alimente le score Elo des deux modèles. Ce système mesure une performance relative dans des duels conversationnels. Il est utile pour comparer les réponses, mais ne remplace pas des tests techniques spécialisés.
Claude est-il encore dans le top 10 des IA en décembre 2024 ?
Non. En décembre 2024, Claude se situe à la onzième place du classement cité. Cette position traduit les résultats des duels enregistrés par la Chatbot Arena à ce moment précis. Elle ne permet pas, à elle seule, de juger toutes les capacités du modèle ni de prédire son rang après une future mise à jour.
Quels modèles autres que Google et OpenAI figurent dans le top 10 ?
Deux modèles issus d’autres acteurs apparaissent dans les dix premiers : Grok-2-08-13 de xAI, huitième avec 1 288 points Elo, et Yi-Lightning de 01.ai, neuvième avec 1 287 points. Leur présence rappelle que le marché des grands modèles de langage ne se limite pas à la concurrence entre Google et OpenAI.
Sources
Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.
- Chatbot Arena, plateforme de comparaison anonyme de modèleslmarena.ai
- Chatbot Arena, classement des modèles par score Elolmarena.ai/?leaderboard



