Modèles et LLM

Top 10 des modèles d’IA en janvier 2025 : Gemini devance OpenAI et DeepSeek

En janvier 2025, Gemini 2.0 domine le classement de la Chatbot Arena avec 1 380 points Elo. Google et OpenAI occupent six des premières places, tandis que DeepSeek-V3 et Step-2 confirment la progression des modèles chinois. Voici ce que ce palmarès fondé sur des duels d’utilisateurs permet réellement de comprendre.

Écran comparant des réponses de modèles d’IA anonymisés devant un classement de performances.
Illustration : Actu.ai

En quelques clics, il est désormais possible de demander à plusieurs intelligences artificielles de résumer un document, d’écrire du code, de trouver une idée ou d’expliquer une notion complexe. Mais laquelle répond le mieux ? En janvier 2025, le classement de la Chatbot Arena apporte une photographie concrète de cette compétition, fondée non sur une seule série d’examens automatisés, mais sur les préférences d’utilisateurs face à des réponses anonymisées.

Le constat est net : Gemini 2.0 conserve la première place avec 1 380 points Elo. Derrière le modèle de Google, les positions restent très disputées. Google et OpenAI concentrent à eux deux les six premières places, tandis que DeepSeek-V3 et Step-2-16K-Exp rappellent que les acteurs chinois progressent rapidement. Ce classement ne désigne pas une IA parfaite pour tous les usages, mais il offre un repère utile pour suivre l’évolution des modèles conversationnels les plus visibles du moment.

Gemini 2.0 reste le modèle à battre

Le premier mois de 2025 apporte peu de bouleversements au sommet du palmarès. Gemini 2.0 garde son avance avec un score de 1 380, une première place qu’il conserve depuis trois mois selon les données citées. Le modèle devance Gemini-Exp-1206, à 1 374 points, puis ChatGPT 4o Latest, à 1 365 points.

Le mot « modèle » désigne ici le système d’IA qui produit les réponses. Un service grand public peut toutefois proposer plusieurs modèles, ou faire évoluer celui qui répond à l’utilisateur au fil du temps. C’est notamment ce qui explique la présence de nombreuses variantes d’une même famille dans un classement : Gemini 2.0, Gemini 2.0 Flash et Gemini 1.5 Pro ne sont pas une seule et même version ; de même, OpenAI apparaît avec ChatGPT 4o Latest, o1, o1-preview et o1-mini.

La hiérarchie du haut de tableau est particulièrement serrée. Entre Gemini 2.0 et Gemini-Exp-1206, l’écart n’est que de 6 points Elo. Un tel résultat ne signifie pas qu’un modèle surpasse systématiquement l’autre à chaque requête. Il reflète plutôt une préférence globale observée dans les confrontations recensées par la plateforme.

Le top 10 des modèles d’IA en janvier 2025

Le tableau ci-dessous reprend les dix modèles mis en avant dans le classement de janvier 2025, avec leur score Elo. Les scores permettent surtout de comparer les modèles entre eux au sein de cette même Arena et à cette date précise.

Position dans la listeModèleScore Elo
1Gemini 2.01 380
2Gemini-Exp-12061 374
3ChatGPT 4o Latest1 365
4Gemini 2.0 Flash1 356
5o1-2024-12-171 351
6o1-preview1 335
7DeepSeek-V31 320
8Step-2-16K-Exp1 306
9o1-mini1 306
10Gemini 1.5 Pro1 303

Google place ainsi trois modèles dans ce top 10 : Gemini 2.0, Gemini-Exp-1206 et Gemini 2.0 Flash, auxquels s’ajoute Gemini 1.5 Pro en dixième position. OpenAI y compte également plusieurs représentants, dont ChatGPT 4o Latest et les différentes versions de la gamme o1.

Surtout, Google et OpenAI placent chacun trois modèles parmi les six premiers. Cette concentration ne doit pas masquer l’intérêt des écarts plus bas dans le tableau : DeepSeek-V3 se situe à 32 points d’o1-preview, tandis que Step-2-16K-Exp et o1-mini affichent exactement le même score de 1 306.

Google et OpenAI concentrent les premières places

La compétition des assistants conversationnels se joue aussi sur la fréquence des mises à jour. Les appellations « experimental », « preview » ou « latest » présentes dans le classement signalent que certains modèles sont des versions en test, des aperçus ou des variantes actualisées. Elles peuvent donc évoluer plus vite que des modèles présentés comme plus stables.

En janvier 2025, Google dispose d’un avantage au sommet du palmarès grâce à Gemini 2.0. OpenAI reste toutefois au contact, avec ChatGPT 4o Latest à la troisième place et o1-2024-12-17 à la cinquième. Cette présence de plusieurs variantes traduit deux approches complémentaires : proposer un modèle généraliste performant et développer des déclinaisons adaptées à des compromis différents entre qualité de réponse, rapidité ou ressources de calcul.

Pour le grand public, la leçon est simple : le nom d’un service ne suffit pas à juger sa performance. Deux personnes utilisant une même interface peuvent être servies par des versions de modèles différentes selon la fonction activée, le type de requête ou les choix de l’éditeur. Lire le nom exact du modèle testé reste donc essentiel lorsqu’on compare des résultats.

Classement Arena : ce qu’il indique et ce qu’il laisse de côté

Ce que le score Elo révèle

  • Il compare les préférences d’utilisateurs face à deux réponses anonymisées.
  • Il permet de situer les modèles les uns par rapport aux autres à une date donnée.
  • Il reflète des duels conversationnels variés plutôt qu’un unique examen.
  • Il rend visibles les évolutions de rang et l’arrivée de nouveaux concurrents.

Ce qu’il ne suffit pas à mesurer

  • Il ne garantit pas l’exactitude factuelle de chaque réponse.
  • Il n’évalue pas à lui seul le coût, la rapidité ou la confidentialité.
  • Il ne remplace pas un test sur des tâches professionnelles précises.
  • Il ne désigne pas automatiquement le meilleur modèle pour chaque langue ou usage.

DeepSeek et Step-2 confirment la montée des modèles chinois

L’un des enseignements les plus marquants de ce classement est la présence de deux modèles développés en Chine. DeepSeek-V3, avec 1 320 points Elo, intègre le top 10 après avoir été classé 11e le mois précédent. Sa progression le place devant Step-2-16K-Exp et o1-mini dans la liste publiée pour janvier.

Step-2-16K-Exp, développé par StepFun, atteint quant à lui 1 306 points. Il partage ce score avec o1-mini. L’arrivée de ces modèles parmi les références les mieux classées montre que la compétition ne se limite plus aux acteurs américains les plus connus, même si Google et OpenAI dominent encore le haut de tableau.

Cette diversité a une conséquence pratique : les entreprises, développeurs et particuliers disposent d’un éventail croissant de modèles à comparer. La performance conversationnelle compte, mais elle n’est qu’un critère parmi d’autres. Le coût d’utilisation, la vitesse, les langues prises en charge, les conditions d’accès, la protection des données et la possibilité d’intégrer l’outil dans un environnement de travail sont tout aussi déterminants dans un choix concret.

Mistral Large recule dans cette photographie du marché

Côté français, le classement est moins favorable en janvier 2025. Mistral-Large-2407 se situe à la 30e place, soit une baisse de cinq positions par rapport au relevé précédent cité dans la publication d’origine.

Ce résultat doit être interprété avec prudence. Il ne dit pas qu’un modèle français serait devenu inutilisable, ni qu’il serait moins pertinent dans tous les contextes. La Chatbot Arena mesure avant tout une performance comparative sur les conversations soumises à son système de vote. Or, le classement peut évoluer avec l’arrivée de nouvelles versions, l’augmentation du nombre de duels ou la nature des questions proposées par les utilisateurs.

Il illustre néanmoins la vitesse à laquelle le secteur progresse. Lorsqu’un modèle gagne plusieurs points ou perd quelques rangs, le changement peut venir autant de l’amélioration d’un concurrent que de l’apparition d’une nouvelle variante très performante. Dans un marché où les annonces se succèdent, les positions ne sont jamais acquises.

Comment fonctionne le score Elo de la Chatbot Arena ?

La Chatbot Arena est une plateforme développée par la Large Model Systems Organization, souvent désignée par l’acronyme LMSYS. Son principe est volontairement accessible : un utilisateur soumet une demande et reçoit deux réponses de modèles anonymisés. Il choisit celle qu’il estime la meilleure. Ce choix alimente ensuite le classement.

Le système de notation employé est le score Elo, historiquement utilisé aux échecs pour estimer le niveau relatif de joueurs qui s’affrontent. Appliqué aux modèles d’IA, il évolue au fil des duels : gagner face à un adversaire bien classé tend à peser davantage que gagner face à un adversaire moins bien classé. Le score n’est donc pas une note sur 100, ni un pourcentage de réponses exactes.

Ce que le score Elo mesure, et ce qu’il ne mesure pas

Le grand intérêt de cette méthode est de faire intervenir un jugement humain sur des réponses produites dans des conditions comparables. L’anonymisation vise à éviter qu’un utilisateur privilégie spontanément une marque connue. Elle rapproche l’évaluation d’une expérience d’usage réelle : la réponse paraît-elle plus claire, plus utile, mieux formulée ou plus pertinente face à la demande ?

Mais cette méthode comporte aussi des limites. Une préférence humaine peut dépendre de la formulation, de la longueur ou du ton d’une réponse. Une réponse convaincante n’est pas automatiquement exacte. Inversement, une réponse courte et prudente peut être moins séduisante, tout en étant plus fiable sur un sujet sensible.

Pour cette raison, les classements fondés sur des duels utilisateurs complètent utilement les benchmarks automatisés, sans les remplacer. Les tests automatisés peuvent mesurer une compétence ciblée, par exemple le raisonnement ou la programmation, tandis que l’Arena observe une préférence face à des requêtes variées. Les deux approches répondent à des questions différentes.

Quel modèle choisir selon son besoin ?

Le classement de janvier 2025 constitue un bon point de départ, pas une recommandation universelle. Pour une recherche d’informations, une synthèse, de la rédaction ou une assistance généraliste, les modèles situés en tête du tableau sont des candidats naturels à essayer. Cependant, il reste utile de soumettre exactement la même demande à plusieurs outils avant d’adopter l’un d’eux.

Voici quelques réflexes simples pour comparer des assistants sans se laisser guider uniquement par leur rang :

  • vérifier les faits importants dans des sources fiables, quelle que soit la qualité apparente de la réponse ;
  • tester des requêtes représentatives de son usage réel, plutôt que des questions générales ;
  • regarder le nom et la version exacte du modèle employé ;
  • éviter de transmettre des données personnelles, confidentielles ou professionnelles sensibles sans connaître les règles applicables ;
  • juger séparément la qualité, la rapidité et la facilité d’utilisation.

Un modèle peut être remarquable pour reformuler un texte et décevoir sur une question technique. Il peut aussi exceller en anglais, tout en donnant des réponses moins précises ou moins naturelles en français. La meilleure démarche consiste à transformer le classement en liste de modèles à évaluer, plutôt qu’en verdict définitif.

Ce qu’il faut surveiller en 2025

Le classement de janvier 2025 montre un marché dominé par Google et OpenAI, mais moins fermé qu’il ne pouvait l’être quelques mois auparavant. La progression de DeepSeek-V3 et la présence de Step-2-16K-Exp dans le top 10 indiquent que de nouveaux concurrents peuvent rapidement s’installer parmi les modèles les plus appréciés dans les duels conversationnels.

Les prochaines évolutions dépendront de plusieurs éléments : les nouvelles versions publiées par les éditeurs, leur capacité à améliorer les réponses sans alourdir les délais, et l’aptitude des plateformes de comparaison à distinguer une réponse agréable d’une réponse véritablement fiable. Le recul de Mistral-Large-2407 rappelle enfin qu’aucune position n’est durable dans ce domaine.

Pour suivre ces mouvements, il faut surtout observer les tendances sur plusieurs relevés, plutôt qu’un seul chiffre isolé. En janvier 2025, Gemini 2.0 mène la course avec 1 380 points Elo. Mais la proximité des scores au sommet et l’émergence de concurrents chinois rendent la suite du classement particulièrement ouverte.

Questions fréquentes

Quel est le meilleur modèle d’IA en janvier 2025 ?

Selon le classement de la Chatbot Arena cité en janvier 2025, Gemini 2.0 occupe la première place avec 1 380 points Elo. Il devance Gemini-Exp-1206, à 1 374 points, et ChatGPT 4o Latest, à 1 365 points. Ce résultat mesure toutefois une préférence relative dans des duels conversationnels, pas une supériorité absolue dans toutes les tâches.

Que signifie le score Elo pour une intelligence artificielle ?

Le score Elo est une note relative issue de confrontations entre deux modèles. Sur la Chatbot Arena, des utilisateurs comparent des réponses anonymisées et choisissent celle qu’ils préfèrent. Ces votes font évoluer les scores, comme dans le classement de joueurs d’échecs. Un Elo élevé indique donc de bonnes performances comparatives dans ce cadre précis, et non un taux d’exactitude universel.

Quels modèles chinois figurent dans le top 10 des IA en janvier 2025 ?

Deux modèles chinois apparaissent dans la liste de janvier 2025 : DeepSeek-V3 et Step-2-16K-Exp, développé par StepFun. DeepSeek-V3 obtient 1 320 points Elo et entre dans le top 10 après avoir été 11e le mois précédent. Step-2-16K-Exp affiche 1 306 points, à égalité de score avec o1-mini.

Pourquoi Google et OpenAI dominent-ils le classement des IA ?

Dans ce relevé, Google et OpenAI placent chacun trois modèles parmi les six premiers. Google est notamment porté par Gemini 2.0, premier avec 1 380 points Elo. OpenAI place ChatGPT 4o Latest au troisième rang, ainsi que plusieurs modèles o1. Cette domination concerne le classement de la Chatbot Arena en janvier 2025 et peut évoluer avec les nouvelles versions et les votes.

À quelle place se trouve Mistral AI dans le classement de janvier 2025 ?

Le modèle Mistral-Large-2407 se classe 30e dans le relevé cité pour janvier 2025. Il perd cinq places par rapport au mois précédent. Ce rang ne résume pas toutes ses qualités ni tous ses usages possibles : la Chatbot Arena compare surtout les préférences des utilisateurs dans des duels de réponses conversationnelles anonymisées.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. Chatbot Arena, classement comparatif de modèles conversationnelslmarena.ai