Classement LMArena : Claude, Gemini et GPT en septembre 2025
En septembre 2025, Claude Opus 4.1 prend la tête de LMArena devant Gemini 2.5 Pro et GPT-4o. Mais les leaders changent selon la tâche : GPT-5 domine le développement web, Seedream la création d’images et Grok-4 la recherche web.

Le meilleur modèle d’intelligence artificielle n’est pas nécessairement le même selon que l’on écrit un texte, que l’on construit un site web, que l’on analyse une image ou que l’on cherche des informations en ligne. Le relevé LMArena de septembre 2025 le montre clairement : Claude Opus 4.1 mène le classement général, mais Gemini 2.5 Pro, GPT-5, Seedream et Grok-4 prennent l’avantage dans des domaines précis.
Ce panorama doit aussi être lu avec une précaution importante. L’article d’archive annonce un « top 20 », mais ne reproduit pas les vingt positions ni les scores complets. Il permet en revanche d’identifier les principales places du classement général et les vainqueurs de plusieurs catégories. C’est déjà suffisant pour comprendre une tendance majeure de l’année 2025 : la compétition ne se résume plus à un seul modèle polyvalent, elle se joue aussi sur des usages très concrets.
Le podium général de LMArena en septembre 2025
À la première place du classement général cité pour septembre 2025 figure Claude Opus 4.1, le modèle d’Anthropic. Il se distingue par ses résultats dans plusieurs types de requêtes, notamment l’écriture créative et le raisonnement mathématique. Cette polyvalence explique sa position de tête dans une arène où les modèles doivent produire des réponses jugées préférables par des utilisateurs.
Gemini 2.5 Pro, développé par Google, obtient la deuxième place. Son rang confirme son positionnement parmi les modèles généralistes les plus solides du moment, capable de traiter des demandes variées et complexes. GPT-4o complète le podium à la troisième position dans le relevé présenté par l’archive, malgré des résultats décrits comme un peu moins convaincants en raisonnement mathématique.
Le cas de GPT-5 illustre la volatilité de ce type de palmarès. La publication d’origine indique qu’il avait auparavant occupé la troisième place avant de descendre au sixième rang, dans un contexte de critiques persistantes depuis son lancement. Ces critiques ne sont ni détaillées ni chiffrées dans l’archive, ce qui interdit d’en tirer un diagnostic technique définitif. Elles rappellent néanmoins qu’un nouveau modèle peut être évalué plus sévèrement lorsque les attentes sont élevées.
| Rang ou catégorie | Modèle mis en avant | Ce que rapporte le relevé de septembre 2025 |
|---|---|---|
| 1er au classement général | Claude Opus 4.1 | Premier de LMArena, avec de bons résultats sur des tâches variées |
| 2e au classement général | Gemini 2.5 Pro | Modèle généraliste particulièrement polyvalent |
| 3e au classement général | GPT-4o | Toujours très compétitif, avec une réserve évoquée sur le raisonnement mathématique |
| 6e au classement général | GPT-5 | En recul après avoir été classé troisième selon l’article d’archive |
| Top 10 général | OpenAI | Cinq modèles d’OpenAI y sont présents, sans détail de toutes les positions |
Que mesure réellement LMArena ?
LMArena évalue les modèles à travers des duels anonymisés. Le principe est simple : deux systèmes répondent au même prompt, c’est-à-dire à la même instruction, sans que la personne qui vote sache quel modèle a produit quelle réponse. L’utilisateur choisit ensuite la réponse qu’il estime meilleure.
Cette méthode a un intérêt évident. Elle limite l’influence de la réputation d’une marque ou d’un modèle. Un participant ne peut pas favoriser Anthropic, Google, OpenAI ou une autre entreprise simplement parce qu’il reconnaît son nom. En théorie, il juge le résultat affiché : sa clarté, son utilité, sa cohérence, sa précision apparente ou son adéquation avec la demande.
Les résultats sont ensuite agrégés avec un système de notation de type Elo. Un modèle gagne ou perd des points selon l’issue de ses confrontations. Plus il bat des adversaires bien classés, plus ses victoires pèsent dans son score. À l’inverse, une série de défaites face à des concurrents moins bien notés peut pénaliser sa position. Le tableau évolue donc au fil des nouveaux votes.
Ce mécanisme fournit une photographie dynamique des préférences observées dans l’arène. Il ne constitue pas pour autant un verdict absolu sur l’intelligence d’un modèle. Une bonne réponse dans un duel peut être élégante, concise ou convaincante sans être parfaite sur le fond. À l’inverse, une réponse rigoureuse mais plus technique peut parfois séduire moins facilement. Les résultats doivent donc être croisés avec les besoins réels : fiabilité des informations, confidentialité, coût, vitesse, outils disponibles et qualité dans une langue donnée.
Un classement général et des classements par usages
Classement général LMArena
- Mesure une préférence moyenne sur des duels couvrant plusieurs types de demandes.
- Place Claude Opus 4.1 devant Gemini 2.5 Pro et GPT-4o dans le relevé cité.
- Favorise les modèles capables de répondre correctement à des requêtes très diverses.
- Ne désigne pas automatiquement le meilleur outil pour une tâche professionnelle précise.
Classements spécialisés
- Évaluent séparément le texte, le développement web, l’image, l’analyse visuelle et la recherche web.
- Font émerger Gemini 2.5 Pro, GPT-5, Seedream et Grok-4 selon les domaines.
- Aident à choisir un modèle en fonction d’un usage concret plutôt que de sa seule notoriété.
- Restent dépendants des prompts, des comparaisons proposées et des votes recueillis.
Les meilleurs modèles changent selon la tâche demandée
Les classements spécialisés présentés dans l’archive révèlent une répartition des forces plus nuancée que le podium général. Un modèle qui n’est pas premier au classement global peut exceller sur une tâche professionnelle ou créative particulière.
Gemini 2.5 Pro en tête pour le texte et l’analyse d’images
Dans la catégorie de la génération de texte, Gemini 2.5 Pro est placé en première position, devant Claude Opus 4.1. Le classement valorise ici la capacité à produire des contenus répondant à des consignes complexes : rédaction, reformulation, explication, structuration d’idées ou écriture créative.
Gemini 2.5 Pro est également premier en analyse d’images. Cette tâche ne consiste pas à créer une image, mais à interpréter un contenu visuel fourni au modèle : décrire une scène, relever des éléments, répondre à des questions sur ce qui est visible ou mettre une image en relation avec un texte. L’archive indique qu’OpenAI occupe aussi plusieurs des places restantes dans le top 5 de cette catégorie.
GPT-5 reste la référence citée pour le développement web
La baisse de GPT-5 dans le classement général ne signifie donc pas qu’il serait en retrait partout. Dans la catégorie du développement web, il conserve la première place. Cette évaluation concerne les tâches liées à la création ou à la modification de sites et d’interfaces : production de code, compréhension d’une architecture web, correction d’erreurs ou application de contraintes de mise en page.
Les déclinaisons de Claude Opus 4.1 restent toutefois présentées comme de solides concurrentes dans cet usage. Pour une équipe technique, ce résultat invite à éviter les raccourcis : le modèle le mieux classé pour le dialogue généraliste n’est pas automatiquement celui qui offrira les meilleures réponses pour une base de code ou un prototype d’interface.
Seedream et Grok-4 prennent l’avantage dans deux usages ciblés
Pour la génération d’images, c’est Seedream, un modèle de ByteDance, qui arrive en tête devant Gemini 2.5 Flash. Google montre une forte présence dans cette catégorie puisque trois de ses modèles se situent parmi les quatre premiers du classement évoqué par l’archive. La génération d’images repose sur la transformation d’une instruction écrite en visuel, avec des critères qui peuvent inclure le respect de la demande, la composition et la cohérence des éléments produits.
Dans la recherche web, Grok-4 prend la première place, une catégorie auparavant dominée par o3-search. Cette spécialité doit être distinguée d’une simple réponse conversationnelle : un modèle de recherche web est attendu sur sa capacité à trouver, organiser et restituer des informations disponibles en ligne. Les modèles Sonar de Perplexity y connaissent une baisse notable et se retrouvent aux huitième et neuvième places selon le relevé.
| Usage évalué | Modèle en tête cité | Principaux éléments signalés |
|---|---|---|
| Génération de texte | Gemini 2.5 Pro | Claude Opus 4.1 le suit de près |
| Développement web | GPT-5 | Les variantes de Claude Opus 4.1 restent compétitives |
| Génération d’images | Seedream | Gemini 2.5 Flash est deuxième, Google place trois modèles dans le top 4 |
| Analyse d’images | Gemini 2.5 Pro | OpenAI occupe plusieurs autres places du top 5 |
| Recherche web | Grok-4 | o3-search perd la tête, Sonar est huitième et neuvième |
Pourquoi la présence d’OpenAI reste centrale malgré le recul de GPT-5
Le sixième rang de GPT-5 ne résume pas à lui seul la place d’OpenAI dans ce classement. L’archive précise que l’entreprise place cinq de ses modèles dans le top 10. Cette densité témoigne d’un portefeuille étendu, avec plusieurs modèles et variantes susceptibles d’être adaptés à des tâches différentes.
C’est un point important pour lire les classements de modèles. Une entreprise peut perdre la première place avec un produit très médiatisé tout en restant très présente dans les usages réels grâce à d’autres versions, à des modèles spécialisés ou à des outils intégrés. Dans le cas d’OpenAI, GPT-4o demeure troisième du classement général présenté, tandis que GPT-5 conserve son avance en développement web.
La même logique vaut pour les concurrents. Anthropic obtient la tête générale avec Claude Opus 4.1. Google cumule la deuxième place générale avec Gemini 2.5 Pro, le leadership en texte et en analyse d’images, ainsi qu’une présence forte en génération d’images. ByteDance et xAI s’imposent, de leur côté, sur des domaines plus ciblés avec Seedream et Grok-4.
Comment utiliser ce classement sans se tromper de modèle
Pour choisir un outil d’IA, la première question ne devrait pas être « quel modèle est numéro un ? », mais « quelle tâche dois-je accomplir ? ». Une personne qui cherche à rédiger et synthétiser de longs documents n’a pas nécessairement les mêmes critères qu’un développeur web, un créatif ou un utilisateur qui souhaite analyser des images.
Le classement de septembre 2025 permet de dégager quelques repères pratiques :
- pour un usage généraliste, Claude Opus 4.1, Gemini 2.5 Pro et GPT-4o forment le podium signalé par l’archive ;
- pour la rédaction, Gemini 2.5 Pro est le modèle le mieux placé dans la catégorie dédiée ;
- pour des tâches de développement web, GPT-5 est le premier modèle cité ;
- pour créer des images, Seedream est en tête du classement spécialisé ;
- pour la recherche web, Grok-4 devance les autres modèles mentionnés.
Ces indications ne dispensent pas d’un essai sur ses propres cas d’usage. Une entreprise devra notamment vérifier la gestion des données, les modalités d’accès, la compatibilité avec ses outils et la régularité des réponses. Un étudiant, un indépendant ou un particulier pourra privilégier la simplicité d’emploi, la qualité en français ou les fonctionnalités multimodales. Le résultat d’un duel LMArena est un signal utile, pas une garantie universelle.
Ce qu’il faut surveiller après ce classement
Le relevé de septembre 2025 confirme que la hiérarchie des modèles évolue vite et que les spécialistes peuvent rivaliser avec les généralistes. La première place de Claude Opus 4.1, les performances transversales de Gemini 2.5 Pro, la résistance de GPT-5 en développement web, l’avance de Seedream en image et celle de Grok-4 en recherche web dessinent un marché moins concentré autour d’un unique champion.
Il faudra surtout observer la stabilité de ces positions au fil des duels anonymisés. Une progression durable suppose qu’un modèle reste performant sur de nombreux prompts et face à des adversaires variés. Il faudra aussi suivre l’écart entre les palmarès publics et l’expérience quotidienne des utilisateurs, car la valeur d’une IA dépend autant de la qualité de ses réponses que de sa capacité à s’insérer de façon fiable dans un usage concret.
Questions fréquentes
Quel est le meilleur modèle d’IA selon LMArena en septembre 2025 ?
Dans le classement général rapporté pour septembre 2025, Claude Opus 4.1 occupe la première place. Gemini 2.5 Pro est deuxième et GPT-4o troisième. Ce résultat reflète des duels anonymisés entre modèles, jugés par des utilisateurs, et ne signifie pas qu’un seul modèle est le meilleur pour tous les usages.
Pourquoi GPT-5 est-il seulement sixième dans le classement général ?
L’article d’archive indique que GPT-5 est descendu à la sixième place après avoir précédemment occupé le troisième rang. Il évoque des critiques persistantes depuis son lancement, sans en détailler les motifs ni les résultats chiffrés. Cette baisse générale n’empêche pas GPT-5 de rester premier dans la catégorie du développement web.
Quel modèle choisir pour écrire un texte, coder ou créer une image ?
Selon les catégories rapportées par LMArena en septembre 2025, Gemini 2.5 Pro est premier en génération de texte, GPT-5 en développement web et Seedream de ByteDance en génération d’images. Pour analyser une image, Gemini 2.5 Pro est également en tête. Le bon choix dépend toutefois de la tâche, des données traitées et de l’outil utilisé.
Comment fonctionne le classement LMArena ?
LMArena confronte deux modèles sur le même prompt, sans révéler leur identité à la personne qui vote. Celle-ci sélectionne la réponse qu’elle préfère. Les résultats sont ensuite intégrés dans une notation de type Elo, qui évolue selon les victoires et défaites obtenues dans ces duels. Le classement est donc dynamique et fondé sur des préférences observées.
Où trouver les vingt modèles du top LMArena de septembre 2025 ?
L’article d’archive annonce un top 20, mais ne fournit pas la liste complète des vingt modèles ni leurs scores détaillés. Il précise les trois premières places, le sixième rang de GPT-5 et plusieurs résultats par catégorie. Pour consulter un tableau actualisé, il faut se référer directement à l’interface de classement de LMArena.
Sources
Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.
- LMArena, plateforme de duels anonymisés et de classements de modèleslmarena.ai



