Qwen3 d’Alibaba : un modèle ouvert qui élève le niveau du raisonnement
Alibaba met en avant Qwen3-235B-A22B-Thinking-2507, un grand modèle ouvert conçu pour le raisonnement, les mathématiques et le code. Avec 235 milliards de paramètres, dont environ 22 milliards activés à la fois, il affiche des scores élevés sur plusieurs tests. Son architecture et son accès ouvert intéressent directement développeurs et chercheurs.

À la date du 27 juillet 2025, la compétition entre grands modèles d’intelligence artificielle ne se joue plus seulement entre les laboratoires qui commercialisent leurs assistants par abonnement ou API. Avec Qwen3-235B-A22B-Thinking-2507, l’équipe Qwen d’Alibaba met à disposition un modèle ouvert qui vise explicitement les tâches où le raisonnement compte le plus : démonstrations mathématiques, logique, problèmes scientifiques et programmation avancée.
Son nom, peu mémorisable pour le grand public, résume déjà son ambition technique. Qwen3 appartient à la troisième génération de la famille de modèles d’Alibaba. Les nombres 235B et A22B signalent une très grande capacité totale, tout en indiquant qu’une partie plus réduite du réseau est sollicitée à chaque étape de calcul. Sur plusieurs bancs d’essai suivis par le secteur, le modèle affiche des résultats suffisamment élevés pour placer les modèles ouverts au cœur de la discussion sur les usages professionnels de l’IA.
Des scores élevés en mathématiques, code et préférences humaines
Les performances communiquées pour Qwen3-235B-A22B-Thinking-2507 portent sur trois types d’évaluation. Elles ne mesurent pas exactement la même compétence : l’une met l’accent sur les mathématiques, une autre sur la capacité à produire du code, la troisième sur la qualité perçue des réponses dans des comparaisons.
| Banc d’essai | Domaine évalué | Score annoncé pour Qwen3 |
|---|---|---|
| AIME25 | Raisonnement mathématique | 92,3 |
| LiveCodeBench v6 | Programmation et résolution de problèmes de code | 74,1 |
| Arena-Hard v2 | Qualité générale des réponses et alignement avec les préférences humaines | 79,7 |
Le score de 92,3 sur AIME25 est particulièrement significatif dans un domaine où les modèles doivent enchaîner des étapes logiques plutôt que retrouver simplement une formulation familière dans leurs données d’entraînement. Les problèmes de type AIME demandent habituellement de structurer un raisonnement, de manipuler des hypothèses et d’aboutir à une réponse précise.
Avec 74,1 sur LiveCodeBench v6, Qwen vise aussi les développeurs. Les tests de code cherchent moins à vérifier la récitation d’une syntaxe qu’à évaluer la capacité d’un modèle à comprendre une consigne, proposer un algorithme et produire une solution exploitable. Enfin, Arena-Hard v2 cherche à apprécier si les réponses paraissent pertinentes et utiles selon des critères proches des préférences humaines.
Ces chiffres doivent toutefois être lus avec méthode. Un benchmark est une photographie prise dans des conditions définies : version précise du modèle, consignes utilisées, longueur de réponse autorisée et protocole de notation. Un excellent résultat en mathématiques ne garantit pas, à lui seul, qu’un assistant sera infaillible sur un document juridique, une demande médicale ou une décision d’entreprise. Il indique en revanche que le modèle dispose de capacités de raisonnement et de génération de code sérieuses sur ces évaluations.
Pourquoi 235 milliards de paramètres ne signifie pas 235 milliards de calculs
Pour comprendre l’architecture de Qwen3, il faut distinguer les paramètres du modèle de ceux effectivement mobilisés lors d’une réponse. Les paramètres sont, en simplifiant, les très nombreux réglages numériques acquis pendant l’entraînement et qui permettent au modèle de reconnaître des régularités dans le langage, le code ou les raisonnements.
Qwen3-235B-A22B-Thinking-2507 compte 235 milliards de paramètres au total. Pourtant, il n’en active qu’environ 22 milliards pour un traitement donné. Cette différence s’explique par une architecture baptisée Mixture-of-Experts, souvent abrégée en MoE.
Dans un modèle dense traditionnel, tous les paramètres pertinents de chaque couche participent au calcul pour chaque élément de texte traité. Dans une architecture MoE, le réseau est divisé en plusieurs groupes spécialisés, appelés experts. Un mécanisme de routage sélectionne les experts les plus adaptés à l’élément en cours de traitement. L’idée est de réunir une grande capacité globale sans exiger que toute cette capacité soit calculée simultanément.
Cette organisation est particulièrement intéressante pour les modèles de très grande taille. Elle peut améliorer le rapport entre puissance de calcul et capacités obtenues, tout en permettant au modèle de bénéficier de spécialisations internes. Elle ne transforme pas pour autant Qwen3 en petit modèle : les poids de l’ensemble des experts doivent rester accessibles au système qui l’héberge, éventuellement répartis entre plusieurs machines.
Architecture MoE et modèle dense : la différence essentielle
Qwen3 avec Mixture-of-Experts
- 235 milliards de paramètres au total.
- Environ 22 milliards de paramètres activés pour un traitement donné.
- Des experts spécialisés sont sélectionnés par un mécanisme de routage.
- L’objectif est d’associer grande capacité globale et calcul plus ciblé.
- L’ensemble des experts doit néanmoins rester accessible à l’infrastructure.
Modèle dense de même taille
- 235 milliards de paramètres participent au calcul à chaque étape.
- Le traitement emprunte un chemin unique partagé par toutes les requêtes.
- La charge de calcul est plus élevée à taille totale équivalente.
- L’architecture est plus simple à décrire conceptuellement.
- Il ne bénéficie pas du même mécanisme de sélection d’experts.
Une fenêtre de contexte de 262 144 tokens, à quoi sert-elle ?
Autre caractéristique majeure, Qwen3 dispose d’une longueur de contexte native de 262 144 tokens. Le token est une unité de texte manipulée par les modèles de langage. Il ne correspond pas exactement à un mot : un mot courant peut être découpé en un ou plusieurs tokens, selon la langue et sa forme.
Cette fenêtre de contexte désigne la quantité de texte que le modèle peut prendre en compte dans une même requête. Une capacité de 262 144 tokens ouvre la voie à l’analyse de corpus bien plus vastes qu’une conversation ordinaire : longs rapports, documentation technique, ensemble de fichiers de code ou historique important d’échanges. L’intérêt n’est pas seulement de faire entrer plus de texte dans la requête, mais de permettre au modèle d’établir des liens entre des éléments éloignés dans ce texte.
Il faut néanmoins éviter de confondre cette capacité avec une mémoire humaine. Le modèle n’acquiert pas une connaissance durable de chaque document qu’on lui transmet. Il traite le contenu placé dans son contexte au moment de la requête. La qualité de la réponse dépendra encore de la clarté des documents fournis, de la précision de la question et de la capacité du modèle à retrouver les informations utiles au sein de cet ensemble.
Comment les développeurs peuvent-ils utiliser Qwen3 ?
L’équipe Qwen rend le modèle disponible sur Hugging Face, plateforme largement utilisée pour distribuer des modèles, leurs fichiers et leur documentation. Cette disponibilité permet aux équipes techniques de l’évaluer, de l’intégrer à leur infrastructure ou de l’adapter à leurs propres cas d’usage, plutôt que de dépendre uniquement d’un service distant fermé.
Pour le déploiement, Alibaba met notamment en avant sglang et vLLM. Ces outils servent à faire tourner un modèle sur une infrastructure de calcul et à exposer ses capacités sous la forme d’un point d’accès API personnalisé. Concrètement, une entreprise peut ainsi connecter le modèle à une interface interne, à un outil de développement, à une base documentaire ou à un flux automatisé.
Le cadre Qwen-Agent est destiné à exploiter les capacités d’appel d’outils du modèle. Un agent ne se limite pas à produire une réponse en texte : il peut, lorsqu’il est configuré à cette fin, choisir d’appeler un outil mis à sa disposition, comme une recherche dans une base de données, un service interne ou un programme. Le modèle conserve toutefois un rôle de chef d’orchestre linguistique. Les résultats restent tributaires des outils autorisés, des permissions accordées et des contrôles mis en place par les développeurs.
L’accès ouvert est donc un avantage important, mais il suppose des moyens. Héberger un modèle de cette taille nécessite une infrastructure adaptée, des compétences d’exploitation et une attention particulière aux données envoyées au modèle. Pour certaines organisations, une API gérée restera plus simple. Pour d’autres, le contrôle de l’hébergement, de la personnalisation et des flux de données pourra justifier l’effort technique.
Des réponses longues pour laisser place au raisonnement
L’équipe Qwen formule également des recommandations précises sur la longueur des réponses. Pour les tâches standard, elle conseille une limite de sortie d’environ 32 768 tokens. Pour les défis les plus complexes, cette limite peut être portée à 81 920 tokens.
L’enjeu est simple : un modèle orienté vers le raisonnement a parfois besoin de davantage d’espace pour explorer un problème, effectuer des vérifications intermédiaires et construire une réponse structurée. Une sortie trop courte peut l’obliger à conclure avant d’avoir développé toutes les étapes nécessaires. À l’inverse, demander systématiquement des réponses très longues n’est pas toujours pertinent. Cela augmente le temps de génération et peut noyer la réponse finale sous des développements inutiles.
Les consignes jouent aussi un rôle décisif. Pour un problème de mathématiques ou de logique, demander explicitement au modèle de « raisonner étape par étape » peut encourager une démarche plus organisée. Mais cette formule ne garantit pas l’exactitude. Dans les domaines à fort enjeu, il reste indispensable de vérifier les calculs, de tester le code généré et de soumettre les conclusions importantes à l’examen d’un professionnel compétent.
Ce que l’ouverture du modèle change, et ce qu’elle ne résout pas
Le positionnement ouvert de Qwen3 modifie l’équilibre du marché. Les développeurs, chercheurs et entreprises peuvent étudier le modèle, le faire tourner dans leur environnement et construire des services qui ne reposent pas exclusivement sur les grands fournisseurs de modèles propriétaires. Pour les acteurs soucieux de maîtriser leur chaîne technique, cette possibilité a une valeur stratégique.
L’ouverture stimule aussi l’expérimentation. Une équipe peut tester le modèle avec ses propres données, comparer ses résultats à ceux d’autres modèles, mesurer les erreurs et bâtir des garde-fous adaptés à son domaine. Cette liberté contribue à accélérer la diffusion de techniques telles que les architectures MoE, les grands contextes et les agents capables d’appeler des outils.
Elle ne supprime pas les difficultés fondamentales des modèles de langage. Qwen3 peut se tromper, inventer une référence, mal interpréter une instruction ou proposer un code qui semble convaincant mais échoue à l’exécution. La sécurité d’un système dépend autant du modèle que de son intégration : filtrage des entrées, contrôle des droits, validation des sorties et supervision humaine demeurent nécessaires.
Ce qu’il faut surveiller
La sortie de Qwen3-235B-A22B-Thinking-2507 illustre une évolution importante : les meilleurs résultats de raisonnement ne sont plus l’apanage exclusif des modèles accessibles uniquement par des services propriétaires. Les performances annoncées par Alibaba sur AIME25, LiveCodeBench v6 et Arena-Hard v2 font de ce modèle un candidat sérieux pour les équipes qui veulent évaluer des alternatives ouvertes dans les mathématiques, le code et les workflows agentiques.
La prochaine étape se jouera moins dans un score isolé que dans la capacité des entreprises et de la communauté technique à transformer ces résultats en usages fiables. Il faudra suivre les tests indépendants, la facilité réelle de déploiement, les besoins matériels, la qualité des intégrations avec les outils et, surtout, le comportement du modèle face à des tâches concrètes et imparfaitement formulées. C’est à cette condition qu’un modèle performant en laboratoire pourra devenir un outil durable au quotidien.
Questions fréquentes
Qu’est-ce que Qwen3-235B-A22B-Thinking-2507 ?
Qwen3-235B-A22B-Thinking-2507 est un modèle de langage ouvert développé par l’équipe Qwen d’Alibaba. Il est conçu pour les tâches demandant du raisonnement, notamment les mathématiques, la logique, les problèmes scientifiques et la programmation. Son nom indique qu’il possède 235 milliards de paramètres au total, dont environ 22 milliards sont activés pour un traitement donné.
Quels scores Qwen3 obtient-il sur les benchmarks ?
Selon les résultats mis en avant par l’équipe Qwen, le modèle obtient 92,3 sur AIME25 pour le raisonnement mathématique, 74,1 sur LiveCodeBench v6 pour le code et 79,7 sur Arena-Hard v2 pour la qualité générale des réponses. Ces scores sont élevés, mais ils doivent être complétés par des tests sur des usages concrets.
Que signifie l’architecture Mixture-of-Experts de Qwen3 ?
La Mixture-of-Experts, ou MoE, divise le modèle en groupes de paramètres spécialisés appelés experts. Au lieu de solliciter les 235 milliards de paramètres à chaque étape, Qwen3 en active environ 22 milliards selon le traitement à effectuer. Cette approche cherche à conserver une grande capacité tout en ciblant davantage les calculs.
Quelle est la longueur de contexte de Qwen3 ?
Qwen3 accepte nativement jusqu’à 262 144 tokens de contexte. Cette capacité lui permet de traiter de très grands volumes de texte dans une même requête, comme une documentation technique, un long rapport ou plusieurs fichiers de code. Un token n’est pas exactement un mot, mais une unité de texte utilisée par le modèle.
Comment déployer Qwen3 dans un projet ?
Le modèle est disponible sur Hugging Face. Les développeurs peuvent s’appuyer sur des outils comme sglang ou vLLM pour l’héberger et créer un point d’accès API adapté à leurs applications. Le cadre Qwen-Agent permet en outre d’exploiter l’appel d’outils, à condition de prévoir les autorisations, contrôles et validations nécessaires.
Sources
Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.
- Hugging Face, page du modèle Qwen3-235B-A22B-Thinking-2507huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507
- Dépôt officiel Qwen3 sur GitHubgithub.com/QwenLM/Qwen3
- Dépôt officiel Qwen-Agent sur GitHubgithub.com/QwenLM/Qwen-Agent
- Documentation officielle de vLLMdocs.vllm.ai



