Qwen3.8-Flash-Next : Alibaba dévoile un aperçu de l'architecture Qwen4
L'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next, un modèle MoE de 125 milliards de paramètres qui n'en active que 6 milliards par jeton, entraîné pour un neuvième du coût de son prédécesseur.

L'équipe Qwen d'Alibaba a publié le 26 août 2026 Qwen3.8-Flash-Next, un modèle multimodal à mélange d'experts (MoE) en poids ouverts que MarkTechPost décrit comme conçu « pour le coût par jeton ». Le point de contrôle repose sur un socle de 125 milliards de paramètres, dont seuls 6 milliards s'activent pour chaque jeton — un ratio que l'équipe Qwen présente comme un aperçu précoce de l'architecture qui sous-tendra Qwen4, le même rôle que Qwen3-Next a joué avant Qwen3.5, selon MarkTechPost.
Le nombre total de paramètres sur disque atteint 180 milliards une fois ajoutés au socle principal une table d'embeddings N-gram de 51 milliards de paramètres et un module de prédiction multi-jeton de 4 milliards de paramètres, rapporte MarkTechPost. The Decoder décrit la couche N-gram comme une sorte de « dictionnaire de locutions » qui stocke des groupes de mots courants sous forme d'entrées autonomes et peut résider dans la mémoire vive classique plutôt que sur le GPU, à ce que Qwen qualifie de « coût supplémentaire relativement faible ».
Quatre changements portent cette version
MarkTechPost identifie quatre changements architecturaux derrière Qwen3.8-Flash-Next. Le premier est un schéma d'attention hybride : trois couches sur quatre exécutent Gated DeltaNet, un mécanisme d'attention linéaire qui compresse l'historique dans un état récurrent de taille fixe, tandis que la quatrième couche exécute Qwen Sparse Attention (QSA), qui sélectionne le contexte à la granularité du micro-bloc via un indexeur léger. Sur les 48 couches du modèle, le motif se répète en 12 blocs de trois couches Gated DeltaNet suivies d'une couche QSA, avec un budget QSA plafonné à 512 blocs ou 2 048 jetons.
Le deuxième changement, Gated Residual, élargit le flux résiduel en quatre branches parallèles régies par une porte de lecture élément par élément et une porte d'écriture par branche, au rang de goulot d'étranglement 320. Le troisième est l'embedding N-gram décrit plus haut. Le quatrième est une recette d'entraînement qui applique l'optimiseur Muon aux côtés d'AdamW à des catégories de poids spécifiques, supprime l'échauffement de la taille de lot et réajuste les lois d'échelle du modèle, rapporte MarkTechPost. La couche de mélange d'experts route elle-même parmi 512 experts, en activant 10 experts routés plus un expert partagé par jeton, à une dimension intermédiaire d'expert de 640.
- 125 milliards de paramètres au total dans le socle principal, dont seulement 6 milliards actifs par jeton
- Table d'embeddings N-gram de 51 milliards de paramètres plus module de prédiction multi-jeton de 4 milliards — 180 milliards de paramètres au total sur disque
- 512 experts dans la couche MoE, dont 10 routés plus 1 partagé actifs par jeton
- Fenêtre de contexte native de 262 144 jetons, extensible à 1 million de jetons via YaRN
- Point de contrôle FP8 : 172,78 Gio ; point de contrôle BF16 : 335,28 Gio
Des scores devant des rivaux plus lourds — pas partout
Sur le code agentique, Qwen rapporte que Flash-Next obtient 58,7 sur DeepSWE 1.1 et 62,5 sur SWE-bench Pro, devançant DeepSeek-V4-Flash et Claude Opus 4.6 (Max), selon The Decoder. Sur les tâches bureautiques et professionnelles, l'écart se creuse encore : Flash-Next affiche 73,9 sur CoWorkBench contre 45,1 pour DeepSeek-V4-Flash, et 55,7 sur JobBench, près du double des 27,6 de Qwen3.7-Plus, rapporte The Decoder. Qwen3.7-Plus compte lui-même 397 milliards de paramètres au total avec 17 milliards actifs par jeton — près de trois fois le nombre de paramètres actifs de Flash-Next — tandis que DeepSeek-V4-Flash compte 284 milliards de paramètres avec 13 milliards actifs, selon le compte-rendu par The Decoder des comparaisons de référence publiées par Alibaba.
Le modèle ne l'emporte pas partout. MarkTechPost note que Claude Opus 4.6 (Max) domine sur Humanity's Last Exam, avec 40,0 contre 35,9 pour Qwen, et que DeepSeek-V4-Flash-0731 domine NL2Repo-Bench, 54,2 contre 48,1. The Decoder ajoute que Claude Opus 4.6 est, en comparaison, un modèle Anthropic « plus ancien », datant de février 2026, et prévient que les scores de référence et les performances réelles peuvent diverger.
Un neuvième du coût d'entraînement, une fraction du prix
Qwen affirme que l'entraînement de Flash-Next a coûté environ un neuvième de celui de Qwen3.7-Plus, selon MarkTechPost. Sur la vitesse de service, les deux sources divergent sur les chiffres exacts : MarkTechPost rapporte que l'annonce de Qwen elle-même cite des accélérations du noyau QSA allant jusqu'à 7,6 fois en préremplissage et 4,9 fois en décodage à 1 million de jetons, tandis que des fiches de déploiement SGLang et vLLM distinctes, citées dans le même article de MarkTechPost, avancent respectivement 10,2 fois et 6,6 fois — un écart que MarkTechPost signale lui-même, invitant à « considérer cette fourchette comme une donnée du fournisseur tant qu'elle n'est pas mesurée indépendamment ». Qwen revendique aussi un débit de préremplissage 8,6 fois supérieur à celui de Qwen3.7-Plus à un taux de succès de cache de préfixe de 90 %, selon MarkTechPost.
Côté tarifs, The Decoder rapporte que la version de production, Qwen3.8-Flash, est disponible via QwenCloud à 0,16 dollar par million de jetons en entrée et 0,47 dollar par million de jetons en sortie, avec une API attendue prochainement. Cela le place à environ un douzième du prix du fleuron actuel d'Alibaba, Qwen3.8-Max, sorti début août et positionné face à Claude Opus 4.8, Gemini 3.1 Pro et GPT-5.6 Sol, note The Decoder — alors même que Flash-Next se situe juste en dessous de ce fleuron sur les propres références d'Alibaba.
Déployable, mais pas sur un poste de travail
Malgré son nombre restreint de paramètres actifs, Flash-Next n'est pas un modèle qu'un développeur isolé peut faire tourner sans y penser. MarkTechPost rapporte que le point de contrôle FP8 pèse 172,78 Gio et la version BF16 335,28 Gio ; selon les fiches de déploiement de vLLM elles-mêmes, la configuration FP8 minimale validée exige deux GPU en parallélisme tensoriel sur le GB300 de Nvidia, quatre étant recommandés, tandis qu'un nœud à 8 GPU H200 nécessite une configuration mixte tenseur-expert car le parallélisme tensoriel standard à 8 voies est incompatible avec les blocs de quantification de 128 de large du point de contrôle. L'activation creuse réduit le calcul, note MarkTechPost, mais pas le stockage. Le modèle est distribué sous la licence maison qwen-community-1.0 d'Alibaba plutôt que sous Apache 2.0, ce qui signifie que les usages commerciaux doivent vérifier les conditions avant tout déploiement, ajoute MarkTechPost.
Le pari que fait Alibaba avec Flash-Next est structurel, pas seulement chiffré : maintenir un faible nombre de paramètres actifs pendant que la capacité totale croît via le routage du mélange d'experts et des tables de correspondance auxiliaires permet à un modèle d'approcher la qualité de raisonnement de systèmes bien plus grands et plus coûteux, tout en le servant pour une fraction du coût de calcul par requête. C'est pourquoi Qwen présente cette sortie non pas comme un produit fini mais comme un « aperçu d'architecture » — une répétition publique, sur un modèle plus petit, des idées qu'Alibaba prévoit de porter à l'échelle de toute la gamme Qwen4.
Pour les entreprises françaises et européennes qui hésitent entre bâtir sur des API propriétaires occidentales comme Claude ou GPT et des alternatives chinoises en poids ouverts, Qwen3.8-Flash-Next aiguise ce choix : un modèle en poids ouverts facturé à une fraction des tarifs propriétaires de pointe, qui égale ou dépasse des systèmes bien plus lourds sur les tests de code et d'automatisation bureautique, est désormais disponible à auto-héberger ou à louer via QwenCloud — même s'il exige toujours un serveur multi-GPU et non un simple poste de travail, et qu'il est distribué sous une licence non-Apache à lire attentivement avant tout déploiement commercial en Europe.
Sources
- Alibaba's Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 ArchitectureMarkTechPost · 26 août 2026
- Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"The Decoder · 26 août 2026



