Qwen3.8-Flash-Next:阿里巴巴发布模型,预告Qwen4架构方向
阿里巴巴通义千问团队发布Qwen3.8-Flash-Next,这是一款拥有1250亿参数、每个词元仅激活60亿参数的MoE模型,训练成本约为上一代模型的九分之一。

阿里巴巴通义千问(Qwen)团队于2026年8月26日发布了Qwen3.8-Flash-Next,这是一款开放权重的多模态混合专家(MoE)模型。据MarkTechPost报道,该模型的设计目标是「按词元成本」优化。这一检查点的主干拥有1250亿参数,但每个词元仅激活60亿参数——Qwen团队将这一比例定位为Qwen4架构的早期预览,据MarkTechPost介绍,这与Qwen3-Next在Qwen3.5发布前所扮演的角色相同。
据MarkTechPost报道,若加上主干之外的一张510亿参数的N-gram嵌入表和一个40亿参数的多词元预测模块,磁盘上的参数总量将达到1800亿。The Decoder将N-gram层描述为一种「短语词典」,它把常见词组作为独立条目存储,并可以放在普通系统内存中而非GPU显存里,Qwen称这样做的额外成本「相对较低」。
四项改动支撑此次发布
MarkTechPost指出,Qwen3.8-Flash-Next背后有四项架构改动。第一项是混合注意力方案:每四层中有三层运行Gated DeltaNet——一种将历史信息压缩进固定大小循环状态的线性注意力机制,第四层则运行Qwen稀疏注意力(QSA),通过轻量级索引器以微块粒度选择上下文。在模型的48层中,这一模式以「3层Gated DeltaNet加1层QSA」为一组重复12次,QSA的预算上限为512个块或2048个词元。
第二项改动是Gated Residual,它将残差流拓宽为四条并行分支,由逐元素读门和每条分支各自的写门控制,瓶颈秩为320。第三项就是上文所述的N-gram嵌入。第四项是训练方案:据MarkTechPost报道,该方案在特定权重类别上同时使用Muon优化器与AdamW,取消了批量大小预热阶段,并重新拟合了模型的缩放定律。混合专家层本身在512个专家中路由,每个词元激活10个路由专家加1个共享专家,专家中间维度为640。
- 主干共1250亿参数,每个词元仅激活60亿
- 510亿参数的N-gram嵌入表加40亿参数的多词元预测模块——磁盘总参数量达1800亿
- MoE层共512个专家,每个词元激活10个路由专家加1个共享专家
- 原生上下文窗口26.2144万词元,通过YaRN可扩展至100万词元
- FP8检查点:172.78 GiB;BF16检查点:335.28 GiB
跑分领先更大规模的对手——但并非全面领先
在智能体编程方面,据The Decoder报道,Qwen称Flash-Next在DeepSWE 1.1上得分58.7,在SWE-bench Pro上得分62.5,均领先DeepSeek-V4-Flash和Claude Opus 4.6(Max)。在办公与专业工作流任务上,差距进一步拉大:据The Decoder报道,Flash-Next在CoWorkBench上得分73.9,而DeepSeek-V4-Flash仅为45.1;在JobBench上得分55.7,几乎是Qwen3.7-Plus(27.6分)的两倍。据The Decoder对阿里巴巴自有基准对比的报道,Qwen3.7-Plus本身共有3970亿参数,每个词元激活170亿——几乎是Flash-Next激活参数量的三倍,而DeepSeek-V4-Flash共有2840亿参数,激活130亿。
该模型并非全面领先。MarkTechPost指出,在Humanity's Last Exam测试中,Claude Opus 4.6(Max)以40.0分领先Qwen的35.9分;在NL2Repo-Bench测试中,DeepSeek-V4-Flash-0731以54.2分领先48.1分。The Decoder补充说,相比之下,Claude Opus 4.6是一款「较旧」的Anthropic模型,发布于2026年2月,并提醒读者跑分成绩与实际表现可能存在差异。
训练成本降至九分之一,价格仅为一小部分
据MarkTechPost报道,Qwen称Flash-Next的训练成本约为Qwen3.7-Plus的九分之一。在推理服务速度上,两份资料给出的具体数字并不一致:MarkTechPost报道称,Qwen自己的公告称QSA内核在100万词元规模下,预填充速度最高提升7.6倍,解码速度最高提升4.9倍;而同一篇MarkTechPost文章中引用的SGLang和vLLM独立部署方案则分别给出10.2倍和6.6倍的提升幅度——MarkTechPost本身指出了这一差异,并建议读者「在获得独立测量结果之前,将这一区间视为厂商自述数据」。据MarkTechPost报道,Qwen还宣称,在前缀缓存命中率达90%的情况下,其预填充吞吐量是Qwen3.7-Plus的8.6倍。
在定价方面,The Decoder报道称,生产版本Qwen3.8-Flash已通过QwenCloud提供,输入词元每百万计0.16美元,输出词元每百万计0.47美元,相应API预计不久后上线。The Decoder指出,这一价格约为阿里巴巴现有旗舰模型Qwen3.8-Max的十二分之一——该旗舰模型于8月初发布,对标Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol;尽管在阿里巴巴自身的基准测试中,Flash-Next的表现略逊于这款旗舰模型。
可以部署,但不能在工作站上运行
尽管激活参数量效率较高,Flash-Next并不是普通开发者可以随手运行的模型。MarkTechPost报道称,FP8检查点体积达172.78 GiB,BF16版本则达335.28 GiB;根据vLLM自身的部署方案,在英伟达GB300上,经验证的最低FP8配置需要两块GPU进行张量并行,官方建议使用四块;而在8×H200节点上,则需要混合张量-专家并行配置,因为标准的8路张量并行与该检查点128宽的量化块并不兼容。MarkTechPost指出,稀疏激活降低了计算量,但没有降低存储需求。该模型采用阿里巴巴自有的qwen-community-1.0许可证发布,而非Apache 2.0协议,MarkTechPost补充说,这意味着商用前需要仔细核查许可条款。
阿里巴巴借Flash-Next下的这步棋,赌的是结构而不只是数字:在通过混合专家路由和辅助查找表让总容量不断增长的同时,保持较低的激活参数量,可以让模型逼近体量大得多、成本高得多的系统的推理质量,同时把每次请求的计算成本压缩到一小部分。这也是为什么Qwen将此次发布定位为「架构预览」而非成品——它是在一个规模更小的模型上,为阿里巴巴计划推广到整个Qwen4系列的构想所做的一次公开彩排。
对于正在权衡是采用Claude、GPT等西方专有API,还是转向中国开放权重模型的企业而言,Qwen3.8-Flash-Next让这道选择题更加清晰:一款开放权重模型,价格只是顶尖专有模型的一小部分,在代码和办公自动化跑分上追平甚至超过体量大得多的系统,如今既可以自行部署,也可以通过QwenCloud按需租用——不过它仍然需要多GPU服务器而非一台普通电脑才能运行,而且其许可证并非Apache协议,任何商用部署前都值得仔细阅读条款。



