通义千问发布Qwen3.8
大模型开源领域的创新节奏再次刷新纪录。阿里通义千问团队近日正式开源了全新多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4 架构的早期预览版本,该模型在保持极低计算开销的同时展现出了越级的性能表现。
在核心架构与参数规模上,Qwen3.8-Flash-Next采用了高度稀疏的混合专家(MoE)设计。整个模型总参数量为 1250 亿,并额外搭配了 510 亿参数的N-gram嵌入表以及 40 亿参数的多token预测模块,但每个token实际激活的参数量仅有 60 亿。其整体拥有 48 层网络结构,MoE层集成了 512 个专家并通过top- 10 进行路由分配。
技术创新方面,该模型集成了多项前沿升级。它引入了GDN与QSA混合注意力机制,兼顾了长文本处理任务的运行效率与信息检索精度,将原生256K的上下文窗口通过YaRN技术成功扩展至1M。同时,通过引入 510 亿参数的N-gram嵌入,几乎不增加额外计算成本便大幅扩展了容量,且支持通过异步预取使其驻留于系统低速DRAM内存中;此外还采用了门控残差连接(GR)以及微块粒度选择上下文的稀疏注意力设计。
在实际性能与成本表现上,该模型交出了亮眼答卷。受益于极致的稀疏化设计,其训练成本仅为上一代Qwen3.7-Plus的九分之一,但在代码编写与办公等核心任务上的表现实现了显著跃升。多方评测与最新报道确认,凭借仅6B的激活参数,该模型在能力上成功击败了Claude Opus 4.6 Max等顶尖旗舰。
在生态部署与开源节奏上,SGLang在模型发布首日便提供了Day- 0 级别的直接支持,开发者可以通过开源渠道获取模型权重并在本地或集群环境中高效部署。这一系列底层架构的创新与突破,不仅为全球开源社区提供了前沿的技术探索样本,也进一步推动了高性能AI大模型向低成本、高效率的规模化落地演进。
