阿里Qwen3.8
阿里云“魔搭ModelScope社区”近日迎来重要更新,阿里Qwen团队正式对外开放了Qwen3.8-2.4T-A95B模型的权重,这是Qwen-Max级别模型首次实现开源。这一举措标志着该团队在大型语言模型领域的技术积累向更广泛的开发者群体敞开了大门。
Qwen3.8-2.4T-A95B作为一款因果语言模型,其总参数规模达到2.4万亿级别,采用了先进的MoE稀疏架构设计。在具体实现上,该模型每个Token仅激活950亿参数,既保证了计算效率,又维持了强大的语言处理能力。其MoE层结构尤为独特,包含512个专家模块,每个Token处理时会动态选择10个路由专家,并额外激活1个共享专家,这种设计显著提升了模型的灵活性和适应性。
在上下文处理能力方面,该模型展现出显著优势。原生支持262,144个Token的上下文窗口,通过技术优化可扩展至1,010,000个Token,这一特性使其在处理长文本、复杂对话等场景时具有独特优势。模型训练过程中引入了多步MTP训练技术,进一步增强了其对语言结构的理解和生成能力。
技术架构上,Qwen3.8延续了Qwen3.5的混合架构设计,但在功能实现上进行了针对性强化。团队重点提升了模型在编程开发、办公自动化、科研分析以及长周期Agent任务等领域的端到端处理能力。通过优化模型结构和训练策略,使其能够更好地完成复杂任务的全流程处理。
官方公布的评测数据显示,该模型在多个专业领域表现出色。在编程Agent、通用Agent、专业工作处理以及长上下文理解等方向的评测中,与Opus 4.8、Fable 5、GPT 5.6 Sol等国际主流模型相比,在PaperBench、IFBench等专业基准测试中取得了优异成绩,特别是在代码生成和科研文献处理等任务中展现出明显优势。
模型开源后,开发者将获得更大的技术自主权。基于开放的模型权重,研究人员可以进行模型复现、结构分析以及性能优化,企业开发者则能够开展微调训练和二次开发,快速构建符合特定业务需求的定制化应用。值得注意的是,官方推出的云端版Qwen3.8-Max在开源模型基础上,额外增加了多项适用于生产环境的功能模块,为企业级应用提供了更完整的解决方案。
