阿里千问开源Max级大模型,性能卓越,大模型智能体能力比拼升级
阿里千问大模型团队近日宣布,正式开放Qwen3.8-2.4T-A95B模型权重,这是该系列首次将Max级别旗舰模型对外开源。作为Qwen3.8-Max的底层版本,Qwen3.8-2.4T-A95B不仅支持视觉输入功能,还具备百万级上下文处理能力,并内置官方工具集,无需额外配置即可直接使用。
该模型总参数规模达2.4万亿,每个Token激活950亿参数,原生支持262144 Token上下文窗口,并可扩展至101万Token。技术架构基于Qwen3.5优化,在编程、办公自动化、科研任务及长周期智能体场景中实现显著性能提升。部署方面,模型兼容SGLang、vLLM和TokenSpeed等主流推理引擎,但正式运行时需采用针对Qwen3.8优化的最新框架配置,并根据硬件环境选择并行策略。
在运行模式上,Qwen3.8系列默认启用思考模式,生成最终回答前会输出带省略号标记的中间推理过程。值得注意的是,此次开源的2.4T版本未提供关闭思考模式的选项。针对硬件资源限制,开源社区Unsloth AI通过动态1-bit分层量化技术,将模型体积从原始的4.9TB压缩至397GB,存储需求减少91%。配合其开发的桌面工具,用户只需设备内存与显存总和超过410GB即可本地运行。
基准测试数据显示,Qwen3.8-Max在多项核心指标中表现突出。在论文复现基准PaperBench中取得93.0分,超越GPT-5.6 Sol、Fable 5等竞品;操作系统操作评估OSWorld-Verified中以86.1分领跑;参数化CAD任务测试得分91.5,同样位居首位。不过在TerminalBench 2.1终端操作测试中,其86.6分略低于GPT-5.6 Sol的88.8分;代码开发基准SWE-bench Pro得分为67.7,落后于Fable 5的80.0分;长视频理解测试VideoMME v2中68.3分的表现也不及GPT-5.6 Sol的71.1分。
实际应用场景测试中,Qwen3.8-Max展现了强大的自主工作能力。在持续16天的编程任务中,模型自主构建了自进化开发框架,完成需求收集、任务分配、代码生成、测试验证及错误修复的全流程。其他测试包括独立复现并改进学术论文、参加算法竞赛,以及在2000轮交互中运营虚拟电商企业,均验证了其处理跨时长复杂任务的能力。
商业应用方面,Qwen3.8-Max的API定价策略区分国内外市场:国内输入每百万Tokens收费12元,输出36元,隐式缓存命中费用1.5元;海外版本输入2美元,输出6美元,缓存命中费用0.25美元。对比市场同类产品,其定价处于中等水平。
此次开源事件恰逢全球大模型竞争升级。同期马斯克团队发布Grok 4.6系列,其中高端版本在智能体编程测试中与GPT-5.6 Sol Max、Claude Fable 5 Max持平;DeepSeek-V4-Pro正式版上线后,在部分指标上超越Claude Fable 5。三大顶流模型不约而同强化了多步骤长周期自主执行能力,标志着行业竞争焦点从单一任务处理转向完整项目承接能力比拼。阿里千问此次开源2.4万亿参数模型,被视为中国在开源大模型领域的重要布局。
