Qwen3.8-Flash发布并开源:6B激活参数背后,是Qwen4架构的第一次公开亮相-AITOP100,AI资讯

北京时间 8 月 26 日晚,阿里通义千问团队发布了 Qwen3.8-Flash,并同步开放了 Qwen3.8-Flash-Next 的模型权重。名字虽然还挂在 3.x 序列上,但官方说得很直白:这是下一代 Qwen4 架构的早期预览版。千问选择在 Qwen4 完整家族到来之前,先把新架构放出来给社区检验——这个动作本身,比跑分更值得关注。
模型地址:通义千问官网
一、模型规格:125B 总参数,每 token 只激活 6B
先看基本的数据:
- 类型:多模态 MoE(混合专家)模型
- 参数规模:主模型 125B,另有 51B 的 N-gram 嵌入参数
- 激活参数:每 token 仅激活约 6B
- 上下文:原生 262,144 tokens,可通过 YaRN 外推至 1M
125B 总参数 + 6B 激活,这个稀疏比相当激进。更特别的是那 51B 的 N-gram 嵌入——它不参与常规的注意力计算,而是通过确定性的本地上下文查表工作,因此虽然占了近三分之一的参数账面,却几乎不增加每 token 的矩阵乘法开销。这是一种典型的"用存储换计算"的容量扩展思路(据媒体报道,该设计受到 DeepSeek Engram 等条件记忆工作的启发,技术报告中有更完整的论述)。
语言性能 & 视觉语言性能:


二、架构:四个方向的系统性升级
官方将本次架构革新归纳为四点,分别对应能力、效率、容量和稳定性:
1. 注意力机制:GDN + QSA 混合
- GDN(Gated DeltaNet):属于线性注意力家族,负责把历史信息压缩进一个紧凑的状态里,避免随序列长度线性膨胀的 KV 开销;
- QSA(Qwen Sparse Attention):用一个轻量级索引器做微块(micro-block)粒度的上下文选择,只对真正相关的块做全精度注意力。
两者分工明确:GDN 管"粗压缩",QSA 管"精检索"。官方给出的数据是:在 1M token 上下文下,QSA 注意力内核预填充阶段最高提速 7.6 倍,解码阶段提速 4.9 倍。
2. 残差连接:门控残差(Gated Residuals)
传统 Transformer 的单条残差流被扩展为 4 个分支,并引入动态读写门控。官方表述是这能加强跨层信息流动,并"显著提升训练稳定性"。对超大规模训练来说,稳定性本身就是真金白银。
3. 嵌入:N-gram Embedding
即上文提到的 51B 查表参数。工程上还有一个务实的细节:通过异步预取,嵌入表可以常驻主机内存而不阻塞 GPU 计算——这意味着它扩展容量的代价被压得很低。
4. 优化器:改进版 Muon
Muon是近两年社区关注度很高的基于正交化的动量优化器。千问这次做了针对性改造:改进正交化过程、在 Muon 与 AdamW 之间做更智能的参数分配、融合参数拆分,并为新架构重新拟合了缩放定律。
最后一点值得划重点——架构变了还沿用旧的 scaling law 是常见的翻车点,重新拟合说明团队是按新架构从头标定的。

三、效率:训练成本降到九分之一
这是本次发布最硬的指标,也是媒体转载的焦点:
- 训练成本仅为 Qwen3.7-Plus 的 1/9(即下降近 90%),同时各方面能力全面超越后者,官方特别强调编码和办公类任务的提升最为突出;
- 在 90% 前缀缓存命中率的典型服务场景下,Qwen3.8-Flash-Next 的预填充吞吐量达到 Qwen3.7-Plus 的 8.6 倍。
训练端省 9 倍、推理端靠稀疏激活和缓存友好的架构设计压成本,最终传导到了定价上。

四、性能:官方公布的数据
以下数据来自官方发布材料(具体评测设置以技术报告为准):
| 基准 | Qwen3.8-Flash 得分 | 考察方向 |
|---|---|---|
| DeepSWE 1.1 | 58.7 | 智能体编程 |
| SWE-bench Pro | 62.5 | 智能体编程 |
| CoWorkBench | 73.9 | 长程专业办公任务 |
| AndroidWorld | 84.5 | 移动端智能体(多模态) |
| MathVision(带 CI) | 95.7 | 视觉数学推理 |
据官方发布材料(经雷峰网、新浪财经等媒体转述):在 SWE-bench Pro 上领先 Claude Opus 4.6 达 9.1 分;在 JobBench 专业工作任务上领先 Opus 4.6 近 20 分;AndroidWorld 和 MathVision 分别高出 22.5 分和 25.1 分。
基座模型方面,Qwen3.8-Flash-Next-Base 在 14 个基准中的 8 个登顶(包括 MMLU-Pro、SuperGPQA、BBH、GSM8K),其余项目与 Qwen3.7-Plus-Base 打平——对一个激活参数只有 6B 的基座来说,这个参数效率相当可观。

五、几个需要注意的点
- 目前流传的跑分主要是厂商自报数据,第三方独立复现还需要时间。尤其要注意评测口径——带工具调用与不带工具调用的成绩没有可比性。
- 第三方分析已经指出短板:例如 DataLearner 的对比分析显示,Qwen3.8-Flash-Next 在复杂指令遵循(IFBench)上仍落后 Opus 4.6 约 12.7 分,在从零生成整库的 NL2Repo-Bench 上也不及 DeepSeek-V4-Flash。它在存量代码修复类任务上优势明显,但并非全能。
- "Next"的定位是实验性预览。开源权重是为了让社区提前适配 Qwen4 架构,后续工程支持、量化生态、推理框架适配(如 vLLM、SGLang 的 day-0 支持)的成熟度还需要观察。
- 176B 总参数(125B+51B)的部署门槛不低,即使激活只有 6B。N-gram 表可以放主机内存是个利好,但"消费级显卡可跑"之类的说法要等实测,不要直接套用。
六、开源与定价
- 开源权重:Qwen3.8-Flash-Next 已上线 Hugging Face;
- API:生产版本即将通过 QwenCloud API 提供,定价 $0.16/百万输入 token、$0.47/百万输出 token。据国内媒体报道,千问 AI 平台的定价为每百万 token 输入 1 元、输出 3 元,最低约为 DeepSeek-V4-Flash 的三分之一;
模型还将首发接入阿里的智能体产品"千问办公"。
模型地址:huggingface.co/Qwen/Qwen3.8-Flash-Next
这次发布最值得琢磨的,不是"又便宜了多少",而是千问选择的路径:在旗舰换代之前,先把新架构以预览版形式开源。GDN+QSA 混合注意力、门控残差、N-gram 嵌入、Muon 优化——这套组合拳如果在社区验证中站得住脚,它很可能成为 Qwen4 乃至同行后续模型的参照系。
1/9 的训练成本如果属实,说明架构红利正在取代单纯堆算力,重新成为大模型竞赛的主战场。至于这套架构的上限在哪,等 Qwen4 正式家族亮相时自有分晓——而在那之前,权重已经放出来了,社区说了算。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:


