华为昇腾快速适配小红书开源大模型dots3
小红书近日正式推出其开源大模型dots3-note preview,这一消息引发了科技界的广泛关注。作为dots3系列的首个版本,该模型以280B的总参数量和16B的激活参数量构建了强大的能力底座,同时具备文本、视觉、语音全模态感知理解能力。官方透露,该模型在推理、Agent及多模态感知等能力上进行了全面优化,在多项任务中的表现可与国内外更大尺寸的优秀模型相媲美。
华为官方宣布,其昇腾Atlas 800 A3和Atlas 900 A3 SuperPoD超节点已完成对dots3-note preview的全量适配,并基于vLLM Ascend开源推理引擎提供了完整的部署与推理能力。在模型发布当天,昇腾团队迅速完成了0 Day推理部署适配与性能优化,确保模型在文本、视觉、语音一体化全模态理解能力完整保留的前提下,实现了稳定运行和生成效率的显著提升,为长程复杂任务场景的智能落地提供了强大的算力支撑。
此次适配与优化的关键点包括全模态端到端适配和框架深度特性优化。基于vLLM Ascend推理框架,昇腾团队完成了dots3-note preview在文本、图片、音频全模态能力上的端到端适配,打通了视觉编码器、音频特征提取与LLM主干推理的全链路,完整保留了模型原生多模态理解与交互能力,支持图文、音文、视频等多模态输入场景的稳定推理。
在框架深度特性优化方面,昇腾团队通过FlashComm通信优化,针对AllReduce后RMSNorm、Dynamic Quant、MLA QKV降维等列向无关算子的冗余计算问题,通过数学等价变换将AllReduce拆解为ReduceScatter+AllGather,将列向独立算子前移至两阶段通信之间执行,彻底消除了多卡间的重复计算,有效降低了推理时延。FUSED_MC2通算融合技术启用了MoE层dispatch_ffn_combine融合算子,将原本多段独立的Kernel合并为单一大算子,通过减少Kernel Launch次数、通信与计算深度流水、中间张量不落盘等手段,显著提升了MoE推理吞吐。
针对增量推理阶段TPOT(单Token生成耗时)这一吞吐核心瓶颈,昇腾团队在vLLM Ascend中原生适配了dots3-note preview的MTP投机解码能力,通过单次前向并行生成多Token候选并校验复用,大幅减少了解码前向次数,有效降低了TPOT,提升了整体生成效率,更好地满足了高并发在线业务的低时延诉求。
