玄铁RISC
阿里千问近日正式推出Qwen3.8系列开源模型,其中270亿参数的Qwen3.8-27B凭借"轻量化"设计在编程与智能体任务领域表现突出。该模型在SWE-bench Pro等专业基准测试中超越Anthropic旗舰模型Claude Opus 4.6 Max,被开发者誉为"家用版Opus"。玄铁团队同步完成该模型在RISC-V架构上的Day 0适配,成功构建从模型架构到硬件落地的完整技术链条。
作为面向部署场景的稠密模型,Qwen3.8-27B在编程能力、专业任务处理、长周期任务执行及多模态智能体交互等方面实现突破性提升。相较于前代Qwen3.6-27B,新模型在DeepSWE 1.1软件工程测试中得分激增217%,QwenSWEBench测试提升60%,JobBench专业任务测试提升45%。这些进步体现在模型对复杂任务的持续执行能力,包括长时间上下文保持、工具调用及环境反馈处理等核心环节。
在架构设计层面,Qwen3.8-27B延续Qwen3.5的混合架构方案,采用64层语言模型结构。其创新性地以"3层Gated DeltaNet+1层Gated Attention"为循环单元,配合FFN模块形成交错执行网络。这种设计使推理链路不再依赖单一注意力计算,而是通过投影、门控、状态更新等操作的协同工作,显著提升复杂任务处理效率。模型运行时需连续处理矩阵计算、向量运算、状态维护及数据访问等多元负载,对硬件适配提出更高要求。
玄铁C950处理器通过三重算力架构实现精准匹配:Matrix路径承担Attention投影和FFN等矩阵密集计算;RVV向量扩展单元处理RMSNorm、RoPE等向量化操作;通用CPU核负责模型控制与不规则计算。这种异构计算模式可根据数据类型、张量形状动态调整计算路径,在64核配置下实现30 tokens/s的解码速度,首字延迟(TTFT)控制在1.9秒以内。针对不同规模模型,玄铁团队还开发了适配方案,如Qwen3.8-2.4T-A95B在相同硬件上达到7.2 tokens/s的吞吐量。
作为连接模型与硬件的关键桥梁,玄铁SHL算子库通过多层优化策略提升实际性能。该库针对MatMul、Linear等矩阵运算提供多精度内核选择,对Softmax、RMSNorm等算子开发专用实现路径。在数据处理层面,通过权重重排、输入预处理、缓冲区复用等技术减少内存操作,结合多核任务划分与缓存复用机制,有效解决推理过程中的性能瓶颈。经实测验证,优化后的系统在复杂任务场景下仍能保持稳定性能输出。
此次技术突破标志着"芯模协同"模式进入产业实践阶段。自2026年初玄铁与千问发布"Powered by XuanTie,Qwen Inside"战略以来,双方已完成从Qwen3.6-Plus到Qwen3.8-27B的全系列RISC-V平台适配。江原科技D20、瑞芯微RK1828等搭载玄铁处理器的芯片产品,现已实现Qwen3.8-27B的高效运行,为机器人控制、工业自动化、车载智能等场景提供技术支撑。随着工具链和推理框架的持续完善,RISC-V架构正逐步成为大模型产业落地的重要技术底座。
