中国移动云发布异构混合推理系统:类脑芯片+国产GPU
发布时间:2026-09-13来源:快科技
快科技9月13日消息,
2026中国算力大会在河北廊坊举办。在大会“算力首创首发”专场上,国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。
该系统由移动云(中移苏州软件技术有限公司)联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同研发,目标是让国产芯片高效支撑大模型推理。
其技术思路是将大模型拆解分工。
团队对Transformer结构做PD/AF分离:Prefill预处理阶段与Attention注意力计算交给国产GPU,FFN模块交给类脑芯片。类脑芯片的存算一体和片上大容量SRAM架构,正好承接对带宽敏感的部分。
研发团队同时自研了模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。这套方案对标英伟达下一代Vera Rubin with Groq异构推理架构。
实测数据落在硬件配置上:
3台天数智芯GPU服务器搭配3台类脑机柜,运行DeepSeek V4 Flash模型,相较同等投入规模的纯GPU集群,推理输出和推理能效均提升1倍以上,业务运营成本下降40%以上。
项目累计形成15项授权发明专利、6项软件著作权,覆盖异构调度、类脑芯片架构、编译工具链等环节,目前已进入小批量试产阶段。
该方案面向Token工厂、AI代码生成、多智能体协同等场景,也可用于金融、安防、通信等安全敏感行业。

转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。
