十万卡,不是把十万张GPU插在一起
十万卡这三个字,最近出现得有点密。
听上去像个数量问题——把一万张卡的做法放大十倍。但真做过集群的人知道,规模每上一个台阶,麻烦不是按比例增加,而是换一种方式出现。
一座城市不是许多栋楼相加。楼可以一栋一栋盖,盖到一定程度,问题会从"楼本身"转移到"楼之间":路网够不够,水电气怎么供,出了事谁管。
十万卡集群也是这个道理。
万卡规模的时候,少数节点故障、偶发的通信拥塞、调度排队,靠人工还能兜住。但到了十万卡,卡数越多,节点故障、通信拥堵、数据供给、任务调度和能源管理等问题就越容易被放大,任何一环没处理住,损失的不是一张卡,而是一整片算力。
所以十万卡的难点在于是否"靠得住"。
衡量一套集群,外行看装了多少张卡。内行看另一组数——这些卡里有多少算力,能长期稳定地交给模型去跑。
摩尔线程披露过的万卡级实践里,有几个数字值得关注:
· 线性扩展效率最高达到95%
· 有效训练时间占比超过90%
· 支持长时间训练和断点续训
· 覆盖通信、调度、故障诊断和恢复
· 已经进入Dense、MoE等大模型训练场景
这几条放在一起,说的是同一件事:摩尔线程超高的稳定性。
线性拓展效率最高达到95%,展开解释一下就是给多少卡就会用上多少卡,近乎不会有“摸鱼”的卡。而断点续训能跑通,意思是一次中断不会让前面的工作白费——这一条在十万卡上比在万卡上重要得多,因为规模越大,中断越频繁,从头再来的代价越贵。
这里要区分两件事。
MTT S5000提供的是基础计算能力,这是集群的地基。但地基不会自动变成楼。把大量GPU组织成一套能运行真实任务的智算系统,靠的是夸娥。
互联怎么搭、任务怎么切、通信怎么排、卡间调度、出故障后怎么诊断、诊断完怎么恢复——这些活没有一样是芯片自己能干的。集群从"硬件"变成"生产力"靠的是夸娥集群。再往外一层是软件生态:芯片和集群再强,开发者写不进代码、模型搬不过来,系统也转不起来。而摩尔线程的MUSA生态目前已有超80万的生态开发者,和国内主流大模型完美兼容。
摩尔线程面向十万卡扩展给出的布局是C256超节点架构,这是从万卡继续向上时,互联与拓扑层面要提前做的准备。
这类问题的答案,通常不在单卡的规格表里。它更像修路——路修得对不对,要等车流量上来才知道。
直接原因是需求端变了。前两天,京东云宣布与摩尔线程共同打造国产十万卡级全功能GPU集群。

这条消息值得注意的不是数字本身,而是一个信号:头部云厂商开始把国产GPU放进超大规模核心算力基础设施的规划里。接下来被追问的自然是供给端——谁能把十万卡组织起来,并且跑稳。
国产GPU过去几年的考验一直是"能不能做出一张不错的卡",这个问题已经有了阶段性答案。而下一道考题:谁能组织和运营十万卡级的算力,摩尔线程已经提前交卷——从S5000这样一颗算力芯片,到夸娥把大量GPU组织成能跑真实任务的系统,再到面向十万卡的C256超节点,它给出的已经不只是芯片,还有MUSA软件生态、工程交付,以及把算力真正用起来的系统能力。

推荐
