头部大模型,已经在用国产算力卡了


国产GPU这两年最难受的地方,是总被拉到同一张考卷上比。
单卡多少TFLOPS、显存带宽多高、能跑多大的模型。这张卷子上,国产卡和国际旗舰之间确实有差距,短期也追不平。但生产环境从来不出这张卷子。
9月3日摩尔线程与趋境科技达成战略合作,公开信息里最有分量的不是签约本身,而是一句容易被划过去的话:联合方案已正式投入生产,并开始承接头部大模型厂商官方业务的真实Token流量。
注意这几个关键词:正式投产、头部大模型、官方业务。
翻一翻历史不难发现,趋境科技是AI Token生产服务商,客户名单里早已有智谱、Kimi、国家级实验室这样的头部玩家。
了解这个背景后,再来看这次合作,逻辑就完全闭环了:当给头部大模型扛流量的“主力工厂”开始把设备切入摩尔线程,哪怕台前没有挑明客户的名字,海量真实用户的调用流量,也已经结结实实跑在国产算力卡了。
这不是实验室演示,是生产排班表。
能进生产,说明它过的不是跑分那关。那它过的是哪关?
1. 推理其实是两种完全不同的活
大模型推理,一个请求里塞了两件性质相反的活。
Prefill(输入处理):把你输入的整段prompt一次性读进去,做大规模矩阵计算,生成KV Cache。计算密集,吃的是算力密度,几乎不等显存。
Decode(生成输出):一个Token一个Token往外吐。每一步都要把模型权重和KV Cache从显存里过一遍,算的量反而很小。访存密集,卡在带宽上,算力在空转。
传统做法是把两件事塞在同一张卡上跑。结果就是跑Prefill的时候带宽闲着,跑Decode的时候算力闲着。
国际旗舰之所以强,是因为它算力和带宽两头都拉满,一张贵卡把两段全扛下来。但这是"一张卡解决所有问题"的思路,代价是贵。
2. 拆开,各干各的
趋境这次落地的方案,走的是另一条路——异构PD分离。
让摩尔线程MTT S5000组成资源池,专注承担Prefill;访存密集的Decode,交给更擅长高带宽访问的芯片。
这是一种很朴素的工程思路:让合适的芯片干合适的活。

图 1 · PD分离:把一次推理拆成两半,各交给擅长的芯片
S5000有原生FP8和充沛的稠密算力,高算力密度是它的长板,那就让它干算力密集的那一段;Decode吃带宽,就让带宽高的上。两类卡各在自己擅长的区间里跑满,谁也不用迁就谁。
中间KV Cache在两个资源池之间传输,调度和协同由软件层兜住。这是工程活,不难理解,难的是在万卡规模上稳定跑住。
3. 国模在用,经济账划算
此前硅基流动公开过一组实测数据:在Prefill场景中,2台MTT S5000可实现对1台国际主流旗舰GPU的等效替代。
单卡Prefill吞吐大约是国际旗舰的46%到54%,差不多一半。但两张卡组成一个资源池,缺口刚好补上。
很多人看到"两台抵一台"的第一反应是:那不是花两倍的力气?
账不是这么算的。
一颗国际旗舰GPU的采购成本、供货周期、合规门槛,和两颗国产卡完全不是一个量级。当单卡成本本身就存在明显差距时,2:1的数量比反而可能变成成本优势。
所以国产卡不必在单卡指标上全面追平国际旗舰。它通过资源池扩展和异构协同,把自身算力优势集中释放出来,换一个更现实的结果:每生产一个Token,花的钱更少。
比单卡跑分,更重要的是每生产一个Token到底要花多少钱。

图 2 · 等效替代:单卡只到一半,两台刚好补齐,数量之外还有三笔账
4. 头部大模型,真的在用
再看一眼客户名单:智谱、Kimi、国家级实验室,以及正在持续接入的国内一线大模型厂商。这次不是"国产卡能跑了"的内部演示,而是头部大模型把线上一线流量切了过来。
对大模型厂商来说,切流量不是表态,是算账。线上流量验证要过稳定性、时延SLO、成本这三关,哪一关不过都不敢上生产。硅基流动的实测就发生在Kimi K2.6模型部署——2台S5000等效替代1台英伟达高端GPU,全链路服务质量不打折,这才敢把真业务放上去。

图 3 · 谁在用:智谱、国家级实验室与一线大模型厂商的真实流量
对摩尔线程来说,这一步比任何跑分都有说服力:国产头部大模型,真正在用国产算力卡。
结语
国产GPU的这几年,其实一直在追赶的赛道上跑。
生产环境是最诚实的裁判。它不问你跑分多少,只问你每个Token报价多少。而这一次,头部大模型已经把真业务放上来了。
