智谱认领海外神秘大模型「牛来」!由10万张国产算力卡扛起!
8月27日,智谱开源GLM-5.3-Flash,据悉,GLM-5.3-Flash全部线上流量由10万张国产芯片承载,正式发布前,该模型以匿名身份Ox-Alpha(中文社区称作“牛来”)在OpenRouter、OpenCode两大海外平台测试,迅速登顶并刷新双平台历史纪录,Token调用量高达62T。

值得一提的是,这些请求流量全部由国产芯片提供算力支持。智谱在官方技术文档中表示,调用超过10万张国产芯片集群用于该模型推理服务,“硬件效率及单token成本已经达到了与主流英伟达GPU相当的水平”。

“过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。”智谱表示。在集群层面,该公司采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。
“与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。”智谱称。
GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的十分之一。相当于用十分之一的成本,跑出了更强的性能。这得益于其极低成本的全新模型架构,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。
8月以来,国产旗舰模型接连更新,性能持续提升,调用保持全球领先。兴业证券研报分析,OpenRouter数据显示,8月10日—16日,中国大模型周调用量达36.84万亿Token,环比增长7.56%,连续16周超过美国,稳居全球首位。同时,DeepSeek、MiniMax、智谱、腾讯等国内厂商已将RSI(递归自我改进)纳入技术研究路线中,从战略规划、产品落地、工程工具等多个维度布局,将引领下一代大模型能力升级,驱动国产模型对标全球顶尖水平。
