大模型推理遇瓶颈,正从“堆GPU”走向存算协同
界面新闻记者 |
界面新闻编辑 |
文姝琪
大模型推理正在遇到新的瓶颈。
随着模型上下文越来越长、多轮对话和
Agent
被越来越广泛应用,推理过程中需要处理的数据量快速增加。过去主要依靠
GPU
算力解决问题的方式,开始暴露出了问题:算力足够了,显存却可能先被
KV Cache
(键值缓存)占满。
KV Cache
原本是大模型推理的重要加速器,可以通俗地理解为“模型的短期记忆草稿本”。模型在处理上下文时,会将已经计算好的
Key
、
Value
向量缓存下来,后续生成新的
Token
时直接复用,从而避免重复计算。但当上下文越来越长,
KV Cache
本身又成为新的成本和性能瓶颈。
对此,中科曙光北京公司总裁助理、分布式存储产品部总经理石静在接受界面新闻采访时表示,目前行业已经形成
“
以存换算
”
的共识,把已经计算好的
KV Cache
保存下来,在后续请求中直接复用,从而减少重复计算。
传统
KV Cache
只能消除单对话、单节点内的重复计算,在跨对话、跨节点的大集群场景中,加速效用迅速衰减。
AI
智能体、知识库问答这类高频调用相同上下文的应用,大量基础
Token
被成千上万次重复计算,
GPU
算力被白白浪费。

8
月
28
日,中科曙光发布
ParaCache
解决方案,试图来解决这一问题。该方案通过构建分布式共享
KV Cache
池,打通
GPU HBM
、
CPU DRAM
、
SSD
和分布式存储四级缓存,让不同温度的数据进入不同存储层,同时实现跨
GPU
、跨节点的
KV Cache
复用。
通俗地讲,中科曙光的思路是把大模型用完即弃的计算中间结果,变成全集群共享的长期记忆,即算一次、存下来,谁用谁取,不必重算。石静表示,
ParaCache
更适合长上下文占比较高、存在大量公共重复上下文,同时具有较大并发压力的场景;如果只是一次性的短请求,缓存复用价值就相对有限。
根据中科曙光披露的测试数据,在高并发场景下,其
Token
吞吐量最高可以提升
27
倍;在多轮会话场景中,首
Token
时延(
TTFT
)降低超过
80%
。而在真实的场景中,某银行信用卡中心智能客服场景,并发吞吐量提升约
3
倍;某教科研知识库问答场景,并发度可提升
15
至
20
倍。
石静对界面新闻表示,在长上下文、多轮对话、智能体等场景下,
ParaCache
可以帮助客户在内存与
SSD
配置上节省约三分之一的硬件采购。
据界面新闻了解,国内一家头部互联网厂商已和中科曙光完成在线推理业务的
KV Cache
管理优化。
这背后是
AI
基础设施建设逻辑的变化:大模型基础设施建设正在从“堆
GPU
”转向存算协同。石静表示,过去做
AI
建设的思路是遇到瓶颈就堆
GPU
,但
GPU
成本高、供给受限,数据路径上的无效计算和额外搬运也在制约
GPU
效率的发挥。“存算协同不是短期的技术改良,而是大规模训推生产的必然趋势。”
在石静看来,
AI
正在驱动数据基础设施的结构性变化,这给国内厂商带来更多机遇。
中科曙光想要抓住这一轮机遇,底气在于其在存储领域多年的积累。其
ParaStor
分布式存储与
FlashNexus
集中式存储是两大核心产品线,已广泛应用于大模型训练、自动驾驶、具身智能、智算中心等
AI
场景。今年
7
月,国内首个全国产十万卡
AI
超集群“曙光
8000
”落成并接入国家超算互联网,
ParaCache
正是在十万卡集群中完成验证。
更值得注意的是,
ParaCache
带来的不只是工程层面的优化,而是大模型推理架构的范式变化。
“以前
GPU
是整个架构里面的中心,
KV Cache
只是一个临时状态。”石静表示,在新的架构下,
KV Cache
正在成为一种数据资产,
GPU
则应该围绕这些数据提供
Prefill
(处理用户
Prompt
)和
Decode
(逐字输出)
计算能力。未来
KV Cache
管理能力甚至可能影响推理服务成本、响应速度以及
Agent
的扩展能力。
从行业的角度看,这一轮基础设施的结构性变化,带来的更深层次变化在于算力的建设思路。
AI
集群的规划正在从只看
GPU
算力,转向算力、存储、网络、缓存的一体化规划,并以总拥有成本(
TCO
)为标尺。存储的定位,也从被动的数据容器转向深度的数据调度、缓存复用与计算卸载。
可以说,管好记忆正在变得和提升算力同等重要。大模型竞争的下半场,不只是比谁的算力更强,还要比谁的数据存得更聪明。
