2026WAIC面对面|曦望徐冰:以推理算力底座抢抓Agent十年机遇
【环球网科技综合报道】7月17日,在2026世界人工智能大会"WAIC的清华朋友圈之夜"论坛上,曦望Sunrise董事长徐冰发表题为《与Agent共生,与同路人共造——Agent时代的推理基础设施与创业地图》的产业演讲。
2026年被定义为Token商业化元年,这一个行业发展的关键分水岭。当前市场已开始大规模为顶尖大模型付费,不少用户每月在模型上的支出达上千元,甚至频繁耗尽Token额度。"放在一年前,这样的市场需求完全不存在,今年才是大众真正认可Token商业价值的元年。"徐冰指出。
徐冰认为,长久以来顶尖智能属于稀缺资源,依赖高校长期培养专业人才,高端智力如同"奢侈品"。而如今,顶级智能已成为可按需采购的标准化商品,智能正式转型为可采购的数字基础设施。
演讲中,徐冰提出了一个观察:"Token的主人正在换人。过去三年,Token是人买的、人看的;从今年开始,越来越多的Token,人都不会看一眼——那是Agent在规划、调用工具、写代码、自我检查时,机器烧给机器的。"
买单主体从人切换到Agent,改变了需求的计算方式。人消耗智能受注意力和工作时长的生理约束,而Agent实现了智能任务与人类时间的完全解耦——7×24小时在岗、可无限并行复制,未来数量有望达到数百亿,远超全球80亿人口。但徐冰特别强调:"Agent数量超过人类只是表象,真正的经济拐点,是Agent的工作小时数超过人类的工作小时数。"推理需求由Agent数量、活跃时长、行动步骤、每步Token与验证重试倍数五个变量连乘决定,呈指数叠加式增长。
AI Agent被普遍定义为继工业革命、信息革命后的第三次生产力革命:工业革命放大了人类的肌肉与体力,信息革命放大了注意力与信息传播效率,而Agent时代则彻底解放了人类的时间。在徐冰看来,"Agent并非切分存量的蛋糕,而是创造历史上不存在的增量市场。"这一判断与"人工智能+"行动中将AI定位为"新旧动能转换加速器"的政策方向形成呼应。
AI算力竞争正从追求性能峰值,转向推理时代的性价比与TCO(总拥有成本)。以存储为例,高通、英特尔等全球头部企业的推理产品正在转向LPDDR(低功耗内存)方案——LPDDR 工艺成熟、供应链充足,易于扩产。这一技术路径的切换,为产业提供了"换道超车"的战略窗口。
徐冰用一个比方解释曦望押注大容量内存路线的逻辑:"在Agent系统里,内存不只是显卡的一个配置参数,它是数字员工的工位。工位越大,一台机器养得起的Agent越多,每个Agent记得住的事越久。"他同时强调:极高带宽场景与训练负载仍更适合HBM(高带宽内存),而曦望第三代GPU通过采用大容量LPDDR内存,在长上下文、高并发等容量敏感的Agent负载上,做出更低的真实任务成本。
徐冰系统阐述了中国AI产业的三重优势:位居全球第一梯队的开放权重大模型、可大规模扩产的内存、价格低且供应充足的电力。三重优势叠加,使国内Token量产成本极具优势。WAIC 开幕式释放出的全球叙事非常清晰:中国希望把开放模型、AI 基础设施和能力建设作为面向全球的公共供给,降低不同国家获得 AI 能力的门槛。
这一成本优势与政策导向中的"算力普惠"目标高度一致。徐冰提出的算力调度、软硬协同模型优化、闲置智算集群盘活等创业赛道,正是将"算力普惠"的宏观导向转化为可操作的商业实践。(勃潺)
