在 AGI 到来之前,无问芯穹决定先把「前店后厂一中心」 建出来

微信|geisterspiele
你并不总能看到模型公司、机器人公司、行业应用公司和芯片公司们一起坐在一家创业公司的论坛现场。
在移动互联网时代,这样的画面更多属于英特尔和英伟达。它们提供的是底层计算能力,因此竞争者也愿意坐到同一排。
今天,这个角色开始重新分配。连续几年 WAIC,我都发现一个有意思的现象。每年都会有一家公司的论坛,能把模型厂商、国产芯片、机器人、行业应用和高校研究者都聚在一起。
它不是最大的模型公司,也不是最大的云厂商。它叫无问芯穹。这种热闹本身说明,越来越多人开始把它看成一层新的基础设施。
今年WAIC,无问芯穹发布了面向Agent时代的完整架构:前店后厂一中心。

一中心,是算力集散中心;后厂,是 Token 工厂;前店,则是 AI 生产力商店。三者共同组成它所说的 Agentic Infra完整战略布局。
在AI圈子天天制造的各种“洋气”的概念里,这几个词带着浓重的工业时代气息,像一座既有能源枢纽、又有生产车间,临街还开着商店的产业园区。但无问芯穹联合创始人兼 CEO 夏立雪对我说,这正是他们要表达的:
今天最重要的是解决那些最落地的需求。它们面对公众没那么“显性”,却是 AI 要更高效提供价值必须完成的事情,而完成这些事情,需要一套立足于Agent时代,满足新需求的完整Agentic Infra基础设施。

前店、后厂和一个中心
无问芯穹把 AI 生产力拆成三个部分:智能资源规模 × Token 转化效率 × AI生产力转化效率。
它们分别对应一中心、后厂和前店。
一中心回答的是,如何最大化智能资源规模。后厂回答的是,如何极致提升效率,服务 Token 的规模化与高质量生产。前店回答的,则是这些 Token 如何帮助千行百业降本提效。
这套框架之所以在今天出现,与 AI 使用方式的变化直接相关。
模型不再只回答一个问题。Agent 会规划、搜索、调用工具、执行,再检查结果。一次工作背后,可能是几十次甚至更多模型调用。
今年 7 月,无问芯穹 Agentic MaaS 平台的单日 Token 调用量较去年12月,增长了约 40 倍。夏立雪说,这些增量主要来自真实产业场景。 AI 开始真正工作之后,基础设施面对的也不再只是芯片和集群,而是一整条生产链。
首先,你要先把算力真正用起来。
中国 AI 产业长期存在一种错位。一边,模型和应用公司持续说算力不足;另一边,一些已经建好的数据中心里,又有芯片没有被充分使用。写在纸面上的算力,并不等于模型真正能够调用的算力。
现实里的资源来自不同地区、不同集群和不同厂商。企业既有本地集群,也会使用公有云;海外 GPU 与国产芯片长期并存,国产芯片之间又有各自的架构和软件栈。单独看都能运行,放在一起却很难成为一台「大电脑」。
无问芯穹最早做的事情,就是在模型与芯片之间构建一座“桥梁”,让更多模型能跑在更多芯片上。
现在,这套能力被扩展成“算力集散中心”。
无问芯穹称,目前其系统已经部署触达超过 3.7 万 P 算力,覆盖 16 种芯片。这个“中心”不是一座具体的数据中心,是把不同的、跨区域的算力资源,高效聚合协同起来,从而扩大智能资源的规模。
它在这次发布中展示了三组结果。
无问芯穹与中国电信把新疆哈密和广东深圳的两套异构集群连接起来,完成了国内首例超 4000 公里距离的大模型跨域混训,联合训练性能提升 165%;又将四套不同代际、不同型号的 GPU 集群聚合起来训练近百亿参数大模型,协同性能提升 41%;在另一项测试中,本地私有集群与公有云算力的安全互通混训,整体性能提升 68%。
跨地域训练的难点远不只是网络连通。任务如何切分,计算和通信怎样重叠,网络波动如何处理,节点故障后训练能不能继续,都需要在训练框架、平台、网络和芯片之间共同优化。
而最新越来越明晰的强化学习需求,又把问题推得更远——行业大势,继预训练之后,强化学习训练已成为解锁智能体持续进化的关键。
与相对稳定的预训练相比,强化学习需要模型不断生成、采样、评估和更新,不同阶段使用资源的方式差异很大。任何一处等待,都可能让大量芯片空转,当规模扩大到万卡级后,从显卡到服务器、网络、存储,故障将以小时级的频率存在。据无问芯穹介绍,其跨域强化学习系统将通信效率提高了三至四倍,通信开销 100% 全掩盖,并搭建了故障无感的训练机制,实现跨域强化学习训练连续一周 0 中断稳定运行。 未来,伴随着大规模跨集群强化学习训练技术的持续成熟突破,团队计划将这套系统对跨域计算资源的支撑规模拓展至十万卡级以上。

这些工作真正改变的,是可用算力的定义。一款芯片可以点亮,不代表它已经进入生产;一座数据中心建成,也不代表它已经成为智能资源。只有模型能稳定运行、不同集群能够协同、已有资源可以被持续调度,智能资源才真正变成生产力。
接下来,是如何极致提升高质量Token生产的效率。
智能资源被组织起来以后,进入“后厂”。后厂生产的是 Token。
在我看来,“Token 工厂”已经是一个被行业反复使用的概念。但夏立雪认为,它是 AI Infra 发展中一次重要的变化,哪怕很多创业公司和大厂纷纷喊出要做token工厂,使得概念十分火热,但这个概念背后的意义依然重要,因为这意味着人们终于把交付物标准化了。
训练时代,客户购买的是 GPU 数量和运行时间。不同模型的架构、数据和训练方式相差很大,很难用同一套指标评价。推理时代,Token 成为一种相对统一的计量单位。不同模型生成的 Token 能力当然不一样,但至少可以比较吞吐、延迟和成本。
夏立雪把它比作自来水。水质和来源有所差异,但只要进入管道,产业就能围绕生产、输送和计费形成清晰分工。无问芯穹过去一年通过系列技术优化,将推理成本降低了约 10 倍,未来仍有10倍优化空间。
这不是依靠某一项神奇技术完成的。一次模型调用要经过网关、排队、路由、缓存、显存管理、模型执行和数据传输。每一层都可能堵塞,也都存在优化空间。
在这次发布中,无问芯穹重点展示了跨集群异构 PD 分离架构。
大模型推理可以大致分成两个阶段。Prefill 负责理解输入,更依赖计算能力;Decode 负责逐个生成 Token,更依赖显存和带宽。过去,两种任务往往跑在同一批芯片上。两道工序对设备的要求不同,却挤在同一条生产线上,彼此等待。PD 分离将它们拆开。
跨集群异构 PD 分离更进一步,让 Prefill 和 Decode 分别运行在不同集群、不同类型的芯片上。更擅长计算的硬件处理输入,另一类更适合推理的芯片持续生成,系统完成中间的状态传输和调度。它相当于把一座从原料处理到最终组装全部包办的工厂,拆成几个专业车间,再用一套物流系统重新接起来。
这对国产芯片还有另一层意义。一款芯片未必需要在所有指标上都与最强 GPU 竞争。只要它在某类工作负载上足够高效,就有机会进入大型推理系统,承担最适合自己的工序。一中心扩大可用资源,后厂提高资源转化成 Token 的效率。公司在今天的WAIC发布会上表示,经实测,这项技术将首Token延迟(TTFT)降低了51.5%,单Token成本则再降37.5%。

除了这些符合人们印象中基础设施企业的工作,此次无问芯穹的新动作其实在让边界发生着变化,它要继续“把手伸向” Token 离开工厂之后的阶段。
在这个“前店”的部分,它卖的不只是 Token。
今天人们容易忽略的一件事情是,同样一百万 Token,可以被 Agent 用在错误的流程里反复打转,也可以找到一处影响上千台机器的故障;可以生成大量无人阅读的文字,也可以完成一段真正投入生产的代码。成本可能相近,价值却完全不同。
Token 工厂回答了能生产多少,却没有回答生产出来之后做成了什么、能不能帮助千行百业真正降本提效。所以,无问芯穹在工厂前面又开了一家店。

“前店”在无问芯穹的定义里,就是 AI 生产力商店。但这也是整套框架里最容易引起疑问的部分:一家 Infra 公司为什么开始进入法律、医疗、影视、能源和具身智能行业?
夏立雪的回答很直接:“不和客户一起做好这块的话,Token很难变成真的生产力。”
直接服务庞大的企业客户后发现,企业需要的从来不是 Token 本身。
律所需要一份能在本地安全生产的可使用法律意见,影视公司需要能稳定交付的成片,机器人公司需要机器及时完成动作。模型能力只是其中一环。还要选择合适的模型,把模型接入工具、数据和权限,处理记忆、工作流、安全和延迟,并在任务失败时定位问题。
夏立雪把那些没有产生实际价值的调用称作“Token 刺客”。
有些简单任务调用了能力过剩的大模型;有些 Agent 在糟糕的流程里不断重试;有些工作本来可以在端侧完成,却全部送上云;还有些模型足够强,却因为没有工具和稳定流程,始终无法交付。前店要做的,就是处理 Token 与工作结果之间的损耗。
无问芯穹打造律师事务所专属 AI 合伙人「律盾芯人」。数据先在本地脱敏,任务交给云端模型处理,结果返回后再在本地回填。敏感信息不直接出域,同时也能通过端侧计算减少云端 Token 消耗。
他还介绍了公司与 VAST 的Tripo 3D 大模型联合打造的 AGENTIC 3D GAME GEN 解决方案,把分散的创意输入转化为可执行、可比较、可细化的 3D 模型输出,高效释放游戏内容生产力。
在具身智能场景,无问芯穹与自变量机器人联合优化模型部署,在保持任务成功率的同时,将 Thor 平台上的端侧推理时延从 500 毫秒降低到 70 毫秒;公司也与智元、清华大学携手,深度探索了真机强化学习训练的技术与实践,攻克阻碍真机强化学习训练大规模落地的核心痛点与难点。
这些案例看起来相距很远,底层逻辑却一致:
围绕最终任务,重新组合模型、芯片、云端与端侧资源。
前店因此不只是销售出口,也是需求入口。进入真实业务,系统才能知道哪一种模型组合真正有效,哪些 Token 没有产生价值,哪些任务应该留在本地,多高的延迟会让机器人无法工作。这些信息再回到后厂和中心,改变下一次模型路由和算力调度。
至此,前店、后厂和中心才形成一个闭环。
一切都在 Agent 化
发布会前几天,我又去了一次无问芯穹位于上海模速空间的办公室。与两年前第一次来时相比,公司扩展了一层,人也肉眼可见变多了。
但比员工数量增长更快的,其实是他们内部的 Agent。
“我们自己在被AI Agent改造,这些服务Agent的需求,其实很多也是从我们自己日常的需求里延伸出来。”夏立雪说。
Agent 首先改变的是外部需求。
过去,用户问模型一个问题,模型给出一个答案。Agent 出现后,一项任务会被拆成规划、搜索、调用工具、执行、检查和重试。模型从回答问题,变成持续工作。这推动了 Token 用量快速增长,也让模型路由、弹性调度、服务稳定性和成本控制变得更加重要。
在无问芯穹,Agent 又进一步进入了 Infra 自己的开发和运行过程。
比如,随着管理的算力规模增加,系统每天产生的日志、告警、工单和客户问题迅速增长。夏立雪把它形容成“牛吃草”——“我吃的没它长得快。”运维系统一天可以产生上亿条日志。完全依赖工程师处理,增加再多人也很快会被淹没。
于是,公司开始让 Agent 接管其中一部分工作。
无问芯穹打造基础设施智能体蜂群,目前已包含三个子集:面向用户的平台管家智能体系统、面向集群的运维智能体系统以及面向芯片的算子生成智能体系统。
其中,平台管家智能体系统是整个基础设施智能体蜂群协同场景下的全局统筹者与用户入口,它通过自然语言交互,就能让智能体主动帮助用户操作平台、统筹 AI 基座,轻松高效完成复杂的资源运营、管理和答疑排障等工作,能够独立解决 80% 日常问题,剩下 20% 深度问题再转交对应垂类 Agent。
“它们之间就形成了一个小组织。”夏立雪说。

(视频说明:无问芯穹 Agentic Infra 行业解决方案 - 平台管家智能体系统)
除此之外,智算集群运维智能体系统是一个能够端到端地解决实际生产场景中的运维难题的7x24小时,全天候值守的“运维专家团”。目前,这套系统已经让整体运维人效提高 5 倍以上,关键故障处理效率提高 6 倍。
不止于此,Agent 也在无问芯穹开始参与更核心的研发。算子决定一款芯片能否真正发挥性能。过去,算子的开发和优化高度依赖少数资深工程师,需要不断编写、编译、测试,再根据结果修改。
无问芯穹开发的 KernelMind,把这些步骤拆给不同 Agent。以算子生成主控智能体为调度中枢,联动多类专用智能体,通过五步闭环工作流,可在真实编译试错与知识沉淀中持续自迭代,稳定交付可直接落地的高质量工业级算子。公司今天公开了一组数据:在 GLM5.2 模型的实测中,对比行业基线该系统在NVIDIA 旗舰卡中实现了端到端 7.3% 的性能提升,在 AMD 旗舰卡中带来了 39% 的整体性能提升。
也就是说,基础设施自己开始用智能优化智能,并逐步从优化走向进化。
这也是无问芯穹提出的 Agentic Infra 里最重要的一层含义。
它不只是给 Agent 使用的基础设施,也是一套开始由 Agent 参与设计、维护和优化的基础设施。夏立雪把它概括为:“通过 Agentic Infra,实现‘用智能进化智能,用生产力加速生产力’。”

他认为,无问芯穹自己这家组织的 AI Native程度也主要体现在这里。它不是一个公司成立时间的标签,也不是让所有员工都使用大模型。让真正的变化发生在生产过程里:AI 参与写代码、排查故障、服务客户和管理集群;人在使用过程中发现的问题,又反过来推动底层系统变化。
它既是基础设施供应商,也是自己的第一批客户。它最早看到不同模型如何协作,也最早碰到 Agent 工作流里的成本问题;它管理大量算力,因此必须让 Agent 参与运维;它本身又是 Token 消耗大户,所以更容易发现那些隐藏的“Token 刺客”。
所以,看起来突破了边界的“前店”并不是突然向应用层的扩张。很大程度上,它是无问芯穹把内部已经发生的 AI 化过程整理出来,再向外输出。
这套体系能够从无问芯穹身上自然长出来,也与它的技术出身有关。
从 2008 年前后开始,团队便在清华大学电子工程系研究软硬件协同。市场里的“商品”不断变化,但核心技术追求一直没有改变。最初,优化的是从电和芯片到模型训练时间的效率;推理兴起后,变成从电到 Token;进入 Agent 时代,又继续延伸到从 Token 到任务结果。
训练、推理、Agent 和具身智能看起来是不同市场,落到这家公司内部,都是同一个问题:如何把有限资源转化成更多生产力。
局部最优总会在下一层被浪费。但软硬件协同出身的团队,会本能地跨层寻找真正的瓶颈。这也是无问芯穹这套模式最大的优势。
在 AGI 到来之前
当很多人看到“前店后厂一中心”的名字时,很容易把它概括成一套中国特色的 AI Infra。
其实并不如此。异构计算、跨集群调度、多模型路由和端云协同,并不只存在于中国。随着预训练、强化学习、推理和 Agent 采用不同计算模式,全球 AI 系统都在变得更复杂。
中国市场的特殊之处,是这些问题来得更早,也更集中。
这里的供给和需求同时高度分散。供给端有多家芯片企业、多种架构、不同区域的算力中心和大量存量设备;模型端有多家闭源公司和活跃的开源生态;需求端分布在制造、能源、医疗、法律、文娱和数量庞大的中小企业。
美国头部科技公司往往可以同时控制芯片、云、模型和应用入口。中国更难由一家公司垂直整合所有环节。这是一种约束,也给中间层留下了更大的空间。
当供给足够统一,客户可以直接选择一套完整技术栈。供给越分散,寻找、适配、组合和运营资源的成本越高,负责集散和优化的那一层就越重要。
而行业眼下真正的问题还不是供给过剩,而是大量需求没有被接住。国产芯片需要进入真实业务,才能持续发现软件和性能问题;模型公司需要更稳定、更便宜的推理;应用公司需要模型真正进入工作流;已经建好的算力中心则希望提高利用率。
无问芯穹不需要替代其中任何一家。它需要证明,自己能让这些分散的能力更有效地协作。
如果“前店后厂一中心”能够运转,会形成三个彼此推动的循环。接入更多芯片和集群,带来更多真实负载;负载帮助系统积累调度经验;效率提高后,又会吸引更多资源进入平台。Token 调用增加,产生更多运行数据;数据帮助它优化路由、缓存、PD 分离和模型组合;成本下降后,平台可以承接更多调用。进入更多行业,则会获得更真实的任务反馈;反馈重新改进 Agent、模型选择和资源配置;任务完成率提高后,公司又能进入更复杂的场景。
可以看出来,这是一个在Infra基础上,构建起来的能让智能继续scale的新的飞轮。
而中国的产业环境,恰好给了它生长条件。这里有足够多的芯片供给方、模型开发者和高度分散的需求。市场不要求一家企业垄断所有入口,只要它能显著提高其中一层的效率,就可能形成足够大的商业空间。
资源受限,也会迫使企业更认真地处理效率。资源充裕时,很多问题可以靠更大的模型、更昂贵的芯片和更多冗余解决。资源紧张时,每一张卡、每一个 Token 和每一次调用都必须被计算,系统效率本身便成为产品。
过去两年,DeepSeek 已经展示过一次类似路径:资源限制不只会带来妥协,也会迫使团队采用更激进的工程方法。无问芯穹代表的是另一种尝试。它不直接参与最强模型的竞赛,而是试图让一个分散、异构、并不完美的产业系统,生产出更多可用的智能。
这套技术也不会永远只服务于目前的需求。当 Agent 进入更多数字系统和物理设备,全球都会面对相似的问题:任务该调用哪一个模型,在哪里执行,使用什么芯片,如何在成本、延迟、隐私和能力之间取舍。无问芯穹此次同时公布了即将开源的首个面向大规模具身任务的云边端一体化管理与调度平台,并升级强化学习框架和推理优化体系。在云端,一次请求慢几秒,用户可能只是失去耐心。到了机器人身上,几百毫秒的延迟就可能决定动作能否完成。数字世界和物理世界差异很大,落到基础设施层,仍然是同一个问题:如何用更低的资源成本,交付更高的任务价值。
在和夏立雪的交流快结束时,我和他谈起 AGI 和 AGI Infra 的区别。
人们习惯把 AGI 想象成一个更强大的模型。但在“无所不能”和“无处不在”之间,还隔着一套庞大、具体,甚至有些笨重的生产系统。过去几年这家跟随 AI 向现实世界移动的年轻公司,把不断看见的断点给接了起来。在AGI到来之前,先把电、芯片、集群、模型、Token、Agent 和现实产业,接成一个彼此协同的系统。这就是无问芯穹眼里的AGI Infra的样子。
“让智能无所不能,是 AGI。”他说,“让智能无处不在,是 AGI Infra。现在我们正在向着这个目标,加速奔跑。”





