光象科技吕尧:物理AI突破数据桎梏,底层范式创新引领产业新方向
在当下国内AI产业蓬勃发展的浪潮中,物理AI成为备受瞩目的焦点领域。通用大模型擅长处理人类构建的符号世界,聚焦于语言与知识的解析;而物理世界大模型则另辟蹊径,通过学习真实世界的物理因果关系,实现对环境状态的推演,从而应对现实场景中复杂多变的挑战。我国制造业底蕴深厚,为物理AI提供了广阔的应用空间,使其得以在这片土壤上生根发芽。
对于物理世界大模型的发展前景,学术界看法不一。部分业内专家指出,物理现实世界中物理效应繁多,参数过于复杂,这将成为世界大模型发展道路上的“绊脚石”。然而,更多业内人士对物理AI的未来发展充满信心。他们认为,若将应用场景设定在特定的可控环境中,打造专属特定领域的行业大模型,无需追求通用能力,而是聚焦于场景内的物理规则与业务逻辑,这样更易于实现安全、可靠的规模化产业落地。以特斯拉最新一代自动驾驶AI为例,它通过在真实世界中进行有限的操作并结合观看视频,就能让机器人AI理解真实世界。
在行业积极探索物理AI可行落地方案的背景下,国内物理AI领域的领军者光象科技,于8月25日联合清华大学李升波教授课题组,发布了第一代物理原生世界模型——Phi-WM 1.0 ActEffect,简称ActEffect。该模型落地“物理原生智能(Phi)”技术路线,为具身智能行业带来了全新的发展思路。围绕行业技术瓶颈、模型底层逻辑、数据壁垒以及产业落地等核心问题,光象实验室首席科学家吕尧分享了他对物理原生世界模型及行业发展趋势的独到见解。
吕尧认为,当前行业广泛采用的纯视频预测方案,虽能借助数据规模法则提升性能,但这种统计拟合路线存在难以突破的局限。该方案仅学习输入与输出之间的映射关系,缺乏物理规律与结构约束,模型易受幻觉问题困扰,难以将任务成功率从99%提升至100%。要让机器人真正可靠地完成任务,不能仅依赖拟合海量示范数据,而必须在训练过程中遵循客观物理规律与动作因果,让模型理解动作如何改变现实世界,这也是光象科技打造物理原生模型的初衷。
“真正从底层理解世界规律,而非依靠不断的数据输入和尝试来拟合结果。”吕尧强调道。实际上,光象科技探索的物理AI路径符合AI的发展趋势。早期,DeepMind开发的AlphaGo Zero仅输入围棋规则,便完成了对围棋的学习。光象科技的路径与AlphaGo Zero有异曲同工之妙,它选择隐状态空间路线,不追求复刻画面的全部细节,而是提取与任务强相关的状态信号,在特征空间完成状态转移学习,从而输出可靠动作。物理原生模型从数据中学习底层物理规律后,面对全新场景只需少量数据即可完成迁移,知识的可泛化、可迁移是该路线的重要优势。
光象科技对ActEffect的定位十分清晰。吕尧表示,对外发布的ActEffect属于底层通用基础模型,未来将以该基座为原点,蒸馏适配不同垂直场景的专用模型。现阶段已在工业真实场景投入使用的模型,虽沿用相同技术路径,但训练目标更为聚焦,专门打磨面向具体场景可复用的泛化技能,并非直接将通用底层模型投入使用。
作为物理原生智能的首个模型化实现,物理原生世界模型ActEffect实现了三方面技术创新。在LIBERO、LIBERO‑PLUS和RoboCasa‑GR1三项国际通用机器人操作基准测试中,分别取得了98.8%、80.3%和67.5%的平均成功率,多项指标领先。该模型可一次性生成三套精细程度各异的动作方案,并对各方案的潜在执行结果进行预测比对,选出最优方案。同时,它还会按层级迭代优化动作方案,规避虚假改进,要求精调方案预测效果优于粗调方案,粗调方案优于初始方案,并通过技术机制保障精调方案的性能提升源于自身迭代优化,而非靠压低其余方案的评估得分实现。
在谈及算法护城河的构建时,吕尧认为,光象科技的壁垒源于数据与算法双重维度。在数据层面,如何大规模产出高保真仿真资产的反事实、动作干预类训练信号,并通过强化学习挖掘这些信号以学习世界状态转移规律,其中蕴含大量行业经验。即便对手能够通过模型蒸馏复制最终模型的输出能力,但整套强化学习训练流程却难以复刻。调度大规模并行仿真环境、调配不同质量等级的训练数据,这些属于训练过程层面的逻辑,不属于模型权重承载的知识,蒸馏手段无法直接带走这部分核心能力。
