智源学者研讨会聚焦具身智能 探讨技术演进与产业落地路径
【环球网科技综合报道】8月27日,“智源学者·具身智能学术研讨会”在北京举办。来自北京大学、清华大学、北京航空航天大学、中国科学院自动化研究所等高校及科研院所的20余位专家学者参会,围绕世界模型、具身智能架构及灵巧操作三大核心议题展开研讨,旨在推动人工智能从数字空间向物理世界延伸,探索具身智能规模化落地的可行路径。
世界模型:补齐物理感知与策略学习闭环
在世界模型专题研讨中,与会专家指出,当前该领域范式多元,已在视频生成、JEPA系列及3D空间表达等方向取得进展,但尚未形成统一标准或显著落地效果。专家认为,世界模型服务具身智能的关键在于补齐“物理感知”与“策略学习”的能力闭环,解决预测状态对行动指导的缺口。在数据层面,“交互性”与“多样性”被视为训练核心标准,需合理配置第一视角、仿真及互联网数据比例。除具身智能外,AI for Science、医疗、游戏及数字孪生等领域也被视为重要应用方向,业界期待以快速泛化与上下文学习能力为标志的技术突破。
具身智能:突破物理理解瓶颈 建立统一标准
针对具身智能从实验室走向规模化部署的挑战,与会学者认为,制约发展的关键并非本体硬件,而是对物理空间的结构化理解与推理能力,以及本体、模型、数据间缺乏统一标准导致的高迁移成本。在技术架构上,分层式架构及大模型、世界模型与VLA模块的协同成为主流探索方向。关于数据建设,专家呼吁补齐长尾交互行为等高质量数据,并建立分类筛选机制。在商业化节奏方面,工业等垂直场景有望率先落地,通用智能的实现仍需数年时间,安全体系与生态建设需同步推进。
在灵巧操作研讨环节,学者们指出当前机械手与人类手部能力仍存在显著差距,材料科学与传感器技术是主要瓶颈。尽管驱动器性能差距缩小,但主端遥操作设备普遍缺乏力触觉反馈,采集频率难以满足精细作业需求。数据方面,面向泛化任务的高维动作空间数据匮乏,抓取及不同材质处理等基础动作仍是难点。视触觉技术虽在带宽与帧率上有所提升,但在标准化、稳定性及耐久性方面仍待突破。
构建全栈技术体系 打造学术交流平台
据悉,智源研究院已构建自底向上的具身智能全栈技术体系,发布了悟界·RoboBrain和悟界·RoboOS。目前正研发以预测下一个物理状态为核心的悟界·RoboBrain Orca,通过融合第一视角交互数据强化世界模型的具身表征。
本次研讨会由智源研究院主办,东城区隆福寺协办。作为常态化高端学术交流平台,智源学者研讨会持续推动跨学科思想碰撞与协作,为具身智能技术演进提供理论支撑与实践指引。(张阳)
