宇树UnifoLM-OminiA-0.3发布,解锁具身机器人全模态交互
近日,全球四足
机器人
领军企业宇树科技正式发布新一代具身大模型UnifoLM-OminiA-0.3,这款专为机器人场景深度定制的端侧大模型,打破了传统人机交互中单一指令输入的局限,实现了语音、视觉、触觉、动作指令的全模态统一理解,让宇树全系机器人产品拥有了更贴近真实生物的自然交互能力,为具身智能的落地体验带来了突破性升级。
当前消费级与工业级具身机器人的交互体验始终存在明显短板:多数产品只能识别预设的标准化语音指令,无法同步理解用户的手势动作、环境画面与语音内容的关联逻辑,更无法通过机身搭载的触觉
传感器
感知外界的物理交互信息。用户想要让机器人完成复杂任务,必须分步输入多条精准指令,一旦环境出现变化,机器人就很容易出现理解偏差,这种“指令式交互”的体验,远远达不到大众对智能机器人的期待,也成为制约具身机器人走向大规模普及的核心瓶颈。
宇树UnifoLM-OminiA-0.3正是瞄准这一体验痛点推出的定制化大模型。不同于通用多模态大模型偏向云端内容生成的设计逻辑,这款模型从底层架构上针对机器人的物理交互场景完成重构,将语音语义理解、三维视觉感知、触觉
信号
解析与动作规划能力深度融合,所有模态的输入信号都能进入统一的模型推理链路,无需分模块处理再拼接结果,实现了真正的全模态统一理解。用户不需要说出精准的标准化指令,仅凭自然的口语表达搭配随手的手势动作,机器人就能同步关联环境画面,快速读懂用户的真实意图。
针对宇树机器人的硬件特性,模型还做了大量端侧优化:轻量化的模型架构可以直接在机器人本地的边缘算力单元上运行,不需要依赖云端网络传输,即使在离线状态下也能完成全模态交互推理,响应延迟控制在百毫秒级别,完全满足实时交互的需求。比如用户在机器人面前指着地上的水杯随口说“把这个拿过来”,机器人不需要额外分步操作,就能同步通过视觉定位水杯位置、通过语音理解指令目标,自主规划移动与抓取路径,直接完成任务,整个过程和人与人之间的自然交互几乎没有差异。
除了面向消费场景的交互升级,这款模型也适配工业级具身机器人的作业需求:机器人可以通过机身搭载的触觉传感器,感知外界的物理触碰信号,结合视觉画面理解人类的引导动作,比如工作人员直接用手调整机器人的
机械
臂姿态,模型就能同步记录下这个动作轨迹,后续自主复现相同的作业流程,不需要专业人员通过复杂的
编程
界面完成示教,大幅降低了工业场景下机器人的调试门槛。目前这款模型已经开始逐步推送至宇树全系机器人产品,老用户也可以通过OTA升级获得全模态交互能力。
具身智能的终极体验,从来都不是让机器人执行冰冷的预设指令,而是让它能像生物一样自然理解物理世界的多元信号。宇树UnifoLM-OminiA-0.3的发布,让机器人的交互逻辑从“识别指令”进化为“理解场景”,为具身智能的体验升级开辟了全新方向,也将推动智能机器人更快地融入日常消费与工业作业的各类场景。
四足机器人
四足机器人
+关注
关注
1
文章
106
浏览量
15788
大模型
大模型
+关注
关注
2
文章
4097
浏览量
5527
宇树科技
宇树科技
+关注
关注
1
文章
71
浏览量
1024
