世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型
发布时间:2026-07-29来源:传感器技术
机器人前瞻7月28日报道,今日,通用具身基础模型公司智在无界BeingBeyond正式发布全球首个隐式触觉世界动作模型Being-H0.8。据悉,Being-H0.8首次将触觉模态引入大规模模型预训练,并将视觉、触觉、动作以及未来状态变化统一到同一隐空间(latent space)。这使机器人能够进一步理解“世界因此发生了怎样的变化”,从而形成对物理交互过程更加完整的认知与预测能力。智在无界是业内率先提出以大规模人类视频数据来训练通用具身基础模型框架的团队。据悉,智在无界建立了人类交互数据库UniHand 3.0,该数据库覆盖自然物体交互、长时程任务、丰富手部动作及多样化场景,汇聚了超过50万小时的第一人称视频数据,该公司还与数十家数据合作伙伴建立合作。智在无界称,其已完成从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施建设。
01.
第一个平台采用两台珞石(ROKAE)AR5机械臂,并支持更换不同的灵巧手以进行跨具身评估(Cross-embodiment evaluation)。这一平台包括拥有16个主动驱动自由度和21个总自由度的LinkerHand L25,以及采用腱绳驱动(Tendon-driven)、拥有12个主动驱动自由度和22个总自由度的DexHand 021。其中,L25的每个指尖均集成了12×6的压阻式压力传感器(Piezoresistive pressure array),而DexHand 021则集成了指尖视触觉传感器(Visuotactile sensors)。第二个平台则由两个RealMan RM65机械臂组成,这些机械臂配备了Inspire夹爪以及Daimon DM-TAC W2M触觉传感器。在智在无界提供的视频中,机械臂可通过触觉感知完成挤牙膏、找出包中隐藏物品、写毛笔字等操作。▲机械臂挤牙膏(来源:智在无界)
▲机械臂寻找水杯(来源:智在无界)
▲机械臂写毛笔字(来源:智在无界)
▲机械臂摘葡萄(来源:智在无界)
02.
据悉,Being-H0.8相较于前代Being-H0.7的核心突破,是首次将触觉模态系统性地引入隐式世界模型架构,它也是首个结合大规模人类视频与触觉信息开展预训练的具身基础模型。触觉的加入,使模型能够感知视觉难以直接观测的接触状态、受力变化与物体约束,从而完成仅依赖视觉难以稳定解决的接触密集型任务。为了充分利用高频触觉反馈,Being-H0.8进一步提出慢快动作专家(Slow-Fast Action Expert)。在标准的完整动作块生成机制之上,该模型引入了一条轻量级的快速更新流:系统首先在每个动作时域(horizon)开始时计算一次“世界—动作上下文”并进行缓存。随后,在时域内少数几个锚点(anchor)处,注入最新观测到的本体状态与触觉反馈,动态生成或修正当前正在执行的动作片段。针对触觉数据规模较小的瓶颈,智在无界自研了面向大规模无标注人类视频的密集触觉伪标签系统TactoHand。该系统无需为数据采集者配备触觉手套或额外传感器,即可从普通人类视频中推断手部与物体交互过程中密集空间点的接触概率和连续接近度(continuous proximity),可为视频补充触觉监督。而在Being-H0.8中,智在无界提出了第二代统一动作空间TopoHand,为人类手部、灵巧手和平行夹爪提供统一的运动学接口。TopoHand采用固定拓扑的“螺旋手”(screw-hand)表征,由20个语义关键点和20个规范关节变量组成,并以手腕为中心建立统一坐标系:x轴指向中指指尖在手掌平面上的投影方向,z轴与手掌法线方向一致,y轴则用于构成右手坐标系。在这一表示下,不同本体特有的关节命名、机械结构和网格拓扑均被隔离在策略接口之外。由此,该模型不再直接依赖某一具体机器人或人手模型的原始关节定义,而是在统一的语义拓扑和运动学空间中学习操作规律。相比第一代UAS,TopoHand实现了控制变量层面的兼容,使大规模人类视频中的操作先验能够更加高效地迁移到多种机器人本体,并显著提升跨本体预训练的效率与可扩展性。
03.
为了训练Being-H0.8,智在无界收集了超过50万小时的原始第一人称人类视频资料。智在无界称,这是迄今为止规模最大的人类视频数据集,而且该数据集中的每个样本都可以被追溯到其来源。该数据库将原始的第一人称视频数据转化为结构化的具身训练数据,其中包括以交互为核心的视频片段、时间上连贯的手部动作轨迹,以及3D空间信息。智在无界称,其数据筛选管线(Curation pipeline)去除了冗余的Episode(任务轨迹片段)与Segment(子片段),在保留具身学习所需的“以操作为中心”(Manipulation-centric)结构的同时,使UniHand 3.0数据集在多样性特征分布上更接近通用多模态视频。该管线专为大规模自然环境(In-the-wild)数据设计,大幅减少了严重跟踪错误、手型扭曲以及不可用的轨迹。其自动化质量控制阶段更可在预训练前检测出超过92%的错误任务轨迹片段。智在无界称,其还实现了异构机器人数据的标准化处理。为了管理这种异构性(Heterogeneity),该公司将每个数据源拆分为可复用的平台级具身规范(Platform-level embodiment specification)与数据集级元数据(Dataset-level metadata)。如此一来,标准化过程就被简化为两个可控的步骤:首先将不同的机器人平台映射到统一的具身接口(Shared embodiment interface),随后再开展针对特定数据集的标定、同步与校验(Calibration,synchronization,and validation)。对于每个受支持的平台,规范的URDF文件(Canonical URDF)定义了机械臂的运动学(Kinematics)、双臂几何关系(Bimanual geometry)、关节命名(Joint conventions),以及手腕或末端执行器坐标系(Wrist or end-effector frames)。而通过机器人几何结构、记录的元数据以及视觉观测结果所恢复出的标定参数,智在无界能够将原始的状态与动作数据映射到URDF这一统一规范中。并且,每个完成对齐的数据集都会经过数据完整性、跨流同步性(Cross-stream synchronization)、运动学一致性以及语言-视频匹配度(Language–video agreement)的检查。未通过校验的样本会被直接过滤,或被送入专门的重处理流程;而高质量的任务轨迹片段则采用几何一致的变换(geometry-consistent transformations)进行增强,以保持图像、状态、动作和语言之间的一致性。
04.
从Being-H0.8的发布可以看出,“触觉感知”与“跨具身泛化”正成为具身智能基础模型走向通用化的关键突破口。智在无界通过TactoHand解决触觉数据规模化难题,借由TopoHand打破不同机器人硬件的统一动作表征壁垒,再辅以UniHand 3.0这一规模化的数据库,为行业提供了一套从底层算法、数据清洗到硬件落地的完整范式。随着隐式世界模型对物理交互规律理解的持续深化,“视觉+触觉”进一步推动机器人走出实验室与特定工况,在居家服务、复杂工业精细操作等真实场景中展现出更高的泛化性与鲁棒性。具身智能从“看得见”迈向“摸得准、控得精”的产业化拐点,或许比预想中来得更快。
免责声明:本文版权归原作者所有。本文所用视频、图片、文字如涉及作品版权问题,请第一时间告知,我们将根据您提供的证明材料确认版权并按国家标准支付稿酬或立即删除内容!本文内容为原作者观点,并不代表本公众号赞同其观点和对其真实性负责。
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。