00后清华博士生创业“神经接口”:把人类肌肉反应炼成Token
衡宇 发自 凹非寺
量子位 | 公众号 QbitAI
具身智能数采,又多了一条新路线。
正式介绍之前我们来做个小互动:抛开AI、不查资料,5秒内能说出现有的具身数据采集方式有哪些?
真机遥操作采集、无本体便携采集(UMI/Ego)、仿真合成数据、互联网视频蒸馏是最主流的四种方式。
与meta关心的并不是怎样让人更方便地点击、滑动或输入文字不同,秦深涛的思考落在物理AGI缺乏的条件上。
在他看来,首先,现在极度缺乏的高质量物理交互数据,已经成为了制约具身智能机器人进阶的关键。
当下的具身数据采集方式各有弊端,能不能以神经肌电作为切入点,做进一步的补充?
而且,选择神经肌电采集可能可以绕过具体接触面的材料和传感器差异,从人和机器各自的驱动侧出发,寻找到一套能够连接肌肉激活、肌腱发力与关节运动的共享动作表征。
采集,从一条腕带开始
2025年,博士在读的秦深涛正式创业,注册成立OriginFlow,愿景是为Physical AGI构建文本、视频之外的“动作基座”。
不久,团队提出了NeuroScale技术体系。
NeuroScale并不是简单地在现有具身数据采集设备上增加一条肌电腕带。
它是一套从信号采集、物理量重建、动作表征到跨本体迁移的数据与模型体系。
该体系以非侵入式神经运动接口为信号入口,融合神经肌电、第一视角视觉与IMU等多模态信息,通过PULSE基座模型重建人类操作中的姿态、接触力和驱动力,并将一次真实操作整理为机器可学习的Human Tokens。
NeuroScale长期关注两个核心问题。
其一,如何实现Human Data Scale Up?
也就是在尽量不打扰人自然感知与运动的前提下,持续记录真实操作,生产更多高质量的物理交互数据。
其二,如何实现Human与Robot之间的Cross-Embodiment Transfer,让人的动作经验经过表征与适配,进入不同结构的机器人。
在这两个问题之下,还对应着一个更基础的技术问题:人类动作究竟应该以什么形式进入基础模型?
文本已经形成相对成熟的Token表征,视觉也逐渐收敛到Patch或Latent表征,但动作模态至今仍缺少公认的规范表征。
OriginFlow将一次物理操作拆解为三个相互关联的空间:
描述手部姿态和运动轨迹的MotionSpace
描述法向力、切向力与接触反馈的TactileSpace
描述肌肉、肌腱驱动力和关节力矩的TendonSpace
驱动力产生运动,运动带来接触,接触最终形成作用力,三者共同构成一条物理因果链。
OriginFlow所说的Human Tokens,正是建立在这三类物理量之上的动作表征。
“在形式上,人可被视为本体(embodiment)构型空间中的一个特例。因而‘人到机器人’的迁移,本质上是‘跨本体迁移’的一个子问题。”秦深涛说。
具体而言,大规模Human Data负责覆盖尽可能广泛的人类动作与技能分布;规模相对较小、但机器人构型足够多样的Cross-Embodiment Data,则提供人和不同机器人本体之间的对齐锚点。
两类数据结合后,模型有机会学习出一套与具体本体相对解耦的共享动作表征,再将同一段人类动作和发力信息,重定向到不同自由度、不同驱动方式的机器人本体上。
因此,OriginFlow并不是希望把人的操作数据直接复制给机器人,而是先寻找不同本体之间可共享的动作、驱动力和接触关系,再完成适配与映射。
落到现实世界里,NeuroScale则从一条腕带开始。
腕带被命名为OriginKitGen 1.0,设计上略宽于Apple Watch的表带,但整体体积更小、重量更轻。
腕带负责采集佩戴者发出的微伏级表面肌电信号,其系统采用16通道采集,信息码流约为每秒96KB,并对手部运动进行连续建模。
不过NeuroScale的落地也不只靠腕带。
单靠腕带,系统只能知道前臂肌肉活动的变化,却很难判断这意味着手指具体在做什么。
OriginKitGen 1.0采到的信号,会与第一视角视觉、IMU等信息一同进入NeuroScale的数据链路。
原始波形经过对齐、校准和处理后,再由团队自研的基座模型PULSE提取其中与手部姿态、运动轨迹、接触力及肌腱发力有关的线索——分别对应Motion Space(运动空间)、Tactile Space(触觉空间)和Tendon Space(肌腱空间)三类核心物理量——硬件端做滤波、差分、运动伪迹抑制,模型端做神经信号编码和强监督学习——逐步整理成机器能够学习的动作表征。
这就是团队所说的Human Tokens。
WAIC期间,秦深涛与团队展示了现阶段的成果,PULSE 0.2版本的demo:
腕带负责采集16通道表面肌电信号,PULSE以这些信号为输入,对手部运动进行连续建模,并观测对指动作中的发力变化。
与离散的手势识别不同,PULSE关注的是连续的手部追踪与指尖力表征。
当用户做对指动作时,系统能够实时观测到发力的变化。
不过,从一段神经信号中重建动作,并不等于已经获得可以直接用于机器人训练的数据。
原始数据还需要经历多设备时钟对齐、个体校准、运动伪迹处理、任务切分、动作与力标注、质量筛选以及跨本体映射。
为此,OriginFlow还搭建了一套覆盖数据生产、加工、评测和训练的Data Infra。
其中,ORACLE利用多模态模型完成动作、力、语义与任务片段的自动化标注;全模态统一基座CHORD负责神经肌电、视觉、IMU、语言及机器人状态之间的时序和表征对齐。
数据还会依次经过物理有效性、任务有效性、标注有效性、模型价值和真机评测等质量环节。只有能够在模型训练或机器人任务中产生实际价值的数据,才会进入最终交付的数据集。
也就是说,不仅要把数据采下来,还要能够以足够低的边际成本,将海量原始信号加工成可训练、可评测和可复用的数据资产。
从Human Data走向Enhance Human
PULSE 0.2演示出的只是公司的一小部分业务,模型本身也只是阶段性产出。
正在研发中的PULSE 0.3在进一步探索肌腱发力与手部前向运动学(forward kinematics)之间的关系。
前面提到的腕带,也只是当前采集终端而非最终产品形态。
对于一条依赖长期、规模化采集的路线而言,设备能否被人自然地接受,决定了数据能否持续产生。
秦深涛说,要让人先愿意戴上设备,还要愿意戴得足够久。
究其本质,OriginFlow希望在尽量不改变人原有感知与运动方式的前提下,持续记录人在真实世界中的动作输出,并将其加工为Physical Tokens。
只有这样,数据采集才能离开数采厂和专门搭建的工位,进入日常生活与真实生产流程。
到那时,具身智能领域现在遥不可及的“万亿小时数据”,只需要将全人类的行为记录十天左右。
秦深涛将这一过程描述为数据Scaling的持续放大。
面向未来,我们将推动全模态Human Data的规模,从千万小时、上亿小时,逐步迈向万亿小时。
而团队设想中的下一代物理入口,将逐渐走向更轻、更自然,也更接近消费品的形态。
在他们的设想里,未来,人们只需佩戴具有消费属性的眼镜、手表,或更轻量的手环,即可在日常生活中持续地对自身建模,并从个人模型中获得便利。
△图片由AI生成
总体来说,OriginFlow这家公司现阶段做的事情,还处于对自己发展规划的第一阶段。
他们给自己规划了三阶段发展路线——第一阶段,From Human,先把人怎么动尽量采下来,把人在物理世界中的操作经验,系统性地蒸馏、转化为机器可学习的数据与表征。
OriginFlow希望在不干预人类自然感知与运动过程的前提下,完整还原人的动作输出。
整套采集方案始终遵循非侵入式原则,确保人在维持原有状态的同时,动作能被系统精确观测并复原。
第二阶段,With Human。
这一阶段将构建包括机器人在内的新一代AI硬件,以Always-on的形态融入日常工作与生活,让更多人享受到下一代人机接口(Interface)带来的价值。
第三阶段则是面向未来10到30年的Enhance Human。
当然,从PULSE 0.2的一次对指演示,到全模态Human Data的万亿小时规模,中间还隔着漫长的工程验证。
One More Thing
据悉,国内创业公司还有强脑科技、章鱼动力、SnowOrigin、念象科技、无界脉络、手亿科技等也在利用神经肌电采集具身智能数据。
