Science Robotics 封面论文| 在森林里飞奔的机器狗:KAIST猎犬如何做到6米/秒的野外疾驰?

导语:你见过能下楼梯、跳高台、在森林里飞奔的四足机器人吗?来自韩国科学技术院的HOUND机器人刚刚做到了。2026年7月,一篇发表在《Science Robotics》上的论文展示了一项令人瞩目的成果:这只机器狗不仅在复杂的野外森林中自主穿越0.34公里,还能在跳下三级台阶时瞬时达到6米/秒的峰值速度——这比博尔特跑100米的最快速度还要快。更关键的是,它的所有判断和动作都只靠自己的“眼睛”和“大脑”完成,不需要任何外部辅助。
一、现有四足机器人的瓶颈
要让四足机器人在真正的野外环境中自由奔跑,现有的技术路线其实都遇到了各自的瓶颈。
基于模型的控制方法,依赖精确的物理动力学方程和优化算法来规划每一步的动作,在建模条件下表现不错。但问题在于,真实的野外环境充满了不确定性——地面的摩擦力、接触动力学、碎石和树枝的碰撞——这些复杂因素很难被精确建模和估算。一旦环境超出了模型的预设范围,性能就会大幅下降。
强化学习方法,让机器人在仿真环境中自己“摸索”出最优的运动策略,在平坦地形上已经展现出不错的敏捷性。但这类方法常面临样本效率低下的问题,而且需要精心设计的奖励函数来引导机器人产生真实而动态的行为。更麻烦的是,如果要让一个端到端的强化学习策略同时掌握多种步态和运动技能,每种技能的表现往往会因为互相妥协而打折扣。
基于运动先验的方法,给机器人看“标准动作演示”,让它模仿着学。但这类演示数据要么依赖昂贵的动物动作捕捉,要么需要额外的强化学习阶段来匹配参考运动轨迹。而且当机器人遇到训练时没见过的地形时,适应性往往不够。另一条思路是层级强化学习和专家混合架构,预先训练几个“专家”策略,然后根据需要选择调用。但在变化的地形条件下,这些方法在技能之间的平滑切换上仍然存在局限,往往只能在训练时见过的障碍物类型中才能良好工作。

二、APT-RL:让机器人先学“通用运动基因”,再学“特殊技巧”
KAIST团队的解决思路很巧妙。他们开发了一个叫APT-RL的统一框架,核心逻辑是三步走。
第一步:用简化模型批量生产高质量运动数据。这个思路的核心洞见在于:与其让强化学习从零开始在仿真环境中盲目试错,不如先给机器人一套高质量的“运动百科全书”作为起点。团队使用了二维轨迹优化技术——把机器人的动力学简化到矢状面(前后方向)上,用单刚体模型来捕捉最核心的全身动力学特征,同时大幅降低模型维度和计算复杂度。这个简化让数据生成变得极其高效:仅仅8分钟,就能生成18万条运动轨迹,总时长达到15.5小时。这些轨迹覆盖了-2到7米/秒的速度范围,每条都同时记录了运动状态和对应的关节扭矩指令,形成了物理上有效、行为上多样且自带“参考答案”的高质量数据集。
第二步:用一个Transformer架构的变分自编码器(TVAE)把多种步态统一到同一个潜在空间。这个步骤的关键作用是将不同运动行为中的共同结构进行抽象和整合,使模型能够理解“奔跑”这一抽象概念在不同步态下的统一表征。潜在空间结构使得小跑和跳跃等不同步态能够被平滑地连接和切换,潜变量自然地编码了速度、步态类型、运动阶段等多维度特征,而步态切换则对应于潜变量在这个空间中的平滑位移。更重要的是,团队专门为每种步态训练了扭矩解码器——给定一个潜在表示,解码器就能输出对应的关节扭矩指令。这相当于把“怎么发力”的知识也内置到了模型中。
第三步:用强化学习在复杂三维地形中“微调”。有了预训练的运动先验和扭矩解码器,策略不再需要从零开始摸索,而是在潜在空间中选择合适的表示,同时学习一个辅助动作来补偿预训练数据和真实物理环境之间的差异。与传统残差策略不同,本框架中的潜在动作和辅助动作是联合学习的,而非用一个固定基策略加上加法修正。最终策略输出三个分量:潜在动作(输入给预训练扭矩解码器)、辅助动作(通过比例-微分控制器提供补偿扭矩)、以及步态选择信号(在2 Hz频率下自主决定该用小跑还是跳跃)。
这种设计的精妙之处在于,它把“通用的运动知识”和“特定场景的适应能力”解耦了。预训练解码器提供了从二维轨迹优化中学到的、经过物理验证的运动模式;辅助动作则负责处理那些二维模型无法覆盖的三维动力学、复杂接触和不规则地形。实验分析验证了这一设计:在正常情况下,运动主要由解码器扭矩驱动,这让机器人的动作保持高效和自然;但遇到需要特殊应对的情况时——比如跳跃过障碍物、腿意外受损、或需要原地旋转——辅助扭矩就会显著增加,帮助机器人调整腿部轨迹,甚至生成原始数据集中根本没有的动作模式。

三、从城市台阶到森林小径:机器人展现“步态自由”
这套系统在真实世界中的表现如何?团队在三个截然不同的场景中进行了长时间导航实验。
城市场景:机器人完成了1.1公里的城市环境穿越,包括多层楼梯、草地和斜坡。最有冲击力的一幕是“跳楼梯”——机器人面对三级台阶(每级高30厘米、深58厘米),以4.3米/秒的指令速度一跃而下,瞬时峰值速度达到6米/秒。这个速度意味着,机器人在着陆过渡的瞬间,身体中心相对于接触脚的速度相当于一辆市区行驶的汽车。
野外场景:机器人穿越0.34公里的无结构森林地形,面对倒下的树木、裸露的树根、不平整的原木和覆盖落叶的湿滑地面。它在不同场景中自主选择合适的步态——跳跃过横倒的高木,在不规则区域切换为小跑以保持稳定,随着指令速度增加又恢复跳跃。整个过程完全自主,没有人类干预。
室内障碍赛场景:机器人采用小跑步态爬楼梯,在跳下90厘米垂直台阶前自主转换为跳跃步态,并在起飞前精确调整脚步节奏。在另一个场景中,它甚至跳过一个60厘米高的台阶,瞬时速度达到4.25米/秒。
机器人在各种地形中自主决定使用哪种步态的行为,取决于地形特征、自身状态和指令速度这三个因素的共同作用。在较低障碍物前,即便指令速度固定为2米/秒,它也会选择更稳定的慢跑;面对更高障碍时,它则切换到更有爆发力的跳跃。这种能力不是事先编程的,而是策略在训练中自主涌现的。
四、为什么只选两种步态?五种步态的全面PK
一个自然会问的问题是:为什么只用小跑和跳跃两种步态?
团队的回答很严谨:他们做了一个全面的消融实验。把五种步态——慢跑、跳跃、速度、疾驰、跳跃——在楼梯、障碍、踏脚石、崎岖地形、高阶、缝隙等七种不同地形上逐一对比,评估维度包括成功率、速度追踪能力和能量效率。结果是,慢跑和跳跃在所有地形上综合表现最可靠且互补——慢跑稳定性好,适合低速和规则地形;跳跃爆发力强,在高速和需要跨越障碍时表现优异。其他步态虽然在特定条件下有优势(比如配速步态能量效率高,疾驰和跳跃在特定地形能耗低),但整体表现不够稳定,方差大、成功率低,不适合作为通用部署方案。
所以,选择两种步态不是能力限制,而是基于实验数据的理性决策——在泛化性和性能之间找到了最优平衡。
五、传感器组合的艺术:为什么机器狗需要“近视”和“远视”兼备?
高速奔跑中的机器人需要在几秒前就预见到即将到来的地形,才能有效规划动作。单一的深度相机虽然能提供密集的局部几何信息,但有效感知范围只有0.3到3米;对于以超过4米/秒速度奔跑的机器人来说,这个距离不足以支撑可靠的提前决策。
团队的解决方案是传感器组合:用深度相机提供近距离的密集空间数据,用二维激光雷达提供远距离的稀疏但准确的地形信息——激光雷达的垂直视场比深度相机大三倍以上,更新频率40 Hz,感知距离远超相机。消融实验结果也印证了这一策略的有效性:双传感器组合在所有地形上的成功率都是最高的。只用激光雷达,在需要精确局部几何的地形(如障碍物、踏脚石)上表现下滑;只用深度相机,在需要远距离预判的地形(如楼梯、高阶)上能力不足。
为了在高速撞击的恶劣环境下保护传感器,团队还在机器人头部和激光雷达之间安装了定制的3D打印减震器——实际测量中,高速运动产生的撞击加速度常常超过10g,足以导致传感器故障或关机。这个看似微小的工程细节,恰恰是从仿真到真实部署的“最后一公里”保障。
六、消融实验揭示的核心贡献
论文的消融实验从多个角度系统验证了APT-RL的核心贡献。
在与AMP(对抗运动先验)和原版强化学习的对比中,AMP虽然用同样的运动数据集训练,但在三种地形上的能耗都更高——因为AMP的正则化机制倾向于让策略模仿参考运动,当地形与参考运动模式不同时反而降低了灵活性。原版强化学习在某些地形上能耗表现不错,但成功率在不同地形间差异很大,说明针对不同地形需要单独调优奖励函数,缺乏通用性。
在与层级强化学习+残差策略的对比中,APT-RL展现了两大优势。一是适应能力更强——层级强化学习基线在从平坦地形迁移到复杂地形时遇到瓶颈,即使最后阶段进行了策略微调也改进有限,因为不同专家策略之间存在分布不匹配的问题。二是样本效率更高——APT-RL使用了更少的总体训练样本,但由于不需要专家预训练阶段,追踪表现反而更好。
在动态步态转换测试中,这个对比更加明显。实验以2 Hz频率随机触发小跑和跳跃之间的切换,模拟真实场景中快速变化的地形需求。结果显示:APT-RL在多个指令速度下都表现出更高的转换成功率,机器人在步态切换时能够顺畅调整摆动和站立阶段的时机,逐步稳定为新的步态模式。层级强化学习基线则经常无法应对专家策略之间的突然切换,导致蹒跚和生存时间缩短。
七、与现有方法的本质差异
要理解APT-RL的独特价值,需要把它放在现有的技术图谱中来看。
与AMP等方法相比,APT-RL的预训练数据集来自轨迹优化而非动物动作捕捉。这意味着数据获取成本低、规模化容易,而且每条轨迹都附带了相应的扭矩指令——状态和动作是联合生成的,不需要额外的强化学习阶段来“补上”动作信息。
与层级强化学习和专家混合架构相比,APT-RL用单一的潜在空间统一了多种步态和运动技能,切换是平滑的潜变量位移,而不是离散的模块切换。这让策略在面对未见过的地形时拥有更大的灵活性和适应性。
与基于运动先验的方法相比,APT-RL的解码器直接输出关节扭矩,而不是先输出运动轨迹、再靠另一层控制器去跟踪。这种端到端的扭矩级控制,在高速和复杂地形下避免了中间环节的误差累积和执行延迟。
与基于模型的控制方法相比,APT-RL继承了对物理动力学的结构化理解——这是从轨迹优化数据中学到的——但又通过强化学习和辅助动作保留了对不确定性的适应能力,兼具了模型的先验优势和学习的灵活性。
八、结语
KAIST团队在论文最后提到,这个框架不仅适用于四足机器人,也可以扩展到双足或人形机器人平台。他们已经展示了将APT-RL应用于ANYmal、Go1和HOUND的双足模式的初步结果。
这项研究的核心价值在于,它提供了一种新的范式——通过轨迹优化批量生成高质量的“运动知识”,用统一表征将这些知识整合为可重用的先验,再用强化学习在真实环境中进行适应和微调。这不是纯靠数据驱动的暴力学习,也不是纯靠人工建模的精确控制,而是两者的深度融合——既享受了模型的结构化先验,又保留了学习的灵活性。
当这只机器狗在森林里灵活奔跑、自主选择步态越过倒下的树干时,我们有理由期待,四足机器人在更复杂、更危险的野外任务中——比如灾后搜救、森林巡逻、未知环境探测——展现出真正的实用价值。
论文信息
标题: Agile perceptive multi-skill locomotion for quadruped robots in the wild
作者: Joon-Gyu Kim, Jaehyun Park, Tae-Gyu Song, Junha Kim, Seungwoo Hong, Hae-Won Park
机构:韩国科学技术院
期刊:Science Robotics,2026年7月15日,第11卷第116期
DOI:10.1126/scirobotics.adz7397
机器人平台:KAIST HOUND

商务合作
商务活动|宣传推广|转载开白等
邮箱|1784288990@qq.com
联系电话|18355423366
END
“
如果内容对您有所启发,欢迎在评论区留言
请点赞、转发、小心心,将公众号设置为星标
”



