机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%

从静态演示走向动态部署,如何让机器人在真实世界持续学习?
当机器人从展厅展台走进产线,棘手的工程矛盾日益凸显:机器人的物理世界是连续、不可逆且具有物理惯性的,而驱动机器人的端侧推理却动辄耗时数百毫秒。
尽管业界普遍依赖“动作分块(Action Chunking)”机制,一次预测数十帧动作,但在有限的端侧算力下,模型依然追不上机械臂的高频节拍。面对不能泄力的高速动态操作,停顿就等于失败。
工业上通用的妥协是“异步推理(Asynchronous Execution)”:机械臂不停,模型在后台错位计算下一批动作。但这套保住连续运动的机制,却同时破坏了在线强化学习赖以成立的因果基础,常常让机器混淆“计划过的”、“真正干过的”与“半路被覆盖的”的动作,导致算法在复盘更新时永远在“对错账”。
针对这一普遍制约具身模型在线微调的难题,星尘智能(Astribot)基座模型团队近日公布了其面向异步执行环境的在线强化学习框架——SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。
该框架的关键,在于让策略更新严格对应硬件的实际执行:剔除那些没来得及下发的预测指令,只把电机真正走过的轨迹拿来算账更新。

SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。
它在一定程度上攻克了强化学习在高速物理交互中的延迟失准问题。在极易因卡顿泄力的连续投掷任务中,通过 250 轮真机训练,任务成功率便从基础策略的 39% 跃升到了 94%。
投掷是衡量机器人物理动态控制能力的经典标尺。与简单的机械臂“抓取-放置”不同,投掷任务要求机械臂在空间划过一条连续加速的摆动曲线,并在毫秒级的临界窗口精准释放夹爪。

SmoothRL论文可见https://arxiv.org/abs/2608.29768,由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究
异步推理的“时差陷阱”
在具身大模型的真实部署中,异步推理已经成为一种工程常态:机械臂保持高频运动,模型在后台流水线式地计算下一段动作序列——手在执行动作 A,大脑已经在算动作 B。
但这套保障机器人“不停机”的机制,却击穿了强化学习最根本的时序逻辑。
传统的在线强化学习假定了一种极其规整的因果关系:模型算出一组动作,机械臂照单全收,算法再根据任务成败来复盘更新。但在异步流水线中,这种一对一的对应关系不复存在:

这就导致了一场严重的算法灾难:模型“计划过的”、机械臂“真正做过的”,以及中途“被覆盖扔掉的”动作彻底混在了一起。
如果强化学习依然把整段动作混为一谈去更新策略,就会出现荒唐的误判:那些因为时延来不及改的前置动作,或是压根没在物理世界发生过的被丢弃动作,都会因为任务最终侥幸成功而被莫名“奖励”,或者因为突发失误而无辜“背锅”。
算法对错了账,策略更新自然陷入剧烈震荡。
解法:剔除无效预测
星尘智能提出的 SmoothRL,核心逻辑极其务实:切断未执行动作的奖惩链路,只针对机械臂在现场真正执行过的动作进行优化。
在具体实现上,SmoothRL 将异步执行下的每一个动作分块(Action Chunk)划分为三个物理区域:
- 已提交区域(Committed): 在模型推理的这几百毫秒内,机器人必须保持运动而执行上一轮旧指令的区间。这属于无法更改的既成事实;
- 执行区域(Execution): 当前新指令生成后、且在下一轮计算结果抵达前,真正驱动了电机、与物理环境产生交互的动作切片;
- 丢弃区域(Discarded): 模型构想过、但尚未下发就被后续新指令覆写替换的无效预测。

SmoothRL 将异步 action chunk 划分为 Committed / Execution / Discarded 三个区域,并只让价值梯度通过真正执行的 Execution Region
在算法回传阶段,SmoothRL 建立了精准的掩码机制:严格只让策略与价值梯度穿过 Execution 区域。 至于来不及改的 Committed 区域和未执行的 Discarded 区域,直接切断其更新链路。
为了让训练与部署环境完全一致,SmoothRL 确立了“在部署中强化(Reinforce in Deployment)”的原则——从训练开始,就让模型在真实的异步延迟与时钟节拍下运行,而不是在理想化的无延迟环境里微调。
在工程架构上,团队采用了更稳健的残差强化学习:
- 冻结大模型底座: 采用针对特定任务微调后的π 0.5作为基础策略,提供宏观操作意图;
- 轻量残差网络调细节: 在底层动作空间上构建轻量级 Actor-Critic 网络,专门预测微调修正量 ;
- 硬件节拍适配: 以星尘 S1 机械臂为例,硬件以 30 Hz 频率执行动作,后台模型以 5 Hz 频率(200 ms 推理预算)生成一段 32 帧的动作分块。在这 200 ms 窗口内,真正驱动电机执行的 Execution 区域仅占 6 帧,其余 20 帧在执行前直接被下一轮预测覆盖。算法只拿这 6 帧真实轨迹进行算账更新。
实战检验:把系统性失误收敛为微小扰动

这套机制在星尘智能 S1 绳驱本体上完成了三项极具代表性的真机测试,覆盖了两类典型工况:
动态投掷(39% → 94%)

投掷不同于慢速放置,机械臂必须在摆动中持续积累加速度,并在临界点精准释放。一旦在动作衔接处出现哪怕数十毫秒的停顿,手臂速度就会瞬间跌落,失去抛射动量。在异步执行保障连续运动的前提下,SmoothRL 仅用 250 轮真机交互,就将成功率从 39% 提升至 94%。
给笔戴帽(8%→83%)
双臂协同对齐,容许公差仅在 5 mm 左右。基础大模型能够将笔带到笔帽附近,但缺乏微观调整能力。SmoothRL 通过现场试错,补齐了末端毫米级的自适应微调。
快递开箱(30% → 90%)

机械臂需持 1 mm 宽的刀片刺入仅 2—3 mm 的箱盖接缝并切开胶带。基础策略由于视觉标定偏差存在固定的“向左偏”。真实探索并不总是一帆风顺:在 150 轮训练节点时,因物理缝隙边缘的接触阻抗探索,成功率一度从 30% 跌落至 20%,随后策略逐步收敛并克服局部卡顿,最终达到 90%。

三项真机任务随累计 rollout episodes 增加的成功率变化
比单纯成功率更有说服力的,是机器人的“错法”变了。
微调前,机器人的失误多是致命的结构性偏差——投掷距离恒定无法自适应、开箱刀片永远向左偏。微调完成后,这些顽固偏差被彻底抹平,剩下的极少数失败样本,开箱偏差收敛在 1—2 mm 以内,戴帽也仅是孔位边缘的微小擦碰。

动态投掷中的 Velocity / Acceleration / Jerk 对比
这意味着在线 RL 并非在重新教机器人理解任务,而是在充当“肌肉记忆修正器”。同时,引入动作平滑约束后,机械臂末端的加速度均方根降低了 52%,加加速度(Jerk)降低了 47%——在成功率近倍增的同时,动作反而更加平顺,降低了机械磨损。
如果说,预训练大模型解决了机器人“会不会做”的广度问题,而在真实物理阻力与计算时延中,像 SmoothRL 这类剔除时差干扰、精准对齐执行轨迹的在线后训练机制,正在解决机器人在真实工业现场“能不能稳定做好”的深度问题。
声明:本文为 AI 前线编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐
QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

今日荐文
独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人
独家|大模型没有秘笈:腾讯混元4背后站着GLM-5核心研究员
开源模型两个月内杀死比赛
DeepSeek 再度调价;英伟达AI服务器涨价超 15%;“AI红娘”承诺三年不结婚就退款,前 Kimi搜索负责人创业目标:拉高10%结婚率 | AI周报

