机器人最让人抓狂的失败,往往不是「不会」,而是明明已经会了,却总差那么一点。

 

Demo里,这叫「差一点」;真正上岗以后,这就是一次失败。

 

机器人还不能像学生做题一样,做一道停下来想一道。更像人在打球:这一拍还没结束,下一拍其实已经在判断和准备了。现在的机器人大模型也是如此——一次会生成接下来一小段动作,但推理本身需要时间。为了让动作不断,真实部署通常是手上还在执行计划A,模型已经在后台计算计划B。

 

这时候,问题就来了:机器人一边干活、一边继续学,在线强化学习到底该复盘哪一段动作?模型想过的,和机器人最后真正做过的,并不完全一样。

 

星尘智能(Astribot)团队发布在线强化学习框架SmoothRL,由王佳楠担任项目负责人。它要解决的正是这个问题:机器人不停下来,模型继续推理,但学习只对准真正执行过的动作。

 

SmoothRL首次将这类异步online RL放到真实高动态投掷任务中验证,让在线学习不只处理「最后几毫米」的精度问题,也进入连续加速、精确释放、不能停顿的动态操作。

 

 

 没真正做过的动作,不能拿来复盘 

 

异步推理真正麻烦的地方,不是机器人能不能把下一段动作接上,而是强化学习必须先搞清楚一件事:刚才到底哪些动作真的发生过。

 

可以把模型每次生成的动作序列(action chunk)理解成一小段提前写好的「计划」。等下一个新计划算出来时,机器人已经沿着上一份计划做掉了前几步;而这份新计划还没执行完,下一份计划又到了,后半段也可能被直接换掉。

 

机器人一边执行任务,一边产生新的真实数据;在线RL再根据这些结果持续修正下一步动作。

 

所以,模型虽然完整「想」了一段,真正控制过机器人的,往往只有中间那一截。

 

这对强化学习非常重要。就像复盘一场比赛,只能复盘真正打出去的球:机器人没做过的动作,不能因为任务成功被记功,也不能因为失败背锅。

 

SmoothRL做的第一件事,就是把这笔账对齐。它把一段动作分成三部分:前面已经被上一轮动作占用的是Committed Region,中间真正落到机器人身上的是Execution Region,后面还没执行就被新计划替换的是Discarded Region。策略更新只针对真正执行的中间这一段。

 

更关键的是,它连「怎么训练」也一起改了。SmoothRL不会在训练时假设机器人可以规规矩矩地「算完再动」,到了部署时才改成边做边算;训练rollout本身就按照真实异步执行的节奏运行——机器人继续动,模型继续推理,实际发生的轨迹再回到学习循环里。

 

团队把这个原则叫做Reinforce in Deployment:机器人真实工作是什么节奏,强化学习就按什么节奏学。

 

SmoothRL在真实机器人动态投掷任务中进行在线强化学习。

 

 三个真实任务,把「差一点」拯救回来 

 

团队在Astribot S1上测试了三个真机任务,基础策略采用针对各任务微调后的π0.5。

 

三个任务看起来很不一样,但共同点很明确:机器人已经基本会了,真正卡住它的是最后一点。

 

  • 动态投掷:39%→94%。机器人要把不同位置的物体投进不同位置的目标箱。除了判断方向,还要根据远近调整释放速度,而且整个摆臂过程不能突然停下来。在累计250个rollout episodes的评估节点,成功率从39%提升到94%。

     

 

  • 给笔戴帽:8%→83%。双臂需要把笔和笔帽准确对齐,允许的相对位姿误差小于5mm。基础策略往往已经到了目标附近,最后几毫米却经常对不上。

 

 

  • 开箱:30%→90%。机器人要把约1mm宽的刀片插进只有2-3mm宽的箱盖接缝。基础策略存在稳定的左偏,经常直接扎进纸板;在线学习后,最终成功率达到 90%。

 

 

三个真实机器人任务在在线RL前后的成功率变化。

 

 RL补的,往往就是「最后几毫米」 

 

比成功率更有意思的是,机器人失败的方式变了。

 

RL之前,很多错误都有固定方向:投掷时不会根据目标远近稳定调整释放速度,开箱时刀片总往左偏,给笔戴帽时对不同位置的笔帽反应得太像。

 

在线RL做的,就是利用一次次真实执行结果,把这些固定毛病一点点磨掉。到最终checkpoint,剩下的失败已经越来越接近成功。开箱任务的失败样本中,刀片相对接缝的左右偏差缩小到1—2mm;给笔戴帽的失败样本也主要变成正确位置附近的小幅错位。

 

所以这次的RL,并不是重新教机器人「怎么开箱」,而是在做一件更像真正工作的事:把「差不多会」练成「稳定做成」。

 

不仅更准,还要更平滑。在真实自主投掷rollout中,在线RL后右侧末端执行器的加速度RMS降低52%,jerk(加加速度)降低47%。机器人不仅更容易成功,动作还更平滑。

 

RL后的失败从明显的固定偏差,收缩到成功位置附近。

 

 机器人上岗以后,训练并没有结束 

 

过去几年,机器人基础模型主要解决的是「会不会」:用更多数据和更强模型,让机器人学会越来越多任务。

 

但真正开始干活以后,问题会变成「能不能稳定做好」。几毫米的误差、一次释放早晚、一个新的物体位置,都可能让一个看起来已经学会的任务失败。

 

SmoothRL想补的就是这一层:机器人上岗以后,还能根据真实执行中的成功、失败和人工反馈继续调整自己。

 

不过,它现在也有边界:模型推理时间需要控制在预设预算内,而且当前方法主要是在冻结基础策略附近做有限幅度的修正。如果基础策略本身离正确动作太远,轻量RL模块也很难凭空救回来。

 

但至少在这三个任务里,可以看到一个很直观的范式:基础模型先让机器人学会怎么做,真实世界里的后训练,再把最后几毫米一点点练准。

 

SmoothRL背后,延续了星尘在机器人模型上一条独特的长期判断:动作不是视觉或语言模型最后附带生成的结果,而应该成为机器人智能里的「第一公民模态」。因为机器人最终不只是为了看懂世界,更要在物理世界正确行动。所以Lumo系列基座模型始终关注「为什么要这样动」,从Lumo-1的显式推理、到Lumo-2预测世界因动作带来的变化,都在沿此思路发展。

 

在这条主线下,星尘也形成了从前端Agent、中间基座模型、到RL后训练的完整模型布局:Agent负责交互、记忆、理解任务与调用能力,基座模型逐步形成开放场景里可泛化的通用操作能力,RL再从真实执行中的成功、失败和反馈中修正策略、持续进化。

 

在模型全面发展时,星尘「AI模型-具身OS-绳驱本体」的全栈系统也在持续迭代,推动Physical AI的应用与规模化部署。

2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!

扫码关注公众号,底部菜单申请进群

作者 ab, 808