群发资讯网

最近在关注机器人模型圈的进展,注意到一个趋势。之前大家聊VLA,都是看机器人能不

最近在关注机器人模型圈的进展,注意到一个趋势。

之前大家聊VLA,都是看机器人能不能学会更多任务,比如叠衣服、收拾桌子,最好换个房间也能继续干活。但最近,研究重点开始往后移了。

因为大家慢慢发现,机器人知道怎么做,不等于它真的能把事情做好。

比如戴笔帽这个动作,机器人其实可以完全理解任务,也知道应该先抓住笔帽,再移动到笔尖附近。但真机执行时,只要偏了几毫米,结果就还是失败的。

这时候继续增加示范数据,不一定是最有效的办法。因为机器人缺的并非是对任务的理解,而是根据真实执行结果调整动作的能力。

而这恰恰是决定机器人什么时候才能真正进入工厂和家庭的关键,因为现实世界不只需要机器人做出一次正确演示,而是希望它每天重复工作,成功率还能维持在一个可用的水平。

1最近几个月,机器人RL明显又热了起来。

比如Physical Intelligence推出了用于精细操作的RLT,它的思路不是重新学习整个任务,而是通过真实尝试,把最容易失败的关键阶段继续练好。Sergey Levine那边也一直在推进推理有延迟情况下的异步RL,相关的Online RL、ARLI这些方向陆续都有新工作出来。差不多同一时间,星尘智能发布了SmoothRL。

这些工作面对的其实是同一个问题:机器人已经学会做任务了,接下来怎么靠真实执行继续变强?

这就像一个人看完游泳教程,大概能理解动作顺序。但真正下水以后,呼吸时机和身体姿态都需要靠反复练习调整。机器人也一样,示范数据可以告诉它大致方向,却很难覆盖每一次接触时产生的细微误差。

机器人模型的重心,正在从pre-training慢慢挪到post-training。先学会,再练熟,这条路线正在明显升温。

2具体到SmoothRL,要解决的是什么问题呢?

现在跑在机器人上的模型越来越大,一次推理需要时间。但机器人不可能每做一步都停下来等模型算完下一步,真实情况通常是机器人手上还在做上一段动作,模型已经在后台悄悄算下一段了。业内把这种方式叫做异步推理,也就是边动边算。

但问题也出在这里。

假设模型一次生成了10个动作,执行到第6个时,下一轮推理提前完成了,于是后面4个动作直接被替换。也就是说,模型虽然生成了10个动作,真正影响现实世界的只有前6个。

这时候如果RL不管三七二十一,把模型生成的整段动作都拿去学习,就等于在学一堆机器人根本没做过的事。

这有点像公司做项目复盘,一个项目最后延期了,你却把某个从未上线的方案也算进原因里,导致下一轮改进一定会跑偏。

3针对这个问题,SmoothRL的解法是:机器人实际执行了哪些动作,训练时就只对这些动作计算梯度。模型生成过但没有执行的部分,不进入这次学习。

这个设计最重要的地方,是实现了让训练记录重新对齐现实。

SmoothRL会根据真实执行过程划分动作片段,并把已经确定要执行的动作纳入价值估计。新旧动作切换时,它还会参考历史轨迹,避免策略更新后突然产生不连续的动作。

团队给这个思路起了个名字,叫Reinforce in Deployment,意思就是把强化学习放回到真实部署的环境里去做。机器人上线以后怎样运行,训练时就应该尽量按照那种节奏学习,交互、推理和优化可以进入同一个闭环。

动态投掷是一个很适合检验这套方法的任务。因为投掷需要机器人持续加速,并在合适的时刻释放物体。中途只要停顿一下,前面建立的速度就很可能被破坏。它对动作连续性和推理延迟都很敏感,很难通过慢动作完成。

最终的真机实验里,动态投掷成功率从39%提高到了94%。戴笔帽从8%到了83%,开箱也从30%提升到90%。

4在我看来,SmoothRL的价值更像是在补一块过去容易被忽略的拼图。星尘前面已经有Lumo系列模型。Lumo-1主要处理物理空间中的推理与行动,Lumo-2又把预测未来变化纳入动作生成,SmoothRL继续往真实执行推进,把动作练得更准、更稳。

星尘一直把动作当作机器人智能里最核心的那个模态。理解动作、预测动作、优化动作,是同一条主线上的三块拼图。

同时,SmoothRL也是一个信号。机器人行业过去几年的关键词,是让机器人会做更多事。现在的关键词,正在慢慢变成让机器人把已经会的事做稳、做准、做到能上岗。

异步执行下的Online RL,目前还是一条非常新的研究方向,公开工作也是最近才陆续出现。SmoothRL把这个问题进一步放到了真实高动态机器人任务里去验证,算是往前推了具体的一步。

对外界来说,可以顺着这件事重新认识一下星尘这家公司。过去大家印象里,它更多是一家绳驱本体做得不错的机器人公司。而SmoothRL证明了,它在AI这条线上也已经做得比较深了,从基座模型到真实世界里的后训练,是一整套能力。

很多公司可以在benchmark上训练模型,但真实动作数据只有机器人工作起来以后才会产生。当这些数据可以继续进入RL,部署就不再只是能力的终点,也会成为下一轮训练的起点。

机器人从会做到熟练,需要真正进入物理世界,然后在那里继续学习。