群发资讯网

最近,跟业内做具身智能的朋友聊起来,大家都有一个共识:世界模型,正在变得越来越重

最近,跟业内做具身智能的朋友聊起来,大家都有一个共识:世界模型,正在变得越来越重要。

原因也很现实,毕竟机器人在真机上试错太贵。每套新策略都要占用设备、场地和人力反复测试,所以行业希望先在虚拟世界里推演动作的后果。

不仅如此,世界模型能够内含原生的物理规律的理解,未来要让机器人在真实世界活动自如,需要这些智能能力。

这也是为什么过去一段时间,Google DeepMind、NVIDIA、Meta 都在持续投入世界模型。

但这就带来一个问题,很多世界模型会生成一些「看起来合理」的未来😂

比如机械臂准备抓杯子,夹爪明明偏了几毫米,有些模型却会顺着任务目标,自动补出一段成功视频,哪怕动作根本没做对。

这是因为它看过类似的任务,看到做动作前的画面,就“偷懒”推演出成功的画面。至于机械臂做的动作,是不是能引向这个画面,完全被忽视掉了。

这就很麻烦了。如果动作和结果对不上,画面越逼真,反而越容易误导策略判断。机器人在里面练得越多,反而错得越多。

1就在这个问题上,自变量机器人最近发布了 WALL-SS,全称是下一尺度自回归世界模型。

它想解决的问题是,让虚拟世界里的未来,真正按照机器人的动作发生。让世界模型真正成为真实物理世界的可靠参考。

我去看了一下论文里的对比实验。在动作跟随这项指标上,WALL-SS 得分 0.29。作为对比,论文里同样报告了这项指标的 Cosmos3 只有 0.044。还有大量模型是0,完全不看动作信号。

轨迹准确度的提升更明显,从基础模型 InfinityStar 的 0.251 提升到 0.539,增幅大约 115%。

也就是说,模型不仅知道机器人动了,还能更准确地把这个动作反映到机械臂实际走过的轨迹上。

另外,WALL-SS 还完成了最长 60 秒的自回归流式推演评测。

这里没有不断给模型偷看真实的后续画面。初始化之后,它只能接着自己生成的结果继续往下推,同时尽量保持物体位置、机器人状态和动作轨迹的一致。

WALL-SS 终于开始尝试回答另一个更难的问题:虚拟世界里测出来的结果,跟真实机器人到底对不对得上。

2所以,它到底是怎么做到的?

我自己的理解是,传统视频模型更像是在续写故事。看到桌上有个杯子,任务是把它拿起来,模型就猜下一段最可能出现的画面。但机器人真正干活时,未来不能只由任务决定,还得由每一步动作决定。

WALL-SS 首先是换了一种生成方式。它不是一次把未来画面直接做出来,而是像画画一样,先搭一个粗轮廓,再逐层补充位置、动作和接触细节。

粗尺度先决定机械臂大概要往哪里走,中间尺度确认它和杯子的相对位置,到了更细的尺度,再判断夹爪有没有真正碰到并夹住杯子。

在逐渐细化预测的每一步,都让动作全程指导,不是可有可无的参考,而是必须遵循的指令。

这样一来,同一个初始画面,给机械臂三条不同的动作轨迹,模型就应该生成三种不同的未来。成功的动作会抓起杯子,偏掉的动作也得老老实实地失败。

听起来很基础,但对机器人来说非常重要。

3动作能对上,还只是第一步。模型每生成一段画面,又要把这段画面当成下一次预测的依据。这就像一个人不断根据自己上一句话往下编故事,前面只要记错一个细节,后面就会越编越离谱。

每一步预测的精准度,直接源于记忆的信息是否充分。最简单的办法是把所有历史画面全部存下来,但推演越久,内存和计算成本就越高。只保留最近几段也不行,模型很快就会忘记物体之前被放到了哪里。

WALL-SS 的处理方式有点像人类记忆:时间越近,记得越清晰。刚发生的抓握保留详细信息,几十秒前只记住机器人和物体的大致状态,最初的场景则作为长期锚点保留下来。

而且它压缩的不只是画面,还有对应的动作历史。这样模型不只记得现在是什么样,还能记得为什么会变成这样。

这样,模型始终有一个相对长期、并且资源占用可控的记忆,自然就能够预测出更准确的未来。

这里面还有一个挺有意思的训练方法,论文叫尺度级梦境强迫。

训练时,模型不会永远拿到完美的历史答案,而是会看到带有误差、甚至由自己生成的上下文,再练习怎么从这些不完美的信息继续往下推。这样一来,模型也能学会怎么处理误差、自我纠正。

在这之外,WALL-SS 还用两个评分器继续校正自己。一个检查生成结果有没有遵守动作,另一个检查物体状态、片段衔接和多个摄像头看到的世界是否一致。这样校正完的模型,预测与真实世界已经非常接近了。

4不过,我觉得这篇论文最关键的还是模拟和现实的对照实验。研究团队让同一批机器人策略分别在 WALL-SS 和真实机器人上执行,一共做了 600 组配对测试,其中 527 组最终成败一致,约占 88%。

从不同任务和策略版本的整体表现来看,虚拟成功率和真实成功率的相关系数约为 0.93。

同一个任务里,WALL-SS 还保留了 89% 的真实策略强弱顺序。这意味着世界模型预测的未来高度可信。机器人可以先在虚拟环境里做一轮海选,找出哪些动作策略能完成任务,再把更有希望的策略送上真机。

当然,它距离替代真实测试还很远。在 332 个真实失败回合里,有 45 个被WALL-SS判断成了成功,失败误判率约 13.6%,问题主要集中在接触、对齐和插入这些很吃物理细节的环节。

但话说回来,WALL-SS 的价值本来就不是取消真机测试,而是把大量初筛工作搬到虚拟世界。

过去,每个策略版本都要让真实机器人反复跑,以后可以先用世界模型推演、淘汰和排序,再把昂贵的真机时间留给最难模拟的问题。机器人真正需要的,是一个能诚实告诉它,这样做下去会发生什么的世界模型。

论文链接:网页链接项目主页:网页链接Github 链接:网页链接