换个房间、改条光线,过去要让机械臂重新会干活,光实拍就要烧掉几十万。现在李飞飞团队的 Atlas 把这件事压成了几段手机视频的事儿——这些普通的录像,能裂变出上千种光照、材质、障碍物全不一样的三维考场,光照能调,镜头能移,碰撞按真实物理算,等于把死视频变成可交互沙盒。
它打的不是影视特效的活,而是机器人训练里最烧钱的那块——换场景重拍。以前拉团队、搬物体、换灯光,一套仿真环境搭完,机器人还没训练就先花掉半个项目预算。现在手机一拍,场景就能像乐高一样批量改,仓库里多一根柱子、客厅里多一只拖鞋,对系统来说只是参数一变。这是数据成本从重资产往轻资产推的过程,肉眼可见会动的就是机器人训练团队的预算表,谁还在为换场景重拍,谁就被甩在身后。
能不能直接搬上实体机器人,还得打个问号。阿易这则转发里没贴论文、没放基准,物理引擎精度、跨房间迁移率、真实硬件跑通多少,全是未知。把“几段手机视频生成交互世界”直接对接到“机器人要学会干活”,中间还隔着仿真到现实那道老沟。要是真跨过去了,省下的不光是钱,是整个具身智能落地的时钟。
所以问自己一句:如果具身机器人真的大爆发,凭这种低成本的虚拟训练场,你先看到的是家里那个会收拾的机器人,还是工厂车间里那条不再停的流水线?
