群发资讯网

一张照片,AI能脑补出整个世界? 9月1日,李飞飞创办的World Labs发布

一张照片,AI能脑补出整个世界?
9月1日,李飞飞创办的World Labs发布新一代世界模型Atlas 它不只想生成一段好看的视频,而是要让AI记住:物体在哪里、镜头从哪里看,以及这个空间接下来可能发生什么 举个最简单的例子 给AI一张房间照片,它能认出桌子、椅子和杯子。但镜头绕到桌子背后,那里是什么样?机器人推了一下杯子,杯子会不会滑落? 识别物体和理解世界,其实是两回事。 Atlas主要有三个值得关注的能力: 1:不让AI猜运镜,直接给它镜头路线 普通AI视频依靠“镜头向左移动”“绕着主体旋转”这类文字指令,模型怎么理解,有点像抽卡。 Atlas可以把相机的位置、方向和运动轨迹直接作为输入。官方称,它能根据1~6张参考图,生成最长1分钟、最高1440p的视频。 创作者不是等AI随机发挥,而是像使用虚拟摄影机一样,提前安排每个镜头。 2:几张照片,补出一个3D空间 Atlas可以从一张到多张图片中生成新视角,并输出深度、点云和3D高斯泼溅场景。 图片越多,真实依据越充分;图片越少,AI需要“脑补”的区域越多。 这也是必须说清的一点: AI生成的背面看起来合理,不代表它就是现实中原本的样子。 3:一个模型,同时做生成、重建和模拟 Atlas采用多模态自回归扩散Transformer 不用被名字劝退。简单理解,就是它一边像大语言模型那样,根据已有上下文逐步生成;一边像扩散模型那样,通过去噪生成图像和视频 更关键的是,它不仅记住前面出现了什么,还会记录这些画面位于空间中的什么位置 但我觉得,Atlas真正值得关注的并不是拍视频,而是机器人训练 机器人要拿起杯子,只认出“这是杯子”还不够。它必须理解距离、角度、碰撞、滑落,以及一个动作可能造成的后果 Atlas可以把手机拍摄的现实环境重建成仿真空间,再改变物体位置、光线、背景和相机角度,为同一个任务制造大量训练场景 机器人可以先在虚拟世界里反复犯错,再把更有希望的策略放到真机上验证 这可能减少人工摆场景、反复重置设备和真机试错的成本李飞飞 Atlas WorldLabs 世界模型 具身智能 机器人 人工智能 空间智能