群发资讯网

据业内消息,字节跳动正在秘密研发一款对标谷歌 Genie 的世界模型,项目不仅调

据业内消息,字节跳动正在秘密研发一款对标谷歌 Genie 的世界模型,项目不仅调用了内部极其庞大的算力资源,更将底座建在了 Seedance 架构之上。

团队的目标相当激进,首个版本最快可能在今年10月推出。而另一边,谷歌Genie早已走出闭门测试,面向付费用户开放的Project Genie正在扩大覆盖范围,风雨已经来了。

为什么大厂们突然不满足于生成视频,开始疯狂抢跑“世界模型”?

因为生成视频和生成世界,看起来只差两个字,实际上隔着一代产品。

普通视频模型接到指令后,会生成一段固定画面。人物怎么走、镜头往哪转、结局是什么,在生成完成时基本已经确定。用户只能观看,不能改变过程。

世界模型则不同。它不仅要生成画面,还要理解空间关系、物体运动和行为后果。用户向左走,模型需要实时生成左侧场景;用户推倒桌子,杯子可能掉落;角色跳进水里,环境还要对动作作出符合常识的反馈。

简单说,视频模型是在“拍电影”,世界模型是在“搭世界”。这可不是给视频加个方向键那么简单。

谷歌2025年公布Genie 3时,已经能以720P、每秒24帧生成可实时探索的环境,并让场景在数分钟内保持相对一致。

2026年推出的Project Genie,则把文字或图片变成可以行走、驾驶和飞行的虚拟空间。

这意味着,未来的游戏不一定先由程序员把地图、建筑和道路全部建好。玩家说一句“生成一座被洪水淹没的未来城市”,模型就可能一边理解指令,一边生成道路、天气和可探索区域。

直播和短剧也可能被改写。同一段剧情,观众选择不同,后续环境随之改变;同一场直播,每个人看到的空间和互动内容甚至可以不同。过去平台争夺的是播放时长,下一步争夺的可能是用户在虚拟世界里停留多久。

这正是字节跳动被认为适合下场的原因。

Seedance已经具备画面生成、复杂动作、多模态输入和音视频同步能力,相当于准备好了“视觉发动机”;抖音等平台提供内容分发和真实应用场景;火山引擎可以承接云端计算;Pico则提供进入虚拟世界的硬件入口。

如果这些环节能够串起来,字节做的就不再是一款孤零零的AI工具,而是一套从模型、算力、内容到终端的闭环。别人生成一段片子,它希望直接生成一个可以走进去的空间。

更重要的战场还在机器人和自动驾驶。

今天的大语言模型很会说,却未必真正理解杯子为什么会摔碎、汽车急转弯会怎样、机械臂抓取失败后该如何调整。机器人不可能把所有错误都拿到现实中试一遍,撞坏设备还算小事,伤到人就不是“模型再迭代一下”能轻松带过的。

世界模型可以充当低成本的数字训练场。机器人先在虚拟环境中尝试成千上万次,自动驾驶系统也能反复经历暴雨、逆光、行人突然横穿等罕见场景。

Meta的V-JEPA 2已经展示了在陌生环境中规划机器人动作的能力,英伟达Cosmos也把合成数据、机器人训练和自动驾驶测试列为重点用途。

所以大厂抢的并不是一个更炫的文生视频功能,而是下一代智能体的“练功房”。谁掌握更真实、更便宜、更可控的虚拟世界,谁就可能掌握机器人、游戏、空间计算乃至下一代内容平台的重要入口。

当然,世界模型现在还远没有成熟。谷歌自己也承认,Project Genie仍可能出现物理规律失真、人物控制不稳定和延迟问题,单次体验时长也有限。漂亮演示距离真正取代游戏引擎、专业仿真软件,还有一段不短的路。

它还面临算力成本、版权归属、人物肖像、虚假场景和安全边界等问题。生成普通视频出错,可能只是多长了一根手指;生成自动驾驶训练世界出错,教给机器的可能就是一套错误规则。世界越逼真,验证反而越重要。

在我看来,字节此时押注世界模型并不意外。短视频解决了“让人看什么”,推荐算法解决了“下一条给谁看”,世界模型瞄准的则是“让人进入什么、让机器在里面学什么”。这是从内容公司迈向智能基础设施的一次试探。

大厂们也不是突然集体开悟,而是已经把账算明白了:生成视频是一门工具生意,生成世界则有机会成为平台生意。10月能否如期看到字节的首个版本尚未确定,但这场竞争的发令枪,显然已经响了。