群发资讯网

凤凰AI研究院字节AI新棋剑指硅谷三大巨头,VR产业逻辑将重构

字节跳动又把“世界”搬上了桌面。 彭博社9月8日引述知情人士消息:他们正在做一款全新的AI世界模型,内部还在协调各业务部
字节跳动又把“世界”搬上了桌面。
彭博社9月8日引述知情人士消息:他们正在做一款全新的AI世界模型,内部还在协调各业务部门,把AI资源和算力先集中起来干一波。最早可能下个月亮相,但具体时间不一定——这种“不确定”,通常也意味着事情在加速推进,或者规模已经超出最初预期。
这不太像一句“常规迭代”的话。
因为他们做的,是能在虚拟空间里把指令变成实时变化的那类能力:新模型基于字节现有的Seedance视频生成模型,主打实时空间视频生成。用户可以用语音或动作指令去互动,场景包括直播、短剧、游戏之类的内容形式。
你可以先把它理解成一句很朴素的话:**从“看视频”走向“让视频照你说的来”。**
而在这些系统里,延迟和流畅度是最容易被卡死的地方。文中提到,云端每秒能生成20帧,延迟约0.05秒。看到这个数字时我第一反应不是“哇”,而是“这得烧多少网络和算力”。
也正因为要把重计算放到云端,他们才敢往“实时”这个方向推。对于VR/空间计算来说,过去的争论常常绕不开硬件:芯片够不够强、头显贵不贵、设备要不要换代。可一旦生成和渲染大部分都由云端完成,你就会看到另一种路线:**别死磕端侧算力,先用AI把体验做出来。**
这会带来一个很现实的讨论:如果效果足够好,硬件是不是就没那么关键了?
至少对一部分用户来说,会变成“我能不能不换一台最贵的设备,也能玩到类似体验”。当然,代价也可能转到别的地方——比如网络稳定性、带宽成本、以及隐私怎么处理。只是这些通常不会像芯片参数那样一眼就摆出来。
国内这边,字节的节奏也不慢。外部信息里能看到他们在前沿语言模型上追赶的同时,也跟腾讯在企业AI市场上正面碰。国际上,如果这款世界模型真能落地,确实会碰到Meta和苹果那套空间计算路线:Meta强调生态和Quest普及,苹果把Vision Pro定义成高端入口。问题是,硬件普及这条路并不总是线性增长——市场总要等“足够多人觉得值得”。
字节的想法更像是把等待变短:用AI世界模型先把“交互感”做出来,再借助内容生态形成飞轮。它把AI模型、云计算、抖音/TikTok的内容分发,和硬件想象放到同一个叙事里。如果你玩过内容生成相关的工具,会明白为什么这种组合很诱人——内容越生成越快,越能验证模型,模型越好又能再生成更多内容。只要闭环成立,优势就不只是“技术领先”,而是“节奏领先”。
我更关心的是另一层:这类世界模型一旦成熟,普通人会怎么用?是更像游戏里的“导演工具”,还是更像直播间里的“即兴舞台”?语音和动作指令听起来很酷,但真正能让人留在里面的,往往不是炫技,而是“我说一句,你立刻接上了”的那种掌控感。0.05秒这种级别的延迟数字,本质上是在追求这种掌控感——让互动看起来不像在等系统。
说到底,世界模型是不是下一个“圣杯”,现在谁也不敢拍胸口。但有一点我觉得挺清楚:在空间计算这条路上,未来更可能被AI重新分配资源,而不是被谁再堆一次硬件参数决定。硬件当然重要,但它可能不再是唯一决定因素。
最后把话收回来。下个月到底能不能如期出现、效果能不能稳定、生态怎么接入……这些都还得看。可无论如何,至少从“0.05秒”和“实时互动”的表达方式里,我们已经能看到字节在押的是什么:不是慢慢迭代内容,而是试图让内容变成一个会“跟着你走”的世界。你觉得这一步,能把VR的天花板往下挪吗?还是会把另一种成本悄悄转嫁到用户身上?评论区可以聊聊。