群发资讯网

18700小时数据训练,字节跳动AI新模型OmniHuman问世 现在最牛的AI

18700小时数据训练,字节跳动AI新模型OmniHuman问世
现在最牛的AI视频生成技术,不是海外大厂搞出来的,而是字节跳动刚放出来的王炸!
继DeepSeek之后,中国AI圈又扔出了一枚震撼全行业的重磅炸弹。
这次字节掏出来的OmniHuman一号,直接把之前所有人对AI生成人物视频的认知全打碎了。
以前你玩过的那种老照片动起来的小程序,要么人脸歪歪扭扭,要么动作僵硬得像木偶,对口型都对不齐。
这次的新技术有多离谱?
你只需要上传一张普通的人物照片,不管是明星、科学家,甚至是家里老人的旧照,AI直接就能给你生成一段全身动作自然、手势细节拉满的完整视频。
想让他唱歌?想让他弹吉他?想让他做演讲?只要配好对应的音频,所有动作表情全和声音严丝合缝,逼真到你根本看不出是AI做的。
之前的深度伪造技术有多拉胯大家都知道。
要生成一段像样的视频,得喂进去几十上百段参考素材,出来的效果还经常崩脸,动作鬼畜。
字节这次直接把门槛干到了几乎为零。
人家为了训这个模型,足足喂了18700小时的海量视频数据集,背后靠的就是旗下短视频平台积累了这么多年的全品类真人动作素材库,根本不愁没东西喂。
之前别家做AI人物生成,大多只盯着音频和人脸匹配。
字节这次直接搞了个全条件训练,把文本、音频、身体姿势所有维度的信号全给AI灌进去,相当于直接教AI“人在说话的时候手会怎么动,唱歌的时候身体会怎么晃,弹乐器的时候手指是什么姿势”。
放出来的测试样片看完我人都傻了。
AI生成的泰勒·斯威夫特现场表演,动作神态和真人几乎没差。
爱因斯坦站在讲台前做演讲的片段,连他标志性的小动作都还原得一模一样。
甚至连从来没举办过的虚构TED演讲,AI都能给你做出来完整的现场效果。
现在它唯一的小缺点,就是偶尔处理特殊姿势的时候还会出点小bug,但对比之前的老技术,已经是跨时代的碾压级进步。
最狠的是,你还能随便调整生成视频的长宽比、人物身材比例、视频时长,效果直接摸到了好莱坞工业级特效的门槛。
但技术有多牛,风险就有多吓人。
德勤之前发过报告,2023年全球由深度伪造衍生的各类欺瞒事件,直接造成了120亿美元的损失,按照这个趋势,2027年光美国一地的相关损失就要冲到400亿美元。
现在已经有不少AI研究者联名呼吁要给深度伪造技术上强监管,美国十几个州都已经出台或者在拟相关的法律,专门管AI假冒的乱象。
2024年5月的一份民调更吓人:60%的受访者说自己过去一年已经刷到过深度伪造内容,72%的人每天都在担心自己哪天就被AI伪造的假视频骗了。
当然技术本身是中立的。
往好的方向用,创作者改视频再也不用熬几个大夜调动作,老师可以把老教授的照片做成科普动画,影视行业拍年代戏找老艺术家出镜的成本直接砍到几乎为零。
但现在最让人慌的是,技术迭代的速度,远远比我们想规则、想监管的速度快得多。
现在字节还没把这个模型公开发布,马上就要去国际计算机视觉大会上亮成果,谷歌、脸书、微软这些海外大厂现在肯定都急红了眼在追进度。
用不了多久,普通人拿着手机就能随便生成以假乱真的人物视频的时代,真的要来了。
以后刷到任何看起来离谱的名人发言、熟人打视频借钱的内容,可千万别上来就信,多留个心眼总没错。
你们觉得这项技术最先会改变哪个行业?