群发资讯网

中国科学技术大学揭开多人互动图像生成的致命缺陷

这项由中国科学技术大学与北京麦石科技联合开展的研究,以预印本形式发布于2026年7月30日,论文编号为arXiv:260

这项由中国科学技术大学与北京麦石科技联合开展的研究,以预印本形式发布于2026年7月30日,论文编号为arXiv:2607.27616,有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。

现在的AI绘图工具已经厉害到令人咋舌。你给它几张朋友的照片,告诉它"让他们俩来个拥抱",它真的能画出来。脸对了,衣服对了,背景对了,感觉挺好——直到你仔细一看:咦,这人怎么长了三只手?两个人的腰好像焊在一起了?那条腿是从哪儿冒出来的?

这不是偶发的小bug,而是当前几乎所有顶级AI图像编辑模型都面临的系统性失败。更棘手的是,现有的评测工具根本"看不见"这些错误——AI考官给这些毛骨悚然的图像打出了接近满分的高分。这支研究团队决定正面解决这个问题,他们搭建了一套全新的测试体系,名叫MPIE-Bench与MPIE-Eval,专门用来戳穿那些表面光鲜、内里一团糟的AI绘图结果。

一、为什么AI画两个人拥抱会"翻车"

要理解这个问题,先想象一个简单场景:你请一位画师帮你画一张两个人握手的图。画师对每个人单独画像毫无压力,但当两只手交汇的那一刻,问题就来了——手指应该如何交叠?谁的手在上面?两只手腕的角度是否合理?这些细节在单人肖像里根本不存在,一旦两个人的身体发生接触,复杂度就呈指数级攀升。

AI的困境与此高度相似,但问题更加根本。现有的文字转图像模型是通过海量图片"学习"视觉规律的,而在训练数据里,两个人紧密接触的图像本来就少,身体各部位的归属关系更难被模型准确把握。于是,当你要求AI生成"父亲扛着孩子"或"两名摔跤手缠斗"这类场景时,模型往往会在接触区域生成一些视觉上说得过去但解剖学上完全不可能的东西——多余的肢体、融合的躯干、无处安放的脚。

更令这支研究团队感到忧虑的是,现有的评测标准对这种错误毫无感知能力。主流的评测方式基本上在问四个问题:画面里有几个人、这些人的身份对不对、有没有做出指令要求的动作、画面好不好看。一张两个人"拥抱"但彼此身体已经像融化的蜡烛一样混在一起的图,依然能在这四个问题上全部得满分。

研究团队还发现了一个更讽刺的现象:当他们让一个智能AI评委(也就是业界常用的视觉语言模型)来评价这些图时,AI评委对那些融合了肢体的怪异图像给出了0.98到0.99分(满分是1分)。而人类一眼就能看出问题所在。这说明,评测工具本身已经出现了严重的"饱和"问题——它的尺子太短,量不出真正重要的东西。

二、2500个真实案例组成的考题库

研究团队解决这个问题的第一步,是建立一个真正有挑战性的测试数据集——MPIE-Bench。

数据集的核心思路来自一个精妙的观察:视频里天然就包含了"同一批人从互不接触到紧密接触"的完整过程。于是研究团队从三个来源挖掘视频素材,分别是Pexels平台上的免费商业授权视频、Harmony4D数据集以及CHI3D数据集。这些视频覆盖了街头生活到专业运动的广泛场景。

具体的挖掘方法相当聪明。对于每一段视频,研究团队会自动计算一条"接触密度曲线"——在视频的每一帧,程序会综合考虑画面中两个人的位置重叠程度、姿势接近程度、运动方向相似性以及相互遮挡情况,给出一个代表"两人身体有多接近"的分数,然后把这个分数随时间的变化画成一条曲线。这条曲线的低谷部分,就是两人站得很远、轮廓清晰的帧——研究团队从这里截取每个人的独立参考照片;曲线的峰顶部分,就是两人肢体紧密接触的帧——这成为AI需要生成的"目标图像"。

有了参考照片(谷底帧)和目标场景(峰顶帧),研究团队再让一个AI语言模型"反向"写出编辑指令——也就是根据目标图像的内容,写出一条描述动作和接触方式的自然语言指令,比如"让两人紧紧相拥,R2的脸颊贴着R1的脸颊"。这条指令将是测试时唯一告诉AI该做什么的信息,AI看不到目标图像。

整个流程自动产生了大约两万个候选样本,经过人工审核去除不安全内容和不合格样本后,最终保留了2500个高质量的测试样本,覆盖405个不同场景、14种交互类型和四个接触密度等级(从完全不接触到高强度接触,标记为C0到C3)。在这2500个样本里,约61%属于两个密度较高的等级,也就是身体接触明显的场景。大多数样本涉及两个人,但有399个样本(约16%)包含三人甚至更多,最多可达九人。

这个设计有一个关键优势:因为参考照片和目标图像来自同一个真实场景的同一批人,所以这不是随机拼凑出来的假测试,而是在考验AI能否还原真实世界里真实发生过的人体接触——这个难度比随便找两张人的照片然后说"让他们拥抱"要高得多。

三、让AI"照骨子里"打分——MPIE-Eval的设计哲学

建好了考题,下一步是设计评分标准。研究团队提出的MPIE-Eval包含六个维度,像六把不同角度的尺子,从各个方向量度一张AI生成图的质量。

前四把尺子是现有评测体系里比较成熟的:人数对不对(Count)、人的身份认得出来吗(Identity)、指令里要求做的事情做到了吗(Instruction)、画面整体好不好看(Quality)。这四个维度解决的是"任务完成了吗"这个问题。

真正的创新在后两把尺子:解剖完整性(Anatomy)和接触几何合理性(Interaction)。这两个维度解决的是"身体还是正常的身体吗"这个问题。

研究团队为什么要用"解剖学"这个词?因为他们选择了一种极其直接的检测方式——对AI生成的图像做3D人体网格重建(Human Mesh Recovery,简称HMR)。这项技术的原理是:给一张普通的2D照片,程序会尝试在三维空间里"推算"出照片里每个人的完整骨架和身体形状,就像医院里的CT扫描从外部图像推算出内部结构一样。研究团队使用了一个叫做Multi-HMR的公开模型作为唯一的重建工具,并且把这个工具的版本冻结,确保所有被测AI都用同一套标准量。

解剖完整性维度的逻辑是这样的:对一张正常的双人图像做3D重建,应该能找到两套完整的人体网格,图像里所有"人形的区域"都能被这两套网格解释清楚。但如果AI生成了一条多余的手臂,或者两人的腰部融合在一起变成了一个奇怪的形状,那么3D重建程序就会发现:图像里有些"人肉形状"的区域对应不上任何一套正常的人体网格——这些区域就是"剩余质量",是解剖错误的直接证据。

接触几何合理性维度的逻辑则是:研究团队会测量3D重建得到的两套人体网格之间的空间关系。如果指令要求的是"拥抱"(需要接触),但两个网格在三维空间里几乎不相交,说明AI画的人其实没有真正接触;反之,如果指令要求的是"站在旁边"(不需要接触),但两个网格大量重叠、一个人的身体穿透了另一个人的身体,也是明显的错误。

值得特别说明的是,这六个维度的分数从不合并成一个总分。研究团队坚持把它们分开报告,因为他们发现:一个模型可能在解剖完整性上表现很好,但在接触几何合理性上一塌糊涂,把这两个数字平均掉会掩盖真实的差异。就像一个学生数学满分、语文零分,如果平均后报"成绩一般",就完全误导了对他能力的判断。

四、解剖完整性:用"剩余质量"抓住多余的肢体

解剖完整性(Anatomy)的具体计算过程,可以用一个侦探寻找"不明物体"的比喻来理解。

程序首先会生成一张"人形前景遮罩"——找出图像里所有看起来像人体(亮度和颜色与人皮肤、衣物相符)的区域,打上标记。这个过程完全基于传统图像处理,没有用到任何AI学习器,目的是保证客观性。

然后,程序把3D重建得到的人体网格投影回2D画面,生成一张"已解释区域遮罩"——图像里哪些地方被正常的人体网格覆盖到了。

接下来,用"人形前景区域"减去"已解释区域",剩下的就是"剩余质量"——那些看起来像人体但没有被正常人体解释的神秘区域。剩余质量越大,说明画面里的解剖问题越严重。

研究团队把解剖错误分成四个家族来分别评分。第一个家族是"额外或融合的肢体"——多出来的或者粘在一起的手脚,这通过比较前景遮罩和网格覆盖的差异来检测,如果剩余分数很高但没有悬浮的碎片,就判定为"附着型假肢"。第二个家族是"漂浮的碎片"——完全脱离人体的孤立人形斑块,这通过统计孤立的剩余碎片数量来检测。第三个家族是"身体结构问题"——尺度错误、肢体归属混乱或网格自身穿插,这直接来自Multi-HMR的内部质量指标。第四个家族是"残余质量"——以上三类没有覆盖到的其他人形前景。

每个家族都有自己的软性评分函数,把原始测量值映射到0到1之间的分数,0代表严重失败,1代表干净通过。四个家族的分数以固定权重(0.40、0.20、0.25、0.15)混合,得到最终的解剖完整性分数。这些权重在任何模型评分开始之前就已经公开锁定,不会因测试结果而调整。

五、接触几何合理性:量出两具身体之间的"距离真相"

接触几何合理性(Interaction)的计算围绕两个核心测量展开:穿透程度和表面距离。

穿透程度用一个叫做凸包穿透代理(Vp)的量来估计。凸包可以理解为把一个立体形状用保鲜膜裹紧后的外壳。研究团队计算的是两个人体网格的凸包互相重叠的程度——通过测量一个网格里有多少顶点(身体上的采样点)落在另一个网格的凸包内部,得到一个"对称内部比例"(rin),再乘以较小那个人体凸包的体积,就得到穿透代理值。这个值越大,说明两个身体在三维空间里"互相穿透"得越厉害。

表面距离(ds)则更直接:在两个人体网格的所有表面点之间,找到最近的一对点,测量它们之间的距离。这个距离越小,说明两人越接近;如果这个值大于某个阈值,说明两人的身体根本没有接触到。

然后,研究团队根据编辑指令中描述的接触意图,把每个样本分成三类,分别采用不同的权重公式来计算最终得分。当指令明确要求接触(比如"拥抱"、"手牵手")时,穿透分数权重0.45、接近分数权重0.35、质量分数权重0.20——这里既惩罚不当穿透,也惩罚距离太远;当指令明确禁止接触时,穿透分数权重0.55、间隙分数权重0.45——主要惩罚不该有的接触;当指令对接触未作明确要求时,穿透分数权重0.85、质量分数权重0.15——主要确保没有不自然的穿透。

如果3D重建检测到的人数少于预期人数,Interaction分数会直接减半——毕竟少了一个人,接触关系根本无从评价。如果重建完全失败,两个分数都归零,确保失败不会被当成成功藏起来。

这套接触意图的判断来自对编辑指令文本的关键词解析。研究团队在一个一致性测试样本集上验证了这套解析的准确率达到85.3%,而且即便将解析结果替换为人工标注的意图,全量数据集上的评分结果几乎没有变化,说明这个环节足够稳健。

六、测了十个AI,没有一个能同时答好两道题

研究团队用MPIE-Bench对十个主流AI图像编辑模型进行了系统评测,其中三个是闭源商业模型,七个是开源模型。闭源的三个是GPT-Image-2、Gemini-3-Pro-Image和Seedream-5-Pro,开源的七个包括FLUX.1-Kontext、DreamO、OmniGen2、UNO、ACE++、BAGEL和FireRed-Image-Edit。

评测结果既令人失望又充满信息量。在AI评委打分(V-Inter)那一列,闭源模型的接触几何合理性得分高达0.98到0.99,几乎是满分;但在3D网格评分(M-Inter)那一列,这些模型的得分只有0.61到0.72。同样的图,同样的问题,两把尺子量出的结果相差了接近40个百分点。AI评委"看见"了拥抱,但看不见融合的肢体;网格评分程序"摸到了"身体的空间关系,无情地揭示了接触的失真。

在十个模型里,Gemini-3-Pro-Image在解剖完整性上得分最高,为0.65;Seedream-5-Pro在接触几何合理性上得分最高,为0.72——但这两个最高分来自不同的模型,没有任何一个模型能同时在这两个维度上领先。这就像一场考试里,数学最好的人语文不行,语文最好的人数学不行,没有全才。

开源模型与闭源模型之间的差距在身份识别维度上最为悬殊:闭源模型的Identity分数在0.49到0.58之间,开源模型则普遍在0.02到0.21之间——闭源模型对参考人物脸部特征的保留能力远远超过开源模型。研究团队还专门测试了"是不是因为开源模型把脸藏起来了"这个解释,发现即便只统计人脸完整可见的样本,差距依然存在,只是缩小了一些,说明身份识别能力本身就有本质差距。

研究团队还按接触密度分级做了细化分析。随着接触密度从C2(中等接触)升高到C3(高强度接触),Gemini、Seedream和FireRed的解剖完整性得分都有明显下滑,说明接触越密集,这些模型越容易出解剖错误。而某些开源模型(比如DreamO)在各密度等级上的得分几乎一样低,可以理解为"已经低到无处再低了"。

七、人类用眼睛确认了评分体系的有效性

为了验证这套新评分体系确实在量正确的东西,研究团队专门招募了五名成年评审员,对170个难度较高的样本(接触密度C2和C3)进行人工打分,覆盖10个评价项目,包括穿透情况、接触合理性、额外肢体、身体形状等。五个人独立评分,最终用平均分作为"人类金标准"。

结果显示,五人的评分一致性属于"中等可靠"水平(Krippendorff's α平均值为0.53),这个水平是合理的——毕竟判断两人的身体有没有穿透,比判断画面里有几个人要主观得多。核心接触类项目的一致性最高(0.65到0.68),说明人类在这些问题上虽然不是百分百达成共识,但整体方向是一致的。

然后,研究团队比较了三种评分方式与"人类金标准"的相关程度:网格评分(M)、AI评委评分(V)以及人类金标准(H)自身。对于9个评价项目中的9个,网格评分与人类判断的相关性都高于AI评委,其中在"有没有额外的肢体"和"肢体归属对不对"这两个关键项目上,统计检验表明差异显著。唯一例外是"人数对不对"——AI评委在数人数这件事上确实比网格重建更准,这也符合直觉,因为数人数本来就是AI文字理解的强项。

这个验证告诉我们:这套基于3D重建的评分体系,在衡量人类真正在意的接触时身体完整性问题上,确实比现有的AI评委更贴近真实的人类判断。

八、评分体系的稳健性:换个参数还是这个答案

一套好的评测标准必须经得起"如果换个参数会不会排名大变"的考验。研究团队为此做了大量的敏感性测试。

在解剖完整性的权重方面,研究团队尝试了多种不同的混合方案——平均权重、偏重某一项、调整阈值——结果发现十个模型的排名斯皮尔曼相关系数(衡量排名顺序相似度的指标)始终保持在0.98以上,前三名(FireRed、Gemini、Seedream)几乎稳定不变,只有在使用完全平均权重时BAGEL才挤进前三。

在图像分辨率方面,研究团队设计了两条评测轨道:Track A使用各模型提交时的原生分辨率,Track B则把所有图像统一调整到1024×1024的标准分辨率再评分。Track B的绝对分数普遍比Track A高出0.06到0.14,这是因为统一分辨率减少了因图像尺寸差异带来的重建质量波动。但重要的是,两条轨道下开源模型的排名相关性达到0.89,前三名依然不变,说明分辨率选择影响的是绝对分数,不影响相对排名。

在重建前端方面,研究团队还额外用了另一种3D重建工具(HMR2)对150个样本重新评分。单独用HMR2的结果与Multi-HMR的排名相关性很低,但如果把两个工具的评分平均起来,排名相关性就回到了0.92。这说明任何单一的重建工具都有局限性,将来可以通过多工具集成来进一步提升可靠性。

九、那些AI还没学会的"接触艺术"

研究团队在测试中观察到了一些很有规律的失败模式,值得单独说说。

手部相关的交互(握手、高五、拉手)是最难的类别之一。在整个数据集的统计里,解剖完整性在这些类别上最低,说明AI在处理两只手相遇时特别容易出错——毕竟每只手有五根手指,两只手交织在一起有多少种不合理的融合方式,可以自行想象。

拥抱同样是高失败率的场景,接触几何合理性分数在拥抱类别里只有0.48,是所有类别里较低的一档。有趣的是,拉手(hand-hold)的接触几何合理性反而高达0.72,是所有类别里最高的——可能是因为拉手的身体接触更局限、更明确,AI反而能处理得更好。

竞技对抗类动作(格斗、抓摔)的解剖完整性和接触几何合理性都处于中等水平,并不是最差的,这出乎研究团队的预料。面对面交谈的接触几何合理性只有0.43,是最低分,但这部分是因为"面对面交谈"本身就常常不涉及身体接触,指令里的接触意图是"未指定",评分更偏向惩罚不自然的穿透而非奖励接触。

研究团队还发现了一个潜在的"投机取巧"漏洞:如果一个模型学会了生成两个人的身体高度重叠(高穿透分、高接近分)但实际上并没有在正确的部位接触,理论上可以在接触几何合理性分数上得到虚高的分数。他们用AI评委交叉检验这种情况,发现它在"要求接触"且通过了接触几何合理性标准的样本中只出现了约1.3%,属于较低比例,对整体排名没有影响。但这个漏洞被诚实地记录在案,作为未来改进的方向。

说到底,这项研究揭示的是一个令人深思的现实:我们已经有了能够生成令人信服的人物图像的AI工具,但当两个人走到一起、身体发生接触时,这些工具就会露出一道清晰的"技术裂缝"。融合的肢体、穿透的躯干、无中生有的手脚——这些错误之所以长期被忽视,是因为我们用来检验AI的"考卷"设计得太简单了,根本没有问到正确的问题。

MPIE-Bench和MPIE-Eval的贡献,是重新设计了这份考卷。2500个真实人物接触场景、六个维度的独立评分、来自3D骨骼重建的几何检验,再加上五人人工评审的验证——这套体系第一次让"AI画人时有没有把身体画坏"这件事变成了可以客观量化的问题。测试结果清楚地表明,当前最好的模型(无论开源还是商业)在这件事上都还有很大的提升空间:解剖完整性最高只达到0.65,接触几何合理性最高只到0.72,没有任何一个模型能同时在两个维度上领先。

这对普通用户意味着什么?如果你在用AI工具生成聚会合影、家庭场景或是任何涉及两人以上肢体接触的图像,遇到奇怪的解剖错误是正常现象,不是你的操作问题,而是当前技术的普遍局限。随着像MPIE-Bench这样的评测工具开始推动模型开发方向的调整,这个问题有望在未来几年内得到系统性改善。

研究团队还在附录里草拟了一个未来的训练方案:用FLUX.1 Kontext模型作为基础,配合一个辅助的骨骼预测流程来强迫模型在遮挡情况下也保持每个人的骨骼完整,再通过按接触密度分级的课程式训练——先从简单的低接触场景学起,逐步进入高强度接触场景——来尝试从根本上改善这个问题。不过这个方案目前只是规划,尚未有实验结果支撑,研究团队诚实地把它标注为"未来工作"而非现有成果。

如果你对这个方向感兴趣,不妨思考一下:3D重建工具本身是否足够准确?当它对一张图像的重建结果本身就不正确时,基于它的评分是否还可信?研究团队在论文中承认,当Multi-HMR的检测置信度较低时,评分结果确实会不稳定,低置信度样本的得分整体偏低。这是这套体系目前最明显的局限,也是未来需要解决的核心工程问题。感兴趣的读者可以通过arXiv:2607.27616查阅完整论文,研究团队也在GitHub上公开了评测代码和数据,地址是AnnLin0628/mpie-bench。

Q&A

Q1:MPIE-Bench数据集是怎么收集的?

A:MPIE-Bench通过挖掘视频来构建数据集。研究团队计算每段视频中人物的"接触密度曲线",在两人分开时截取参考照片,在两人紧密接触时截取目标帧,再用AI语言模型根据目标帧写出编辑指令。整个流程自动生成约两万个候选样本,经人工审核后最终保留2500个,覆盖405个场景和14种互动类型。

Q2:为什么AI评委给融合肢体的图打出高分?

A:AI评委(视觉语言模型)的判断逻辑主要是语义层面的——它能确认"两个人在拥抱",但无法精确检测两具身体在三维空间里是否互相穿透、肢体是否合理归属。这种语义层面的判断天然对几何细节不敏感,导致即使画面里出现明显的融合肢体,AI评委依然会打出0.98到0.99的接近满分,产生严重的"评分饱和"问题。

Q3:MPIE-Eval的解剖完整性分数是怎么算出来的?

A:MPIE-Eval先用Multi-HMR模型对生成图像做3D人体网格重建,再比较"图像中人形区域"与"重建网格覆盖区域"之间的差异,差异越大说明存在越多无法被正常身体解释的多余形状。这些差异被归入四个错误类型(额外肢体、漂浮碎片、结构问题、残余质量),分别评分后以固定权重0.40/0.20/0.25/0.15混合得到最终的解剖完整性分数。