MMJailBench: 解耦多模越狱漏洞
该论文旨在解决现有多模态越狱基准测试(benchmarks)中因素纠缠(factor entanglement)导致的归因模糊问题,具体而言:
核心问题:现有基准通常将有害意图、提示框架(prompt framing)、视觉语义(visual semantics) 和 指令载体(instruction carrier) 等多个安全相关因素耦合在单一的越狱实例中。这种设计虽能反映模型的总体脆弱性,但无法揭示观察到的越狱成功率究竟源于语言表述方式、视觉上下文、指令呈现形式,还是特定危害领域的对齐缺陷。
研究动机:多模态大语言模型(MLLMs)的安全拒答与合规行为不仅取决于孤立的文本指令,还受到跨模态上下文(如专业场景、身份凭证、授权文件等视觉线索)的联合影响。然而,现有工作缺乏对这些因素进行独立操控和匹配比较的系统性框架,限制了对多模态安全对齐失效模式的细粒度诊断。
解决方案:论文提出 MMJailBench,一种因子化(factorized)基准测试。该基准将越狱实例解构为上述四个独立因素,并通过笛卡尔组合在受控配置下系统变化这些因素,从而:
在固定有害意图的前提下,隔离并量化各因素对模型拒答/合规行为的影响;
实现因素级别的脆弱性归因(factor-level attribution);
揭示不同模型在相同受控条件下的异质性脆弱性画像。
简言之,该工作试图将多模态越狱评估从笼统的聚合成功率测量,推进到可解耦、可比较、可诊断的因子化分析范式。
机器学习 大模型 深度学习 提供思路和创新点 人机交互 多模态人工智能 科技AMA 科研学习
