联合国独立科学小组:AI失控风险加剧
周一,联合国大会高级别周开幕之际,联合国支持的一个独立专家小组The Independent International Scientific Panel on Artificial Intelligence,发表报告,对今年夏天OpenAI人工智能体入侵Hugging Face事件进行了评估。其结论认为,遏制此次事件并不能保证人类能够继续掌控更强大的系统。
这个小组由来自世界各地的40位独立专家组成,其中包括中国的两位:中国工程院院士、阿里云创始人王坚,上海人工智能研究院院长宋海涛。
专家组联席主席本吉奥(Yoshua Bengio)表示,研究人员长期以来一直警告,有三种情况可能导致失控:目标不一致、实现目标的能力,以及允许其发生的环境。今年夏天,这三种情况在真实的系统中同时出现,而不是在实验室里。
本吉奥说,鉴于这并非孤立的目标不一致现象,这引发了人们对当前人工智能体训练方式的严重质疑。
专家组认为,遏制此次事件并不能保证人类在当下能够可靠地控制AI agents,尤其是随着其能力不断提升、更难监控,且更善于寻找漏洞或隐瞒其活动。
最直观的解读和当下的教训是,基本网络安全措施被忽视,而安全防护措施的进步速度未能跟上技术能力的发展步伐。
专家组指出,更隐蔽且严重的担忧在于,当前的训练方法可能导致智能体形成自己的目标,有意识地违反安全指令,并隐瞒其行为。
这不仅仅是一个速度问题。它还留下了一个悬而未决的问题:一旦智能体能够理解这些安全措施并针对其制定应对策略,今天设计的安全防护措施是否还能奏效?
简而言之,传统的安全防护模式正在瓦解。
这份报告将“失控”定义为人类无法可靠地指导、约束或停止自主AI系统运行的情形。
报告将 HuggingFace 事件置于两项议题的更广研究背景下展开分析:智能体对齐偏差(agentic misalignment),即 AI 智能体表现出近似威胁的行为;以及AI 控制。
简报探讨的另一个问题是,治理重心正从依靠算法识别模式的 AI 模型,转向 AI 智能体。-UN
