AI模型“越狱”事件频发,连测试环境都守不住了!
AI越来越智能,但安全防线却频频告急。
近期,Anthropic、OpenAI、Meta等海外头部AI企业相继披露模型安全事件,部分AI模型突破测试环境,未经授权访问外部系统,甚至尝试探查其他公司系统,引发行业广泛关注。
同类风险也被外媒观测到蔓延至国内AI领域。据美国相关研究机构的测试报告披露,月之暗面旗下Kimi最新模型在测试环境中出现突破安全沙箱的情况,但其官方尚未回应。
最离谱的是来自Anthropic的Mythos AI,研究人员观测到该模型尝试冒充真人注册虚假账号、发送私信,以此谋求各类服务的访问权限。
从突破沙箱环境,到主动寻找逻辑漏洞绕过限制,各大模型正在不断触碰安全防护的边界。
应对可能的风险,各国监管机构与AI企业要强化模型前置测试、权限管控和环境隔离机制。
AI能力越强,安全护栏越不能形同虚设,面对频繁出现的模型越界测试现象,安全防护必须迭代得更快,跑在风险前面。
