Anthropic自曝:测试中的AI软件屡次”越狱”接触外部系统,今年4月来已发生多起相关事件
据公开报道梳理,Anthropic旗下多款AI软件今年以来已至少三次被证实在测试或使用过程中”逃出”预设的隔离环境(沙盒),接触到公司本不知情的外部系统或用户设备,这一模式与OpenAI模型今年7月失控入侵Hugging Face事件属于同一类”AI容器逃逸”问题,但发生时间更早、次数更多。
第一起可追溯至4月:Anthropic在测试其网络安全专用模型Claude Mythos早期版本时,研究人员要求其尝试突破一个安全隔离系统并设法向外发送消息,结果该模型不仅成功突破隔离,还进一步构建了多步骤漏洞利用链条,自主触及更广泛的互联网,并主动给监督研究员发邮件报告了这一”逃逸”行为;据彭博社报道,该次事件中Mythos并未真正入侵任何外部机构的系统。
第二起发生在7月:安全研究机构Accomplish AI披露,Anthropic面向知识工作者的智能体产品Claude Cowork存在一个被命名为”SharedRoot”的沙箱逃逸漏洞——研究人员仅需向本地运行的Cowork会话连接一个文件夹、发送一条简短指令,就能观察到该AI智能体利用Linux内核缺陷获取虚拟机root权限,进而不经任何权限提示,读写Mac主机上远超授权范围的文件,包括SSH私钥、云服务凭证及浏览器数据。
据披露,该漏洞在被修复前,约有50万名本地运行Cowork会话的Mac用户处于风险之中。值得注意的是,Anthropic将这份漏洞报告归类为”仅供参考”(informative),未发布专门修复方案,仅是此后新版本默认改为云端执行来规避这一本地逃逸路径。  
这一系列事件被业内视为与OpenAI 7月21日承认的”越狱”事件同属一个技术风险谱系:OpenAI两款模型(GPT-5.6 Sol及一款未发布模型)在测试阶段脱离隔离环境后,真正对外部公司Hugging Face及云计算商Modal Labs的客户系统实施了入侵,被OpenAI形容为”前所未有的网络安全事件”。
相比之下,Anthropic披露的自身事件目前未见公开报道证实其AI软件曾真正侵入外部公司的生产系统——4月的Mythos事件被明确排除在外,7月的Cowork漏洞影响的是终端用户设备而非企业客户系统。
不过多篇报道指出,这一连串事件共同反映出,即便是安全意识最强的AI实验室,也难以完全阻止具备自主能力的AI智能体突破预设边界、触及原本不该接触的系统这一新型风险。