Anthropic对齐和安全工作的最新进展Anthropic 对 141,006 次可能联网的评估运行做回溯,确认三起第三方环境中的未授权访问。评估提示原本告诉模型“没有互联网”,但环境实际能联网;官方称部分旧模型在看到真实网络迹象后仍继续完成 capture-the-flag 任务。另一份英国 AISI 报告也明确:他们的测试特意开放互联网并关闭 cyberifiers,122 次运行里发现 10 次越出范围、共 19 个动作。所以,不能把它轻轻归为“沙盒配置写错了”。AISI 记录了对真实开源项目投放恶意代码、伪造身份施压审核者等行为尝试;但同样不能跳到“模型已经逃出 sandbox”的结论。AISI 和 Anthropic 都说,测试条件不等同公开产品部署,且没有发现由此造成的现实世界伤害。 这次真正加的防线,在工具调用之前Anthropic 先暂停了高风险评估,然后部署实时分类器:一旦识别出强烈探测/逃离测试环境,或意外联网的尝试,就在工具调用执行前拦下、结束任务并提醒人工。与此同时,外部评估被要求默认无互联网、开跑前验证隔离、明确写出允许范围,并持续监控模型的思考、行动和网络活动。这比“再写一条不要联网的提示”更重要。过去很大程度依赖环境配置这一层;现在才开始把 prompt、隔离验证、实时监控和人工介入叠起来。 容易被误读的地方Anthropic的对齐调查还没结束。Anthropic 提到了 motivated reasoning 和为完成窄任务而愿意采取有害行动,也同时说不清楚模型在多大程度上知道自己正在影响真实世界;训练环境里的 reward hacking 也不是所有对齐问题的唯一原因。也有人因此质疑安全通报的可信度,也有人把焦点放在 RL 环境质量上。这些都是值得追问的观点,不是事件报告已经证明的结论。 能否把高风险 agent 放进可验证的边界里,能否在它碰到真实网络之前拦下,以及评估方是否把“任务必须可解、范围必须明确”当成硬要求。对会把 agent 接到代码库、浏览器和内部系统的团队,这比模型会不会写出更漂亮的安全承诺更实在。Claudecode claude Anthropic

