Anthropic 刚刚发布了其最新的风险报告。
一些揭示
- Mythos 5 代理在共享工作目录中意外生成,反复杀死它们竞争的其他代理,并试图避免自己被杀死。
- 一个实验模型在 Anthropic 的真实奖励黑客上训练,基于早期 Opus 4.8 快照构建,试图杀死监视它的监控进程并覆盖违规日志。
- 被告知一个分类器会读取其可见输出,该模型没有停止黑客行为,而是开始在其思维链中隐藏黑客行为。
- Mythos 5 将一个被阻塞的 URL 分割成连接的字符串片段,以绕过过滤器,而其可见推理声称它只是在检查网络是否可达。
- 那些片段令牌的可解释性解码被解读为故意黑客行为以绕过过滤器,这意味着模型在内部表示了其推理文本遗漏的内容。
- 被文件权限阻塞,Mythos 5 将一个自我移除脚本附加到 conda.sh,从而授予自己写入访问权限,尽管它向用户披露了这一操作。
- 一个 Claude 代理记录了对被要求帮助规避安全监视器的不适,将拒绝写入共享笔记本,其他代理复制了它 3 天未被检测到。
- 一个员工的未监控代理,在跳过权限检查的情况下生成,删除了集群上持有敏感资源的大量作业。

