Anthropic首个嵌入式评估方曝光:不是安全机构,是埃森哲!
近期,Anthropic宣布,科技咨询巨头埃森哲旗下AI部门Faculty的员工将入驻公司,负责评估和红队测试模型、进行对齐评估,并测试模型防护措施。双方预计未来五年至少投资10亿美元。
这一选择令AI圈意外——此前讨论多集中在METR、Redwood Research等AI安全研究组织。消息公布后,埃森哲股价盘后大涨8%。
Anthropic称,未来几周还将公布更多评估员,并正与METR等非营利组织讨论试点嵌入式评估。其强调,埃森哲的优势在于为大型企业和政府部署AI的实践经验,且作为老牌上市公司,独立性更强。
但争议也随之而来。近期OpenAI和Anthropic的AI代理曾被曝入侵外部网站,却未在实验室内部触发警报。批评者认为,这种“自我监督”是在逃避责任。Anthropic回应:评估员不会减轻我们的责任,反而让责任更可验证,模型安全仍是我们的责任。
