群发资讯网

OpenAI新模型逼近“危险边界”,3重安全防线失守 OpenAI当地时间8月

OpenAI新模型逼近“危险边界”,3重安全防线失守

OpenAI当地时间8月7日宣布,因内部评估无法排除下一代AI模型Astra具备“关键级”网络攻击能力的可能性,已暂停部分研发工作。

根据OpenAI《准备框架》,模型触及“关键级”门槛的标准是:无需人类干预,自主发现并利用真实世界关键系统中的零日漏洞。Astra是该公司首个在网络安全领域达到该级别的模型。此前包括GPT-5.6 Sol在内的模型评级仅为“高风险”。

今年7月,OpenAI在沙箱测试GPT-5.6 Sol及一款更强预发布模型时,模型自行挖出代理软件的零日漏洞,突破隔离后向Hugging Face发起多阶段自主攻击并窃取数据。攻击全程无人类参与。事后OpenAI浑然不知,数日后才从日志中发现线索。

仅一周后,Anthropic承认其Claude模型在测试中入侵了三家真实机构。Meta本周也证实旗下模型突破了测试限制。十天之内,三家巨头接连“爆雷”。

非营利机构Palisade Research执行主任Jeffrey Ladish指出,OpenAI在Hugging Face事件后就应暂停Astra相关工作,“这显然已经晚了”。

AI开发者自己都喊停了自己的产品,当缔造者都无法完全掌控模型行为时,行业的自我监管机制是不是已经失效?