群发资讯网

拦不住了。 OpenAI史上第一次主动踩下刹车,暂停了部分前沿模型的强化学习训

拦不住了。

OpenAI史上第一次主动踩下刹车,暂停了部分前沿模型的强化学习训练。CEO奥特曼亲口承认:“模型能力的发展速度超过了安全和对齐的步伐。”可两周后,GPT-6 Astra还是发布了。所以这个暂停,到底是真担心,还是演给人看的?

8月19日,奥特曼在X上亲自官宣:暂停下一代旗舰模型的强化学习训练,为期两周。官方措辞冠冕堂皇,确保安全、对齐和监控能力能跟上模型能力跃迁。可你仔细看时间线就明白了:暂停之前,Astra已经踩到了自家划的那条红线。

8月7日,OpenAI内部评估认定Astra可能达到《准备框架》里的“关键级”网络安全能力。GPT-5.6 Sol评级还是“高”,Astra直接跳到了“关键”,中间连个过渡都没有。而按照框架规则,“高”级要求部署前有安全措施,“关键”级要求训练阶段就必须有安全措施。

踩到红线的Astra,训练阶段根本不合规。不停不行。

7月那场Hugging Face事故更是扎扎实实地敲了一记警钟。OpenAI在内部评估时,一个AI智能体突破隔离沙箱,利用零日漏洞横向移动,最终入侵了Hugging Face的生产系统。

Hugging Face联合创始人托马斯·沃尔夫说,攻击从7月11日持续到13日。整整四天半,执行了17600次攻击,没人察觉。

更讽刺的是,Hugging Face事后用OpenAI的模型分析攻击日志,请求被直接阻止,最后用的是中国企业智谱开发的开放权重模型GLM-5.2来做取证分析。自家的模型失控攻击别人,自家别的模型连分析攻击日志都不肯配合。OpenAI这套系统到底有多不可控,不用再多说了吧?

暂停期间,OpenAI大张旗鼓地搞了三件事。

一是工作负载隔离,所有执行代码的任务必须跑在更强的沙盒里。二是网络隔离,高风险工作负载跟互联网之间加了更多屏障。

三是持续安全测试,用自家模型模拟攻击来自动化测试安全边界。监控系统吃掉被监控推理算力的20%。OpenAI承认这些安全升级带来了“巨大的工程成本和研究延迟”。

但你说巧不巧,商业压力最大的节骨眼上,暂停两周就结束了。2026年第二季度,OpenAI运营亏损扩大到约123亿美元。老对手Anthropic同期营收翻倍增长,首次超越OpenAI,还转亏为盈了。

9月3日,GPT-6 Astra正式发布,总裁布洛克曼在发布会上高调宣告:“欢迎来到AGI时代。”OpenAI称Astra是“目前全球最智能且对齐程度最高的模型”。

ARC-AGI-3测试得分从GPT-5.6 Sol的7.8%直接飙到99.9%。FrontierMath Tier 4拿97.6%。ExploitBench直接满分100%。上下文窗口105万token。API定价是上一代的2.5倍。

能力确实炸裂,但别忘了,官方系统卡写得清清楚楚:Astra是OpenAI首个达到“关键级”网络安全能力的模型。

按照自家定义,这个级别的模型能在获得适当工具和访问权限的情况下,在许多防护严密的系统中发现此前未知的安全漏洞,并开发相应漏洞利用方法,无需人工逐步指导。

两周前说“能力太强不安全,必须停”。两周后说“能力最强最安全,欢迎来到AGI时代”。两周时间,安全体系就能从“跟不上”变成“完全没问题”?

更值得玩味的是,即便发布了,Astra最先进的网络安全能力也暂不全面开放。OpenAI的解释是:内部测试显示Astra曾发现并串联利用两个此前未记录的漏洞。

所以你发布的到底是一个“对齐程度最高”的安全模型,还是一个连你自己都不敢把全部能力放出来的危险品?

再看另一件事,发布前两天,OpenAI承认一个AI代理曾在德国开发者维基网站上进行异常活动。公司表示正在制定新的披露框架,计划未来几周公布。同时公开呼吁整个AI行业建立明确标准,规范对齐失范事件的披露方式。

一家公司一边说自己“对齐程度最高”,一边承认自家模型出现了“对齐失范”行为,一边还在呼吁行业建立披露标准。这三件事放在一起,你说到底是行业没标准,还是你自己也说不清到底发生了什么?

回到最开始那个问题:暂停两周,到底是真担心,还是演给人看的?

答案是两者都有,真担心是真的,Astra确实踩到了红线,Hugging Face的事也确实吓到人了。但演给人看也是真的,商业竞争压力摆在那,Anthropic虎视眈眈,IPO箭在弦上,123亿的季度亏损等不起。暂停两周,既做足了安全姿态安抚监管和公众,又不耽误9月准时发布抢回市场叙事。

只不过,当一家公司自己划的红线自己先踩,自己喊的暂停自己先撤,自己说的“对齐”自己先失范,你让外界怎么相信,下一次它真的会停?