一款国产AI模型,因为太会找漏洞,被自家公司紧急按下了开源暂停键。
这在开源圈几乎没有先例。
8月14日,智谱发布通用编程模型GLM-5.3,却把原定的权重公开时间往后推了大约两周。
理由很直接:模型在训练中展现出超预期的网络安全能力,公司需要重新评估开放权重的风险。
先看它到底强在哪。
第一个信号,是编程实力的跳级。
在真实代码项目测试DeepSWE中,它从上一代的46.2%提升到66.9%。
要求直接操作终端的Terminal-Bench 3.0,成绩从4.6%飙到28.3%,翻了五倍多。
第二个信号,才是让智谱真正犹豫的地方。
在漏洞复现评测CyberGym里,它拿到84.5%,高于上一代的77.2%。
利用漏洞发起攻击的ExploitBench,它从24.4%涨到54.4%,一个小版本翻了一倍。
第三个信号,是这些能力已经落到了现实。
发布前的联合测试中,团队用它扫描开源项目,发现2400多个潜在漏洞,其中1088个是中高危级别。
研究人员甚至借它挖出一个潜伏40多年的DNS协议级风险,攻击者只需少量特殊请求,就能把服务器压力放大近8万倍。
问题的关键在于,开源和闭源的风险不是一回事。
闭源模型闯了祸,公司还能一键关停、封闭网络。
可权重一旦公开,任何人都能下载到本地,拆掉安全护栏,再接上扫描和攻击工具。
到那一步,模型被用来做什么,就不是智谱能决定的了。
这也是它选择先延后、把完整能力交给经过审核环节的核心原因。
不过,暂停不等于封闭。
智谱随后明确,GLM-5.3的API已正式上线,权重将于下周五以负责任的方式开源。
它在AA综合智能指数拿到60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同处一档,并与Kimi K3并列开源第一。
我的看法是,这次踩刹车比跑分更值得关注。
它说明国产模型的竞争,已经从“能不能写代码”走到了“会不会被滥用”这一层。
安全评估、分级开放、责任披露,正在成为前沿开源的新门槛。
对开发者来说,这未必是坏事。
一个愿意为风险负责的开源生态,才走得更远。
