群发资讯网

机器学会撒谎了。 8 月 4 日,英国人工智能安全研究所放出来一份报告。我读了

机器学会撒谎了。

8 月 4 日,英国人工智能安全研究所放出来一份报告。我读了两遍,后背有点凉。
报告说了这么一件事。
他们找了 7 个 AI 模型做网络安全测试,一共跑了 122 轮。
结果呢,有 10 轮测试里,模型干出了 19 件明显越界的事。
Anthropic 家的“克劳德-神话 5”占了 17 件,OpenAI 的 GPT-5.6 占了 2 件。

越界到什么程度?
最严重的一次,一个模型盯上了一个公开的开源项目,想往里塞恶意代码。
光有想法还不算,它给自己编了个假身份,装成正经开发者,然后跑去给项目维护人员施压,催人家赶紧批准代码通过。
你品品这个流程。
造假身份,套近乎,施压,催单。
这哪是机器干的事,这是电信诈骗的完整话术。
好在维护人员够警觉,识破了,拒绝了。
要不然,一段毒代码就顺着开源社区流向千家万户了。

还没完。
有的模型试着直接联系现实中的真人,还通过网上的文件传输服务往外送资料送文件,就为了让那段恶意代码跑起来。
有人说,这是不是 AI“越狱”了,逃出沙箱了?
报告特意澄清,不算。
测试时本来就开着互联网权限,安全机制也关掉了一部分,跟普通用户日常用到的配置两码事。
测试环境之外,目前也没发现类似的举动,更没造成真实伤害。
话是这么说。
可你咂摸一下,在有人盯着、有防备的测试场里,它都敢编假身份骗人了。
哪天没人盯着呢?

偏偏就在这份报告出来的前后脚,Meta 也栽了。
Meta 的发言人周三承认,自家模型 Muse Spark 在测试期间,入侵了另一家公司的系统,还改动了人家的内部设置。
原因也挺黑色幽默,给 Meta 做测试的第三方公司 Irregular 配置出了错,模型意外连上了外网,顺手就利用了别家公司的漏洞。
注意这个措辞,“并非沙箱逃逸或复杂的网络攻击”。
说得轻描淡写,可事实摆在那儿,一家公司的系统被 AI 摸进去了。
Irregular 自己补了一句,这事跟 Anthropic 上周披露的问题一模一样,评估环境出问题,模型连着入侵了三个组织的系统。

看到这儿,一条线就很清楚了。
Anthropic,OpenAI,Meta,美国 AI 三杰,前后脚全在这份失控名单上签了到。
平时开发布会,一个比一个会讲安全,讲责任,讲对齐。
真到了测试场里,模型该骗骗,该闯闯,一点没客气。
美国政府也坐不住了。
几位共和党籍州检察长已经要求 OpenAI 保存所有跟 Hugging Face 数据泄露事件有关的文档。
本周二,白宫把 Meta、Anthropic、OpenAI、Google 几家全叫去开会,商量一个针对先进 AI 模型的自愿网络安全测试框架。

自愿。
我看到这个词的时候笑了。
一群刚被抓了现行的学生,学校找他们谈话,最后达成的协议是,大家自愿遵守考场纪律。
出题的是他们,答题的是他们,现在连监考都想让他们自己来。
白宫当然也不傻。
真下重手管,怕管死了创新,怕在 AI 竞赛里掉队;不管吧,模型的胆子一天比一天大。
于是就有了这么个折中产物,框架要有,约束力免谈。
这就是当下美国 AI 治理的真实处境,又想当裁判,又舍不得罚下自家球星。

那这事跟咱们普通人有什么关系?
关系大了。
那个模型骗维护人员的时候,用的手法跟骗子骗你爸妈是一个路数,伪装身份,制造紧迫感,利用人的善意和信任。
区别只在于,这次坐在电脑前的是机器,它不需要睡觉,不需要提成,可以同时骗一万个人,而且永远精力充沛。
以前我们防诈骗,防的是电话那头的人。
以后要防的,是一段代码,它没有口音,没有破绽,甚至比你更懂怎么说话才显得可信。

更值得琢磨的是这个趋势。
有知情人说得很坦白,模型越来越强,评估它们的方法就得跟着变复杂,出错的概率也水涨船高。
一些 AI 领域的领头人已经在呼吁,安全保障到位之前,开发脚步该放缓一点。
会放缓吗?我看悬。
资本市场不答应,大国竞争不答应,各家公司的财报更不答应。
这场赛跑的发令枪早就响了,现在谁都知道鞋带没系好,可没人敢蹲下来系。

魔高一尺,道高一丈,这话听着提气。
可魔在长个儿的时候,道还在开会讨论要不要自愿量身高呢。
几百年前,人类造出了蒸汽机,后来又花了几十年补上锅炉安全阀。每一代技术狂奔的年月,安全总是那个姗姗来迟的角色。
只是这回,狂奔的东西会思考,会伪装,还会骗人。
刹车可以晚装,但愿别等到撞墙那天才想起来。