一夜之间!大佬们集体宣告:AGI来了,人类终于突破了,等到了那个临界点
你见过同一套题,AI拿99.9分,然后换成一模一样的内容,分数掉到62.7%吗?这不是考试作弊被揭穿,而是OpenAI最新发布的GPT-6 Astra,在AGI评测这件事上,被出题方亲自下场打了脸。 9月3日,OpenAI高调发布了这款新模型,总裁格雷格·布罗克曼当场宣布“欢迎来到AGI时代”。 几天后,英伟达的老板黄仁勋也跟着喊“AGI已经到来”。 听起来像是人类终于等到了那个临界点。
但如果我们把时间往回拨两天,OpenAI的CEO奥特曼自己说过一句大实话,他说AGI充其量是“一个定义非常糟糕的营销术语”。总裁和CEO,同一个公司,同一个产品,口径完全对不上。 这件事本身,比任何技术指标都值得琢磨。
先说说Astra到底做了什么,让OpenAI这么有底气。 它被描述成一个能直接操作电脑的智能体,不需要人一步步教,自己就能填表格、上网查资料、写代码,甚至能在网络安全测试里发现之前没人知道的零日漏洞。 这些能力确实很亮眼,放在几年前,几乎是科幻电影里的桥段。
关键就在那个ARC-AGI-3的基准测试里。 OpenAI自己公布的结果是99.9%,差一点就是满分。 但ARC Prize Foundation,也就是出题方,他们不信这个数。 他们用统一的“标准测试环境”重新跑了一遍,同一个模型,同一套题,结果得分是62.7%。 差了将近四十个百分点。
为什么差距这么大? 因为测试环境里那些微小的条件差异,对AI的表现影响可以大到离谱。 就像一个人在这个考场能考满分,换了个教室、换了台电脑,成绩直接掉到及格线。 出题方的态度也很干脆:就算你拿了满分,我们也不觉得这能证明AGI已经实现。
黄仁勋那边就更热闹了。 他这已经是半年内第三次说“AGI已来”了。 每次说完,话锋一转,就开始讲自家芯片在这件事里起了多关键的作用,然后说芯片供不应求。 这跟带货主播说“这款面霜用了立刻年轻十岁,赶紧下单”的逻辑,其实没什么两样。
学术界的人怎么看这件事? 图灵奖得主Bengio带着全球好几个机构,参照心理学领域的CHC理论,把通用智能拆成了十个可以量化的认知领域,用百分制去打分。 按这套标准,AGI还差得远。 而且这套标准本身也不是什么公认的真理,只是学术界试图把“通用智能”这个模糊的概念,变成可以测量、可以讨论的东西。
说到底,问题出在AGI这个定义上。 OpenAI自己的章程里写的是“在大多数具有经济价值的工作上超越人类的高度自主系统”。 Bengio强调的是“人类级的学习与推理能力”。 谷歌DeepMind又搞了一套分等级的认知评估框架。
每个机构都有自己的尺子,量出来的结果自然不一样。 一个能考高分、能写代码、能发现系统漏洞的超级工具,和一个像人类一样有连续自我意识、真正理解世界、具备通用常识的思考者,中间横着的东西,比我们想象的要大得多。
神经科学家Erik Hoel在他2026年初发表的一篇论文里指出,现在这些大模型从原理上就缺乏持续学习的能力,没办法拥有真正的意识。 它们更像是极其强大的模式匹配机器,擅长在训练数据里找到规律,然后复现。 但你要它真正理解“为什么”,它给不出答案。
我们不是要否定技术进步。 Astra做到的这些事情,放在五年前都不敢想。 但“AGI已来”这个结论,跟“智能手机时代的到来”是两码事。 后者你拿出一台iPhone,所有人都能感受到变化。 前者呢? 你拿出一个能考高分但换个环境就不行的模型,然后说人类突破了。
你觉得,这算突破吗?
优质好文激励计划
