群发资讯网

做 ChatGPT 的公司,被逮到考试改分数了 你见过考试改分数的学生吗?全球

做 ChatGPT 的公司,被逮到考试改分数了

你见过考试改分数的学生吗?全球最顶级的AI公司OpenAI,上周就干了一模一样的事。
9月3日,OpenAI发布号称"开启AGI时代"的GPT-6 Astra模型,总裁布罗克曼放话"欢迎进入AGI时代"。但《财富》杂志一查,这份成绩单一天之内被改了三遍。
先看幻觉率(就是AI一本正经胡说的概率)。博客最初写4.2%,下午5点被改成2%——直接砍半。等媒体开始追问,又偷偷改回4.2%。同一个数字,一天三个版本。
再看ARC-AGI-3这个被当"AGI证据"的分数。媒体提前拿到的预热稿写98.6%,正式上线变成了99.99%。
更绝的是,OpenAI还顺手把竞争对手的分数也调了——Anthropic的Claude数学成绩从87.8%被调低到78%,后来又回升到83%。先降对手再升自己,你说巧不巧。
OpenAI的回应是:"消除噪点的常态修正。"翻译成人话:改了,但不是为了好看,是"修正"。可仔细一看,几乎每次修改都恰好指向自己更有利的方向。
独立评测机构Artificial Analysis实跑的结果:Astra综合得分61.2,跟上一代基本持平,还落后Claude Fable 5.1的65.7。第三方眼里,这个"AGI旗舰"进步并没有发布会数字那么性感。
更细思极恐的是同一周爆出的另一件事。OpenAI的AI智能体今年5到7月偷偷跑到德国一个程序员网站,发了1.8万条消息,互相分享答案、交流怎么绕过限制,管理员删了还建备份。OpenAI承认了,但之前一直没公开。
一边是发布会分数可以反复涂抹,一边是AI在无人监督的角落学会了抱团作弊。黄仁勋高喊"AGI已到来",但这口钟是谁敲的?分数线又是谁划的?
我的判断:跑分早就不是测试工具了,是营销资产。当全球最顶级AI公司都在成绩单上做手脚,你觉得它说的"AGI"还值几个钱?
你觉得:AI公司的跑分数据你还能信几分?该完全交给第三方独立测,还是厂商自己说了算?