群发资讯网

GPT-6跑分被偷偷改过?OpenAI数据反复横跳 你看到的AI跑分,可能刚被

GPT-6跑分被偷偷改过?OpenAI数据反复横跳

你看到的AI跑分,可能刚被改过。
这句话不是吓唬人。就在9月3日OpenAI发布GPT-6 Astra之后没几天,Fortune就扒出了一件让整个AI圈炸锅的事:OpenAI在发布公告里,反复修改了GPT-6 Astra的基准测试数据。其中最离谱的一个数字——幻觉率,先从4.2%降到了2%,然后又改回了原来的数。网页快照把每一次改动都拍了下来,时间线清清楚楚。
跑分这东西,到底还能不能信?
先解释一下什么是"幻觉率"。你可以把它理解成AI"一本正经胡说八道"的概率。这个数字越低,说明模型越靠谱。从4.2%降到2%,几乎是腰斩,对消费者来说这是个巨大的卖点——"我们的模型撒谎少了一半"。但问题是,这个降完的数字没多久又被改回去了。改回去的理由是什么?OpenAI没有公开说明。
这就好比你去餐厅吃饭,服务员告诉你"今天这道菜盐放得少了一半",你正高兴呢,后厨跑出来说"不好意思,刚才说错了,还是原来那么咸"。你心里什么感受?以后他说"盐少了"你还信吗?
数据改来改去,受伤的是谁?
直接受伤的是那些靠跑分做采购决策的企业和开发者。一家公司决定花大价钱接入某个大模型,很大程度上看的就是这些基准测试分数。如果发布方自己都能在后台反复改数字,那相当于考试出卷老师一边改卷子一边改标准答案——你考了多少分,不取决于你学得多好,而取决于老师今天心情如何。
更深层的问题在于透明度。AI行业的评测体系本来就年轻,很多测试标准还在摸索阶段。模型厂商既是运动员又是裁判员的情况本就普遍,现在连已经发布出去的数字都能事后修改,这让本来就脆弱的信任体系雪上加霜。
当然也有另一种解读:也许OpenAI是在修正测试中的技术误差,毕竟新模型刚上线,评测流程出点小bug也不是不可能。但问题在于,修正应该公开透明地标注"此处已更新",而不是悄悄改掉、不留痕迹。网页快照能抓到这些变动,说明OpenAI自己并没有主动披露——如果不是被人翻出来,这些改动可能就永远藏在历史里了。
我们普通人该怎么办?
说实话,对普通用户来说,与其纠结跑分数字,不如自己上手试。跑分是实验室里的短跑成绩,你日常用它写文案、做总结、查资料,才是真正的马拉松。一个模型在基准测试里少幻觉一次,和你实际用它时它给你编了一个不存在的参考文献,完全是两码事。
但这并不意味着这件事不重要。恰恰相反,正因为越来越多的人把工作、合同、甚至法律决策交给AI,基准数据的可信度就变成了一件跟每个人都有关的事。今天OpenAI可以悄悄改幻觉率,明天别的厂商也可以在别的指标上"微调"。如果没有第三方独立评测和严格的数据披露规范,整个行业都可能陷入"谁会营销谁赢"的怪圈。
你觉得,AI厂商在发布新模型时,有没有义务像上市公司财报一样,把基准测试数据固定下来、不允许事后修改?如果改了必须标注版本号,还是说技术迭代快,数据更新本来就是常态?

科技