群发资讯网

OpenAI被曝修改GPT-6评测数据,幻觉率反复 模型分数说改就改,你还信评

OpenAI被曝修改GPT-6评测数据,幻觉率反复

模型分数说改就改,你还信评测榜单吗?据Fortune报道,OpenAI自9月3日发布GPT-6 Astra以来,多次修改评测基准数据,其中幻觉率一度从4.2%降到2%,后来又改回了4.2%。这波操作让很多人开始质疑:那些看起来漂亮的评测分数,到底有多少是真的?

【事件梳理:数据到底改了什么】

据IT之家援引Fortune的报道,OpenAI在9月3日发布GPT-6 Astra公告后,对评测基准数据进行了多次修改。最引人关注的是Astra的幻觉率——这个指标衡量的是AI"胡说八道"的概率,数值越低说明AI越靠谱——数据曾从4.2%降至2%,但随后又改回了原来的数值。

Fortune的报道基于网页快照,逐项梳理了数据变动的细节,并给出了多方不同解读。有人认为这是正常的数据修正,发布后发现统计有误就改回来,没什么大不了;有人则质疑OpenAI在"优化"成绩,先放一个好看的数字制造发布效果,被人发现后再改回去,反正大多数人只看发布当天的新闻。

你可以把这想象成:学生考完试公布了分数,过两天偷偷把分数改高了,被人发现后又改了回来。不管原因是什么,分数来回变动本身就会让人对公信力产生怀疑。尤其是4.2%和2%之间差了一倍多,这不是小数点后几位的微调,而是质的差别——2%的幻觉率意味着AI几乎不胡说,4.2%则意味着它还是会经常犯迷糊。

【为什么基准测试这么容易"动"】

AI模型的基准测试,本质上是用一套标准化题目来衡量模型能力,就像学生的期末考试。但问题在于,这套体系存在几个天然的"弹性空间":

一是测试数据的选择。用哪套题、怎么评分、什么算对什么算错,本身就有很大的操作空间。同一模型在不同基准上的表现可能天差地别,选对了基准就是"史上最强",选错了就是"平平无奇"。

二是数据修正的时机。发布后发现数据有误,是应该立即修正还是等下一次发布?不同的选择会给公众留下完全不同的印象。如果每次发布后都要改几次数据,公众自然会怀疑你是不是在"试数字"。

三是透明度问题。如果企业不公开完整的测试方法和原始数据,外界就很难判断修改是"纠错"还是"美化"。你说你改的是统计错误,但别人看不到你的计算过程,凭什么信你?

【我的判断:信任危机比数据本身更严重】

我认为,这次事件真正的问题不在于4.2%和2%哪个数字是对的,而在于它暴露了AI行业评测体系的信任危机。

当一家头部公司的评测数据可以在发布后反复修改,公众就有理由怀疑:其他公司发布的那些"碾压人类""史上最强"的成绩,是不是也有类似的操作?评测榜单本来是帮助用户和开发者判断模型能力的工具,如果这个工具本身不可信,那整个行业的沟通基础就动摇了。以后再有人说"我的模型跑分第一",大家第一反应不是"哇好厉害",而是"你改了几次数据?"

对普通人来说,这意味着不要盲目相信宣传中的评测分数。选AI工具时,更应该看实际使用体验——它能不能帮你写好一份报告、能不能准确回答你的问题、会不会经常胡说八道,这些比榜单上的数字实在得多。对行业来说,建立独立、透明、可复现的评测机制,已经比单纯追求更高分数更加紧迫。没有信任,再高的分数也只是空中楼阁。

你觉得AI公司应该被强制要求公开完整的评测数据和方法吗?还是说这属于商业机密不该公开?评论区聊聊你的立场。

大模型 AI大模型 AI测评 AI评测 科技