GPT‑6 Astra跑分风波内容总结OpenAI新一代旗舰模型GPT‑6 Astra发布过程出现跑分数据反复改动的争议事件,博文上线推迟两小时,官方事后将数据变动解释为消除噪点的常规修正。一、跑分数据异常现象幻觉率:快照记录Astra幻觉率先是4.2%,数小时被修改为2.0%,对上一代GPT‑5.6 Sol数据也同步下调;被网友截图质疑后恢复原始数值。竞品分数改动:对手Anthropic的Fable 5.1数学评测成绩被调低近10个百分点,之后又回弹,变相抬高Astra相对优势。ARC‑AGI‑3:预热稿为98.6%,正式官宣直接改为99.99%。业内指出这属于Benchmaxxing现象:反复调试环境拿到最优跑分对外展示,却不披露测试条件,容易误导用户把最优表现当成日常实际能力。二、GPT‑6 Astra本身现存缺陷与官方解决方案OpenAI公开模型短板,配套发布提示词指南:爱反问、容易中断任务:指令模糊就频繁追问、中断长流程。官方给出系统提示词模板,强制模型直接产出完整结果,减少确认、询问环节。外部技能文件冲突卡死:对AGENTS.md这类技能配置文件高度敏感,指令冲突就停滞。提供调试提示,让模型定位是哪个文件哪一行造成中断。流程冗余、子Agent协作差:代码任务过度测试,消耗大量token;子智能体之间缺少主动协同。AI套话严重:设置“AI泔水词”黑名单,禁用高频AI行话、机械反差句式、模板化总结语句,强制输出朴实自然的文本。三、OpenAI内部迭代规划内部已经进入递归自我改进RSI早期,模型互相参与训练;Astra被视作内部底牌,推动部分产品计划提前半年,9月29日DevDay还有重磅发布。Astra之后的下一代将直接以AGI名义发布,预计11月中旬;完全超越人类的终极版本排期到2027年中下旬。竞争对手Anthropic也有内测新模型,将展开竞争。四、新智元推出评测工具针对AI跑分可信度的乱象,新智元即将上线ASI坐标系评测平台:从智能、推理、知识、编码、Agent、生态、经济7大维度,29项二级指标评估模型;配套「秒追ASI」「ASI爆点」「图追ASI」板块,跟踪AI行业实时动态,解决传统榜单迭代滞后的问题。基金
GPT‑6 Astra跑分风波内容总结 OpenAI新一代旗舰模型GPT‑6 Astra发布过程出现跑分数据反复改动的争议事件,博文上线推迟两小时,官方事后将数据变动解释为消除噪点的常规修正。 一、跑分数据异常现象 幻觉率:快照记录Astra幻觉率先是4.2%,数小时被修改为2.0%,对上一代GPT‑5.6 Sol数据也同步下调;
阅读:0
点赞:0