GPT-6 Astra 是真实的重大技术跃迁(尤其"自主操作电脑"的 Agent 能力),但"已实现 AGI"的说法站不住脚——它更像是 OpenAI 在商业竞争压力下的一场叙事营销。核心证据 ARC-AGI-3 的 99.9% 在统一中立环境下只有 62.7%;独立第三方智能指数显示它与前代 Sol 持平、落后于 Claude;而 OpenAI 高层自己(奥特曼)在发布前两天刚称"AGI 是营销术语"。
综合评价真实的进步(值得承认):Astra 是迄今最强的"电脑操作型" Agent 模型——OSWorld 72.6%、Terminal-Bench 从 37.3% 跃至 57.9%、单任务平均时长从 75 分钟压到 40 分钟、百万级上下文记忆准确率 96.3%、逆向工程能力(SRE-Bench 88%)远超前代。ARC Prize 确认的"行动效率达到人类水平"是硬指标,网络安全能力更是首次达到"关键级"。这是 Agent 能力的代际跃迁,AI 应用落地确实会加速。 没有实现 AGI(结论):从任何可验证的标准看都未达成——核心证据依赖自设环境、独立评测不领先、创办基准的机构拒绝背书、OpenAI 自己都定义不了 AGI 且高层口径矛盾。Astra 证明的是"AI 能像人一样用电脑做长任务",而不是"AI 像人一样通用地理解世界"。 相反,思维链不再可读让"模型是否真在按用户意图行事"变得更难验证——在"AGI 来没来"的口水仗之外,这其实才是更值得盯的问题。后续值得追踪:第三方基准独立复测结果、激活监控等替代监督手段的进展、"潜空间推理"是否在下一版本规模化,以及 9 月 29 日 DevDay 的后续发布。
让豆包综合权威信源对astra的评价。