“Welcome to the AGI era.”9月3日,OpenAI总裁在GPT-6 Astra发布会最后,直接宣布:“欢迎来到AGI时代。”
这次发布最被记住的,当然是两项接近满分的测试。ARC-AGI-3把模型放进陌生的互动环境,考它能不能自己摸索规则并完成任务,Astra得分99.9%。
ExploitBench则测试模型能不能把已知软件漏洞变成可运行的利用代码,Astra得分100%,而且这是在没有生产安全限制的测试环境里完成的。
这些成绩很抢眼,但我看完发布,真正亮眼的是一组更具体的演示:Astra直接操作电脑来处理以前必须由人收尾的工作。
1️⃣ AI开始处理“打开软件之后”的工作这类变化在PPT制作里最直观:OpenAI给Astra几页现成模板,让它按照原来的版式、视觉风格和叙事结构,生成一份完整演示文稿。
这一步的难点是理解模板,决定哪些内容放在哪一页,调整图表和排版,最后交付一份可以继续修改的文件,而不只是写出几段介绍。
在网站制作案例中,Astra还会打开浏览器做前端QA,逐项检查按钮、页面跳转和功能是否正常。
过去常见的AI编程助手会告诉你代码应该怎么写、测试应该覆盖哪些地方。现在模型开始进入浏览器和开发环境,自己执行、观察,再根据结果返工。
Computer Use 之所以成为这次发布的核心,是因为问题已经从“模型能不能回答”变成了“模型能不能在现有软件里完成一段连续工作”。
2️⃣ 编程场景的变化,是从生成代码到交付结果如果把这种操作能力放进开发环境,变化会更明显。
Astra配合新版Codex Harness,可以读取项目文件,调用终端,运行测试,再根据报错继续改代码。
OpenAI还为Codex加入了实验性的上下文机制,可以跨上下文窗口保留工作笔记,并检索更早的消息和工具输出。长任务不必只依赖一段压缩摘要,也能回头查找某个方案为什么失败。
连续执行比“代码写得更像样”更重要。
真实项目里,最耗时间的往往不是敲出第一版代码,而是读旧代码、跑环境、找依赖、补测试,再处理一连串小问题。
在OSWorld 2.0的离线子集上,Astra得分72.6%,GPT-5.6 Sol是65.7%。
按照OpenAI的延迟模拟,Astra平均每项任务约40分钟,Sol约75分钟。它不能直接代表所有生产环境的体验,但至少说明,电脑操作和持续执行正在成为模型能力差异的一部分。
3️⃣ 人和AI的分工,开始从“问答”变成“交接”前面这些场景放在一起看,GPT-6就不只是聊天窗口里的一次模型升级了。
在OpenAI描述的协作方式里,人主要说明要达成什么结果、哪些事情不能做,不必把每一个按钮都写进提示词。
Astra会在信息不足时提出问题;如果只是普通的执行细节,它会自行做合理假设;涉及重要选择时,则停下来等确认。
AI产品的验收标准也会改变。以前看的是回答准不准、文案顺不顺;以后还要看它有没有读错文件、有没有误改数据、失败后能不能回退,以及每一步操作是否留痕。
这次发布不只有模型更新。
OpenAI还更新了Codex Harness、上下文管理和安全审核机制。
能不能把工作交给AI,取决于整套系统能否在真实软件里稳定地走完流程。
所以我更愿意把GPT-6 Astra看成一种新的工作接口,而不只是聊天机器人的下一代版本。