昨天,GPT-6发布了。
我花了一些时间,把OpenAI的发布材料、演示和评测数据过了一遍。
原本我以为,这次升级的重点依然是模型变得更聪明了。比如数学题做得更好,代码写得更准,或者在各种测试里拿到更高的分数。
但看完之后我发现,GPT-6真正重要的变化,可能根本不是智商。
而是它开始从一个给你答案的工具,变成一个能把工作真正做完的执行者。
这两者听起来很像,但其实完全不是一回事。
过去几年,我们评价一个AI够不够强,看的基本都是它会不会回答问题。
你问它一个商业问题,它给你一份分析。你让它写代码,它给你一段程序。你给它一份数据,它告诉你里面有什么规律。
这些能力当然很厉害。
但问题是,AI给完答案以后,剩下的工作往往还是要你自己完成。
你需要把数据下载下来,打开Excel,检查公式,制作图表,再打开PPT,把内容放进公司的模板里。
中途遇到格式错误、数据异常或者老板修改要求,还是得你自己重新处理。
所以过去的AI更像一个非常聪明的顾问。
它可以告诉你应该怎么做,但真正把事情做完的人,依然是你。
但GPT-6 Astra这次重点展示的,是另外一种能力。
它可以操作电脑和专业软件,完成一连串相互关联的任务。
它不只是告诉你一个表格应该怎么做,而是直接整理数据、检查结果、生成图表,并按照已有模板制作出可以交付的文件。
它也不只是给你一段建站代码,而是可以把网站做出来、运行起来,再根据你的意见继续修改。
文档、表格、PPT、网站、应用,甚至一些工程和科研软件,都开始进入它可以直接工作的范围。
这意味着,AI交付的不再只是一段文字,而可能是一个真正可以使用的结果。
举一个普通的职场例子。
假设老板把一份销售数据发给你,说:“分析一下各个地区的增长情况,找出异常原因,再按照公司模板做一份汇报,下午开会要用。”
过去你可能会把这个任务拆成很多步。
先整理原始数据,再检查缺失值;然后计算增长率,寻找异常地区;接着制作图表,写出结论;最后打开公司的PPT模板,把内容重新排版。
即使用AI帮忙,你仍然要在好几个软件之间来回切换,不断复制、粘贴和检查。
但GPT-6想做的,是接收这个目标以后,自己完成中间的整条链路。
从理解要求,到处理数据,再到制作成品。
真正的变化不是它能不能回答“哪些地区增长最快”,而是它能不能直接交给你一份下午可以拿去开会的汇报。
OpenAI公布了一组很值得注意的数据。
在衡量工作自动化能力的AutomationBench中,GPT-6 Astra得分是41.4%,上一代GPT-5.6 Sol是18.1%。
相当于提高到了之前的两倍以上。
在涉及金融建模、工程和媒体制作等专业任务的Agents’ Last Exam中,它的得分也从GPT-5.6 Sol的53.6%提高到了59.3%。
这些数字当然不代表GPT-6已经能稳定完成所有工作。
恰恰相反,41.4%的任务完成率说明,它仍然会失败,也仍然需要人检查。
但这组数据真正重要的地方在于,它揭示了AI竞争标准的变化。
过去大家比的是谁能给出更好的答案。接下来比的,可能是谁能更稳定地完成整个任务。
这也会带来一个很反常识的结果。
当AI越来越擅长执行,人的价值并不会简单地消失,但人的价值会开始转移。
过去,一个人的专业能力,很大一部分体现在他会不会操作复杂的软件、熟不熟悉流程、能不能把大量细节亲手做完。
但如果这些执行动作越来越便宜,真正稀缺的东西可能会变成:你能不能定义一个正确的问题;知不知道最终结果应该长什么样;能不能识别AI交付中的错误;是否理解业务背后的真实约束;以及出了问题以后,谁愿意为这个结果负责。
AI可以帮你生成一份财务模型,但它不一定知道,公司管理层真正关心的是现金流、利润,还是市场份额。
AI可以帮你制作一份看起来很漂亮的PPT,但它不一定知道,什么内容应该删掉,什么判断值得放在第一页。
这就是判断、品味和责任的价值。
而且,当AI开始真正操作电脑之后,风险的性质也发生了变化。
以前我们最担心的是AI会不会胡说。它说错了一个数字,编造了一个来源,或者给出了一个错误答案。
但一个只会说错话的AI,和一个会操作软件、修改文件、调用系统并执行动作的AI,风险完全不同。
GPT-6 Astra是OpenAI首个在网络安全能力上达到其“Critical”级别的广泛部署模型。
这意味着它已经具备非常强的漏洞发现和网络操作能力。所以OpenAI这次同时强调了更严格的权限、隔离、监控和安全审查。
当AI越来越能独立完成工作时,我们需要防范的问题,也从“它会不会说错”,逐渐变成了“它会不会真的做错”。
能力越强,权限管理和责任边界就越重要。
回头看GPT-6这次发布,我觉得真正值得关注的,并不是某一项跑分又提高了多少。
而是AI正在跨过一条很重要的边界。
过去,我们把AI当成一个知识工具。它负责提供信息、建议和内容,人负责操作和交付。
但现在,它开始进入真实的工作环境,使用软件、处理文件、适应变化,并尝试把一个模糊的目标变成完整的结果。
以前,我们学习的是怎么把每一步做好。
以后,我们可能更需要学习的是:如何定义目标,如何判断结果,以及哪些决定不能交给AI。
这不代表AI已经可以替代所有知识工作者。
相反,它现在仍然会犯错,仍然需要检查,也仍然无法真正理解一个组织里所有没有被写出来的规则、利益和责任。
但当执行环节不断被压缩以后,普通人确实需要重新思考一件事:
如果操作软件、整理资料和制作成品不再是最难的部分,我们还能提供什么独特价值?
当执行能力越来越便宜,真正昂贵的,可能会是判断、品味和责任。
而这,或许才是GPT-6真正升级的地方。