群发资讯网

昨天,GPT-6发布了。 我花了一些时间,把OpenAI的发布材料、演示和评测数据过了一遍。 原本我以为,这次升级的重点依然是模型变得更聪明了。比如数学题做得更好,代码写得更准,或者在各种测试里拿到更高的分数。 但看完之后我发现,GPT-6真正重要的变化,可能根本不是智商。 而是它开始从一个给你 ​

昨天,GPT-6发布了。

我花了一些时间,把OpenAI的发布材料、演示和评测数据过了一遍。

原本我以为,这次升级的重点依然是模型变得更聪明了。比如数学题做得更好,代码写得更准,或者在各种测试里拿到更高的分数。

但看完之后我发现,GPT-6真正重要的变化,可能根本不是智商。

而是它开始从一个给你答案的工具,变成一个能把工作真正做完的执行者。

这两者听起来很像,但其实完全不是一回事。

过去几年,我们评价一个AI够不够强,看的基本都是它会不会回答问题。

你问它一个商业问题,它给你一份分析。你让它写代码,它给你一段程序。你给它一份数据,它告诉你里面有什么规律。

这些能力当然很厉害。

但问题是,AI给完答案以后,剩下的工作往往还是要你自己完成。

你需要把数据下载下来,打开Excel,检查公式,制作图表,再打开PPT,把内容放进公司的模板里。

中途遇到格式错误、数据异常或者老板修改要求,还是得你自己重新处理。

所以过去的AI更像一个非常聪明的顾问。

它可以告诉你应该怎么做,但真正把事情做完的人,依然是你。

但GPT-6 Astra这次重点展示的,是另外一种能力。

它可以操作电脑和专业软件,完成一连串相互关联的任务。

它不只是告诉你一个表格应该怎么做,而是直接整理数据、检查结果、生成图表,并按照已有模板制作出可以交付的文件。

它也不只是给你一段建站代码,而是可以把网站做出来、运行起来,再根据你的意见继续修改。

文档、表格、PPT、网站、应用,甚至一些工程和科研软件,都开始进入它可以直接工作的范围。

这意味着,AI交付的不再只是一段文字,而可能是一个真正可以使用的结果。

举一个普通的职场例子。

假设老板把一份销售数据发给你,说:“分析一下各个地区的增长情况,找出异常原因,再按照公司模板做一份汇报,下午开会要用。”

过去你可能会把这个任务拆成很多步。

先整理原始数据,再检查缺失值;然后计算增长率,寻找异常地区;接着制作图表,写出结论;最后打开公司的PPT模板,把内容重新排版。

即使用AI帮忙,你仍然要在好几个软件之间来回切换,不断复制、粘贴和检查。

但GPT-6想做的,是接收这个目标以后,自己完成中间的整条链路。

从理解要求,到处理数据,再到制作成品。

真正的变化不是它能不能回答“哪些地区增长最快”,而是它能不能直接交给你一份下午可以拿去开会的汇报。

OpenAI公布了一组很值得注意的数据。

在衡量工作自动化能力的AutomationBench中,GPT-6 Astra得分是41.4%,上一代GPT-5.6 Sol是18.1%。

相当于提高到了之前的两倍以上。

在涉及金融建模、工程和媒体制作等专业任务的Agents’ Last Exam中,它的得分也从GPT-5.6 Sol的53.6%提高到了59.3%。

这些数字当然不代表GPT-6已经能稳定完成所有工作。

恰恰相反,41.4%的任务完成率说明,它仍然会失败,也仍然需要人检查。

但这组数据真正重要的地方在于,它揭示了AI竞争标准的变化。

过去大家比的是谁能给出更好的答案。接下来比的,可能是谁能更稳定地完成整个任务。

这也会带来一个很反常识的结果。

当AI越来越擅长执行,人的价值并不会简单地消失,但人的价值会开始转移。

过去,一个人的专业能力,很大一部分体现在他会不会操作复杂的软件、熟不熟悉流程、能不能把大量细节亲手做完。

但如果这些执行动作越来越便宜,真正稀缺的东西可能会变成:你能不能定义一个正确的问题;知不知道最终结果应该长什么样;能不能识别AI交付中的错误;是否理解业务背后的真实约束;以及出了问题以后,谁愿意为这个结果负责。

AI可以帮你生成一份财务模型,但它不一定知道,公司管理层真正关心的是现金流、利润,还是市场份额。

AI可以帮你制作一份看起来很漂亮的PPT,但它不一定知道,什么内容应该删掉,什么判断值得放在第一页。

这就是判断、品味和责任的价值。

而且,当AI开始真正操作电脑之后,风险的性质也发生了变化。

以前我们最担心的是AI会不会胡说。它说错了一个数字,编造了一个来源,或者给出了一个错误答案。

但一个只会说错话的AI,和一个会操作软件、修改文件、调用系统并执行动作的AI,风险完全不同。

GPT-6 Astra是OpenAI首个在网络安全能力上达到其“Critical”级别的广泛部署模型。

这意味着它已经具备非常强的漏洞发现和网络操作能力。所以OpenAI这次同时强调了更严格的权限、隔离、监控和安全审查。

当AI越来越能独立完成工作时,我们需要防范的问题,也从“它会不会说错”,逐渐变成了“它会不会真的做错”。

能力越强,权限管理和责任边界就越重要。

回头看GPT-6这次发布,我觉得真正值得关注的,并不是某一项跑分又提高了多少。

而是AI正在跨过一条很重要的边界。

过去,我们把AI当成一个知识工具。它负责提供信息、建议和内容,人负责操作和交付。

但现在,它开始进入真实的工作环境,使用软件、处理文件、适应变化,并尝试把一个模糊的目标变成完整的结果。

以前,我们学习的是怎么把每一步做好。

以后,我们可能更需要学习的是:如何定义目标,如何判断结果,以及哪些决定不能交给AI。

这不代表AI已经可以替代所有知识工作者。

相反,它现在仍然会犯错,仍然需要检查,也仍然无法真正理解一个组织里所有没有被写出来的规则、利益和责任。

但当执行环节不断被压缩以后,普通人确实需要重新思考一件事:

如果操作软件、整理资料和制作成品不再是最难的部分,我们还能提供什么独特价值?

当执行能力越来越便宜,真正昂贵的,可能会是判断、品味和责任。

而这,或许才是GPT-6真正升级的地方。