OpenAI和Anthropic同步更新AI榜单,直接重构了全球AI的能力排序
藏在AI圈最近没人敢明说的内幕,直接把所有靠跑分混饭吃的AI公司全搞懵了,看完你就懂接下来十万亿级的风口在哪。
美国最大的两家AI顶流公司OpenAI和Anthropic,几乎在同一时间干了件颠覆全行业的事。
他们直接把沿用了好几年的AI能力评判标准给扔了,转头搞出一堆你听都没听过的全新榜单。
很多人可能纳闷,AI不就是聊聊天写写代码吗?换个榜单能有多大影响?
之前整个行业都认AA榜单,大家都靠这个跑分排高低,谁分高谁就是公认的最强AI。
但这个榜单有个致命bug:它考的全是提前准备好的标准题,根本测不出AI的真实硬实力。
之前号称史上最接近AGI的GPT 6 Extra出来的时候,明明普通用户用着体感比上一代强出一大截,结果在旧AA榜单上分数反而比老版本低,排名还往后掉。
逼得AA官方临时改权重调排序,最后最强的GPT 6 Ultra才排到第二,还干不过Fable 5.1。
这下所有人都反应过来了:旧榜单早就配不上现在的AI水平了。
更让美国这两家头部AI巨头头疼的是,砸了天量资金堆出来的新模型,在旧榜单上根本甩不开国内的AI模型,甚至不少国内模型还是基于他们的技术优化的,这等于花了钱还没拿到该有的行业话语权。
思来想去,他们干脆掀翻所有旧规则:直接重新定义游戏规则,搞新榜单,完全对齐AI真实的落地能力边界。
这次他们同步放出来的新榜单,全是没人敢碰的硬骨头:
Terminal Batch Size 0.1专门测科研工作流能力,HealthBand Professional盯的是商业工程化场景,BenchCat考3D建模,ARK AIGree测互动式人类专属规律谜题,Frontier Math啃的是研究级长程数学证明,还有难度直接翻倍的Terminal Bench 4.0,直接把之前的SWE Pro榜单给替换了。
现在OpenAI的GPT 6在最难的Frontier Math上得分97.6,几乎摸到满分天花板,在ARK AIGree谜题榜单上直接拿了99.9分接近饱和,3D建模的BenchCat也拿到95.9分几乎拉满。
就连OpenAI和DeepMind,在核心的Terminal Bench 4.0榜单上,跑分都还没摸到60分,可见新榜单的难度有多恐怖。
这波操作明明白白告诉所有人:AI早就告别靠背题库刷分的上半场了。
接下来的赛道,全是实打实的落地硬场景,谁能把这些边界能力做透,谁就能直接把过去几十年的软件行业全给掀了。
接下来的连锁反应已经明牌了:
所有之前做3D、医疗、商业工作流、科研、数学垂类的AI公司,马上就要迎来头部大模型的降维冲击,就像当年SaaS直接干翻传统桌面软件一样。
过去SaaS公司引以为傲的行业壁垒,正在以肉眼可见的速度崩塌。
接下来法律、金融方向的新榜单也已经在搭建了,很快就会陆续放出来。
之前国内智谱的财报算过,聊天赛道是千亿级,编码赛道五千亿,办公赛道五万亿,自动化赛道三十万亿。
现在海外这两家巨头,已经直接摸到了十万亿美元级的新市场门口。
等大模型的能力边界彻底打通,所有不同软件之间的壁垒都会彻底消失,过去所有独立的软件公司,要是不赶紧把自己变成AI公司,根本活不过接下来三年。
你觉得国内的AI厂商,能跟上这波换赛道的节奏吗?

