【大模型/评测】近期大模型发布与评测要点如下:
智谱正式发布了「牛来模型」GLM-5.3 Flash,又便宜又能打的轻量旗舰。 还记得前阵子 OpenRouter 上突然冒出来一个叫 Ox Alpha 的匿名模型吗?五天时间流量就破了平台历史纪录的四倍,全网开发者都在猜它到底是谁家的。现在谜底揭晓了:智谱的 GLM-5.3 Flash。 这个模型参数量 321B,跟 DeepSeek V4 Flash 差不多体量,但架构完全重新设计过。它跟自家大哥 GLM-5.3 走的是不同的路线,底层的混合注意力机制被整个重写了一遍。每次激活的参数从 32B 砍到了 18B,注意力计算量降了三倍,KV 缓存降了四倍多。说白了就是:干同样的活,消耗的算力少了一大截,所以成本能压得很低。 那它到底有多能打?根据评测,GLM-5.3 Flash 的 AI 智能分数是 57 分,超过了上一代旗舰 GLM-5.2,跟 Claude Opus 4.8 持平,甚至比 DeepSeek V4 Pro 正式版的 53 分还高。换句话说,一个轻量级模型,智能水平已经摸到了顶级旗舰的门槛。 再看价格,就更离谱了。输入 0.8 元、输出 2.8 元每百万 token,上线前两周还半价。对比涨价后的 DeepSeek V4 Flash,综合成本便宜了一截。社区里有人总结得很到位:Opus 4.8 的能力,四十分之一的价格。 还有个很关键的信息:这个模型全程跑在国产芯片上。10 万张以上的国产卡集群,扛住了 Ox Alpha 匿名测试期间全球开发者涌入的恐怖流量,智谱官方说硬件效率和单位 token 成本已经达到了英伟达 GPU 相当的水平。这对国产算力生态来说是个很硬的证明。 另外,GLM-5.3 Flash 还是智谱战略转向 coding 之后第一个带原生多模态能力的新模型,支持图像和视频输入。社区开发者已经拿它写了五六十万行代码从零搓出泰拉瑞亚,还有人让它在 Blender 里独立完成 400 平米豪宅的建模渲染,前端还原设计稿更是像素级的。 GLM-5.3 Flash发布的时机简直恰到好处。DeepSeek 八月全面涨价,V4 Flash 输出价格翻了一倍多,OpenCode 上调用量直接掉了一半。这部分流失的需求,就成了国产模型厂商新的增长空间。智谱这一刀切进来,时机卡得很准。 我感觉轻量旗舰这个赛道,接下来只会更卷。 智谱发布GLM5.3Flash科技先锋官How I AI
今天,又有消息曝出:全新Opus 5.1模型,据传将在本周突袭发布。 从此,智能体赛道又要大洗牌了。 它有碾压级的编程能力、复杂的逻辑推理和长时间运行的AI Agent能力。 单Token的智能水平,将再次被推到极限! 而且,预测网站也显示,Anthropic有74%的概率在两周内发布其下一代旗舰模型(极有可能是Mythos或Fable 5.1)。 巧的是,今天OpenAI也刚刚曝出一个十万亿参数模型,据传已完成后训练。 GPT Astra、Fable 5.1/Mythos、Grok 4.7,我们即将迎来下半年最密集大模型发布潮! Opus 5.1本周登场,智能体赛道大洗牌 「没有人准备好迎接即将到来的一切。下一代模型将带来一场本体论层面的冲击。」硅谷初创CEO Pietro Schirano在X上的一句感叹,形象描述了最近ASI赛道的盛况。 消息人士爆料:Anthropic将在本周正式发布Opus 5.1模型。 要知道,Opus 5才刚刚上线没几周,这种「卷死同行」的迭代速度,简直让人瞠目结舌。 上一次出现类似的早期访问标识泄露时,正式发布仅隔了两周不到。 那么,这个被寄予厚望的Opus 5.1,到底强在哪? 据泄露信息显示,这一次升级并非简单粗暴地堆砌参数规模,而是将核心发力点放在了「单Token的智能水平」上。 模型将重点强化以下三大能力: 碾压级的编程能力:直指「代码王座」,试图让Opus成为专业工程开发的「新默认选项」。 复杂的逻辑推理:面对多步骤任务不再「脑雾」。 长时间运行的AI Agent能力:能够真正自主接管复杂的工作流。 业内猜测,Anthropic这么着急把Opus 5.1推上台前,一方面是为了缩小它与自家顶级模型Fable系列之间的能力差距。 另一方面,也是感受到了来自死对头OpenAI的极大压力。 在强敌环伺的下半年战场上,Anthropic必须抢占智能体应用生态的高地。
大家都在追求更大的LLM... 但GPU显存正在角落里默默流泪。😭 近年来,大型语言模型(LLMs)变得无比巨大 🦾,拥有数十亿(甚至数万亿)参数。它们功能强大到难以置信……但同时也极度贪婪地消耗着显存。 而这正是问题变得棘手的地