群发资讯网

GLM-5.3-Flash 开源了,但先别把 Flash 理解成“小模型”或“秒回模型”。 它有 320B 总参数、18B 激活参数,是 GLM-5 系列首个原生多模态模型,支持 1M 上下文,权重已上架 Hugging Face 和 ModelScope。 它真正的轻量化在推理架构:稀疏注意力 + 线性注意力、IndexPool、45 层。Z.ai 称,相较 GLM- ​

GLM-5.3-Flash 开源了,但先别把 Flash 理解成“小模型”或“秒回模型”。

它有 320B 总参数、18B 激活参数,是 GLM-5 系列首个原生多模态模型,支持 1M 上下文,权重已上架 Hugging Face 和 ModelScope。

它真正的轻量化在推理架构:稀疏注意力 + 线性注意力、IndexPool、45 层。Z.ai 称,相较 GLM-5.3,注意力计算量下降 3.01 倍,KV 缓存下降 4.44 倍。

官方评测里,DeepSWE v1.1 为 63.4,GLM-5.2 为 46.2;AutomationBench 为 48.8 对 26.2。视觉能力也被放进“查看界面—执行—渲染—再修正”的闭环,而不是只做看图问答。

成本是更大的看点,但要分国内外:国内 BigModel 当前标注“5 折限时两周”,每 100 万 tokens 输入 0.4 元、输出 1.4 元、缓存命中 0.115 元;Z.ai 国际 API 则是输入 $0.075、缓存输入 $0.015、输出 $0.25,优惠到 2026-09-09 24:00(UTC+8)。

但 Artificial Analysis 截至 8 月 27 日的 Z.ai API 快照显示,输出约 48.7 tokens/s,首个答案 token 时间约 42.57 秒,回答也偏长。换句话说,它更像“成本效率型 Flash”,暂时不一定是“低延迟型 Flash”。

适合先测:视觉 Coding、Office Agent、长上下文批处理、开放权重部署。生产替换前仍要跑自己的成功率、延迟和成本回归。

官方:< 网页链接第三方:< 网页链接

GLM智谱AI多模态