这段时间,关于大模型的斩杀线的讨论非常多。
过去每次新模型发布,行业一般会看榜单,看它有没有超过最强的那一个。
但从Qwen3.8-Flash 上线以后,讨论的问题已经变了。8 月 27 日,阿里把这款模型的国内 API 价格降到了每百万 Token 输入 0.8 元、输出 2.7 元。缓存命中更低,只要 0.1 元。
一个价格只有旗舰模型零头的模型,如果已经能完成大量编程和办公任务,那些更贵的模型,为什么还要默认出现在每一次调用里?
这个问题,可能会影响接下来整个算力产业的生意。
1所谓大模型的斩杀线,并不是说谁把 Token 卖得最便宜。如果一个模型价格很低,却只能做简单问答,并不能改变市场。
真正的斩杀线,是把过去只有高价模型才能提供的能力,拉进多数企业可以放心长期使用的价格区间。
DeepSeek 此前带来的冲击就在这里。它让行业第一次认真思考,面对相近水平的智能,我们究竟应该付多少钱。
现在, Qwen3.8-Flash 又把这条线往前推了一步。
按照 Qwen 官方测试,它在 SWE-bench Pro 上比 Opus 4.6 高 9.1 分,在长程办公测试上高 5.7 分。这次发布,让低价模型进入了旗舰模型原本独占的任务区间。
再来看价格。Qwen 的最新国内价格,已经低于百炼平台上 DeepSeek-V4-Flash-0731 忙时价的三分之一。和 Opus 4.6 相比,差距会明显更多。在长输入的 Agent 任务里,Qwen 的国际 API 费用大约只有 Opus 的 2% 到 3%。
过去选择便宜模型,通常意味着接受能力下降,但现在价格已经落到 Flash 区间,能力却跨进了原本的旗舰区间。这才是斩杀线真正发生变化的地方。
2但为什么 Token 已经这么便宜了,企业还要重新算账?因为企业真正购买的从来不是 Token,而是一个能交付的结果。
比如我们让 AI 做一份行业分析,它需要阅读资料并调用搜索工具。中间如果发现数据不够,还会继续查找。只要某一步判断错了,后面的调用很可能都要重来。
表面上看,这只是一个任务,但对模型来说,背后可能已经跑了几十轮。这时候,单价只能解释账单的一部分。模型走错路后会不会反复重试,结果还需不需要员工修改,都会改变最终成本。
所以我觉得,大模型新的斩杀线应该从 Token 单价转向任务成本,也就是一块钱最终能完成多少工作。
这也解释了为什么 Qwen3.8-Flash 的意义不只是字面上的更便宜。它每次只激活 6B 参数,又会从长上下文里找出真正重要的部分,避免重复计算。额外的 N-gram Embedding 还能放进主机内存,减少对昂贵显存的占用。
据 Qwen 团队披露,它的训练开销只有 Qwen3.7-Plus 的约九分之一。这说明模型行业正在进入一个新阶段。过去提升能力主要靠增加计算,现在更重要的是让同一份算力产出更多有效智能。
3那昂贵的企业级模型,会因此失去市场吗?我觉得不会,但它们很可能失去一种过去被默认拥有的权利,就是所有请求都先经过自己。
过去企业为了省事,通常会选一个最强模型处理全部任务。可当低价模型已经足够好,这就像让公司里薪水最高的专家每天整理表格。专家当然能做,只是没有必要。
更合理的方式,是让低价模型先处理日常任务。碰到复杂判断,系统再把请求转给旗舰模型,必要时才由人工复核。微软披露的数据已经能看到这种变化。超过 1 万家 Foundry 客户使用过多个模型,Microsoft 365 Copilot 也加入了智能路由。
低价模型负责规模,旗舰模型处理少数难题。模型厂商争夺的,也不再只是榜单第一名,而是谁能成为企业每次请求的第一站。所以所谓默认调用权,本质上是一种分发权。一旦 Qwen3.8-Flash 进入默认位置,即使难题仍然交给 Opus,双方拿到的调用量也会完全不同。
4如果模型变得更便宜以后,GPU 需求会减少吗?直觉上好像会,一块 GPU 可以处理更多请求,完成同样工作需要的算力自然更少。
但经济学里有一个经典的杰文斯悖论,蒸汽机更省煤以后,煤炭总消耗反而上升,因为更多行业开始使用它。过去一次 Agent 任务很贵,企业只会把它放进少数高价值流程。但现在一次调用只要几毛钱,原本不值得自动化的工作也能交给 AI。
省下来的预算不一定会被收回,企业更可能把 Agent 接进更多业务流程。
Google Cloud 表示,过去一年已有近 500 家客户各自处理超过 1 万亿 Token。Gartner 甚至预测,到 2028 年,每个 Agent 工作流的推理成本可能增长五倍以上,因为任务复杂度会跑赢 Token 的降价速度。
到了那个时候,产业链比拼的也不只是 GPU 算力。
模型生成 Token 时要不断搬运权重和上下文,内存带宽会直接影响速度。上下文变长后,KV Cache 和 CPU 到 GPU 的数据移动也会进入关键路径。
所以 Qwen3.8-Flash 对算力产业的影响,可能不是让 GPU 变得不重要,而是让推理系统的其他部分变得更重要。
模型效率提高以后,算力需求会从集中训练扩展到持续推理。硬件厂商要解决的,也不只是提供更多 FLOPS,而是让整套系统稳定完成更多任务。
过去几年,大家都把模型能力看成最稀缺的东西,但接下来稀缺的,可能是把能力稳定变成结果的效率。Qwen3.8-Flash 还没有结束旗舰模型的故事,它真正改变的,是企业给每一项任务分配智能的方式。