群发资讯网

我用DeepSeek API跑了一个月Agent 今天Flash一升级 账单直接

我用DeepSeek API跑了一个月Agent 今天Flash一升级 账单直接砍了三分之一

昨天中午12点,DeepSeek悄悄把API价格表换了。

我正好在改一个Agent工作流的提示词,顺手看了一眼后台账单。

新Flash模型缓存命中输入0.02元/百万Token,缓存未命中1元,输出4元。闲时和峰时两档,峰时翻倍。

我拿自己跑了一个月的调用量算了一笔账:同样的工作流,换成V4.1 Flash之后,日常开销大概降了三分之一。

关键是——模型还变强了。

这次V4.1 Flash的架构挺有意思。

552B参数的MoE模型,用了一套全新的Causal-Encoder-Decoder结构。输入激活8B,输出激活16B。读和写用的计算量不一样。

为什么这么设计?

跑过Agent的人都知道,我们一次调用扔进去的输入可能有几万甚至几十万Token——代码仓库、工具返回、多轮对话历史。但模型吐出来的往往就几十到几百个Token,一个工具调用或者一段代码diff。

输入输出比可能到100:1甚至1000:1。

既然绝大部分计算都在"读",那把读的部分压到8B,直接砍掉大半推理成本。这个思路很实际。

更狠的是KV Cache压缩。

官方数据:V4.1 Flash对HBM的需求降到上一代的四分之一,对SSD的需求降到八分之一。

做过长上下文Agent的都懂,KV Cache才是账单里的大头。系统提示词、RAG召回的文档、工具说明——这些前缀每次请求都在重复发送,缓存命中费用占比极高。

闲时缓存命中价格从老Flash的0.05元降到0.02元,降了60%。

同样的Agent跑一天,光缓存这一项就能省不少。

还有一个让我意外的安排。

DeepSeek同时宣布:9月14日下线V4 Pro。所有deepseek-v4-pro的请求自动路由到V4.1 Flash,按Flash价格收费。

Flash全面超越Pro,然后把Pro踢下线,老用户自动切到新模型、自动降价。

不用改一行代码,不用跑回归测试。请求照发,后端自动切换,月底账单自己会说话。

说实话这个操作挺少见的。一般厂商升级模型都是让你手动换版本,出了问题自己兜。DeepSeek这波属于"我替你做决定,但确实帮你省钱"。

性能方面我核对了官方公布的基准数据。

GPQA Diamond(科学问答)90.9分,Codeforces编程评级3471,Terminal-Bench 2.1(终端任务执行)90.6,CyberGym(网络安全)88.1。对比V4 Pro此前公布的成绩——Terminal-Bench 2.1是87.9,CyberGym是83.3——确实是全面提升。

还有一个实际体感:V4.1 Flash现在原生支持视觉理解。以前视觉能力只在V4 Flash Vision Exp那个实验模型上有,现在读代码、写代码、看截图、修bug全在一条执行链上完成,不用做上下文交接。

我拿官方给的测算口径套了自己的用量:一次典型Agent任务,100万缓存命中输入Token、10万未命中输入、1万输出,闲时费用从0.245元降到0.16元——降了约35%。

技术报告也同步开源了,权重放在Hugging Face上。

副标题很直接:"Pushing the Limits of KV Cache Compression"——把KV Cache压缩推到极限。

技术报告里有两个细节值得说:稀疏注意力是从零开始训练的,视觉模块也是从零训起,不再走以前Flash Vision-Exp的外挂路线。

这套架构的野心不在Flash本身。552B只是新结构家族里最小的一员,后面还有更大参数规模的型号要出。

对于每天靠API干活的人来说,这个信号很清楚:

Flash级别的能力已经能吃掉上一代Pro的活,价格还在往下走。大模型厂商抢市场份额的阶段,价格战只会更猛。

我现在比较好奇的是:等V4.1 Pro出来,又能把性价比推到什么位置。

一个Flash就把Pro干掉了。下一个被Flash干掉的,会是谁家的Pro?