我用DeepSeek API跑了一个月Agent 今天Flash一升级 账单直接砍了三分之一
昨天中午12点,DeepSeek悄悄把API价格表换了。
我正好在改一个Agent工作流的提示词,顺手看了一眼后台账单。
新Flash模型缓存命中输入0.02元/百万Token,缓存未命中1元,输出4元。闲时和峰时两档,峰时翻倍。
我拿自己跑了一个月的调用量算了一笔账:同样的工作流,换成V4.1 Flash之后,日常开销大概降了三分之一。
关键是——模型还变强了。
这次V4.1 Flash的架构挺有意思。
552B参数的MoE模型,用了一套全新的Causal-Encoder-Decoder结构。输入激活8B,输出激活16B。读和写用的计算量不一样。
为什么这么设计?
跑过Agent的人都知道,我们一次调用扔进去的输入可能有几万甚至几十万Token——代码仓库、工具返回、多轮对话历史。但模型吐出来的往往就几十到几百个Token,一个工具调用或者一段代码diff。
输入输出比可能到100:1甚至1000:1。
既然绝大部分计算都在"读",那把读的部分压到8B,直接砍掉大半推理成本。这个思路很实际。
更狠的是KV Cache压缩。
官方数据:V4.1 Flash对HBM的需求降到上一代的四分之一,对SSD的需求降到八分之一。
做过长上下文Agent的都懂,KV Cache才是账单里的大头。系统提示词、RAG召回的文档、工具说明——这些前缀每次请求都在重复发送,缓存命中费用占比极高。
闲时缓存命中价格从老Flash的0.05元降到0.02元,降了60%。
同样的Agent跑一天,光缓存这一项就能省不少。
还有一个让我意外的安排。
DeepSeek同时宣布:9月14日下线V4 Pro。所有deepseek-v4-pro的请求自动路由到V4.1 Flash,按Flash价格收费。
Flash全面超越Pro,然后把Pro踢下线,老用户自动切到新模型、自动降价。
不用改一行代码,不用跑回归测试。请求照发,后端自动切换,月底账单自己会说话。
说实话这个操作挺少见的。一般厂商升级模型都是让你手动换版本,出了问题自己兜。DeepSeek这波属于"我替你做决定,但确实帮你省钱"。
性能方面我核对了官方公布的基准数据。
GPQA Diamond(科学问答)90.9分,Codeforces编程评级3471,Terminal-Bench 2.1(终端任务执行)90.6,CyberGym(网络安全)88.1。对比V4 Pro此前公布的成绩——Terminal-Bench 2.1是87.9,CyberGym是83.3——确实是全面提升。
还有一个实际体感:V4.1 Flash现在原生支持视觉理解。以前视觉能力只在V4 Flash Vision Exp那个实验模型上有,现在读代码、写代码、看截图、修bug全在一条执行链上完成,不用做上下文交接。
我拿官方给的测算口径套了自己的用量:一次典型Agent任务,100万缓存命中输入Token、10万未命中输入、1万输出,闲时费用从0.245元降到0.16元——降了约35%。
技术报告也同步开源了,权重放在Hugging Face上。
副标题很直接:"Pushing the Limits of KV Cache Compression"——把KV Cache压缩推到极限。
技术报告里有两个细节值得说:稀疏注意力是从零开始训练的,视觉模块也是从零训起,不再走以前Flash Vision-Exp的外挂路线。
这套架构的野心不在Flash本身。552B只是新结构家族里最小的一员,后面还有更大参数规模的型号要出。
对于每天靠API干活的人来说,这个信号很清楚:
Flash级别的能力已经能吃掉上一代Pro的活,价格还在往下走。大模型厂商抢市场份额的阶段,价格战只会更猛。
我现在比较好奇的是:等V4.1 Pro出来,又能把性价比推到什么位置。
一个Flash就把Pro干掉了。下一个被Flash干掉的,会是谁家的Pro?
