群发资讯网

--- 梁文锋发力了 ## 核心爆点:小模型干翻自家旗舰 这次发布的正式名称是 **DeepSeek V4.1 Flash**,是全新模型结构系列里尺寸最小的一款,但官方宣称在基准测试中超越了包括上一代旗舰 DeepSeek V4 Pro 在内的一众旗舰模型——媒体的说法很直白:"用Pro的能力收Flash的钱"。 --- ## 1. 架构革命 ​

---梁文锋发力了

核心爆点:小模型干翻自家旗舰

这次发布的正式名称是 **DeepSeek V4.1 Flash**,是全新模型结构系列里尺寸最小的一款,但官方宣称在基准测试中超越了包括上一代旗舰 DeepSeek V4 Pro 在内的一众旗舰模型——媒体的说法很直白:"用Pro的能力收Flash的钱"。

---

1. 架构革命:非对称因果编码器—解码器

**552B 总参数的 MoE**,但输入/输出计算不对称:处理输入只激活 **8B** 参数,生成输出激活 **16B**。逻辑对应 Agent 工作模式——读大量上下文(代码仓库、长文档)时用便宜的计算,产出相对有限的判断和指令。

**原生多模态**:自带视觉理解,不再是 8 月那种外挂的 Vision-Exp 实验版(当时 V4 Flash 和 Vision-Exp 还是两个独立模型)。

这套结构**可扩展到更大参数规模**,为后续更大型号铺路。

效率数字很夸张:相对上一代,**HBM 显存占用降到 1/4,SSD 存储降到 1/8**;每 token 全局 KV Cache 压到 **890 字节**,比 4 月的 V4 Flash(3514)再小 **3.9 倍**。从 V1 算起,KV Cache 总共缩小了 437 倍。

---

2. 性能:Flash 尺寸,旗舰分数

官方公布的成绩里几个关键项:

| 基准 | V4.1 Flash | 对比 ||---|---|---|| **DeepSWE v1.1** | **74.2** 🏆 | 干翻 Opus 5(74.0)、GPT-5.6 Sol || **Codeforces** | **Rating 3471** 🏆 | 竞赛编程唯一 3400+,独孤求败 || **CyberGym** | **88.1** 🏆 | V4 Pro 为 83.3 || **Terminal-Bench 2.1** | **90.6** 🏆 | V4 Pro 为 87.9 || **Automation-Bench** | **54.8** 🏆 | 第一,领先 Opus 5(50.3) || **GPQA Diamond** | 90.9 | 低于 V4 Pro(92.4)和 GPT-5.6 Sol(94.1) || **Terminal-Bench 3.0** | 30.0 | Opus 5 为 43.3 |

简单说:**Coding 和 Agent 类任务已经干到第一梯队甚至最强**(DeepSWE、CyberGym、Automation-Bench 三项登顶),但在硬核科学推理(GPQA Diamond 90.9)和复杂终端任务(TB 3.0 的 30.0 对 Opus 5 的 43.3)上仍有差距——**加了工具以后 HLE 跳到 63.9 排第一**,说明它擅长用工具补推理短板。

第三方 OpenDesign Arena 给了一个很有信息量的结果:V4.1 Flash **世界第二**,超过 Claude Fable 5.1、GPT-5.8 Sol 等,仅次 GPT-6 Astra,而且**成本只有 Astra 的 1.4%,得分达到其 98%**。

这是两个月内的第二次"小胜大":7 月 31 日的 V4 Flash 正式版就已经靠纯后训练在九项 Agent 基准上反超 Pro 预览版,这次是**连架构带后训练(新预训练方法 + 更大规模强化学习)一起换**,把差距彻底拉开。

---

3. Pro 下线(你问的重点)

官方安排:**deepseek-v4-pro 将在 9 月 14 日 12 时后转向新 Flash,并按 Flash 价格计费,直至未来 V4.1 Pro 上线**。也就是说 Pro 不是被砍,是被自家小弟性能+价格双重碾压后"战略性让位",等新架构的 Pro 出来再战。背景是 Pro 一直受高端算力产能约束、吞吐有限,定价反映的是供给瓶颈而非真实成本。

所有旧模型名(`deepseek-v4-flash`、`deepseek-v4-flash-vision-exp`)当前底层也已切换为 V4.1 Flash。文字与图片处理并入同一个主力 API 模型。

---

4. 定价:继续峰谷,缓存输入再砍 60%

新价格 9 月 10 日 12:00 生效(单位:元/百万 Token):

| 计费项 | 空闲时段 | 高峰时段 ||---|---|---|| 输入(缓存命中) | 0.02 | 0.04 || 输入(缓存未命中) | 1.0 | 2.0 || 输出 | 4.0 | 8.0 |

对比 V4 Flash 同口径:**缓存命中输入降价 60%,未命中降约 33%,输出降约 11%**——明显在定向补贴 Agent 的多轮重复读取场景。按官方测算,典型 Agent 任务组合用量的闲时费用从 **0.245 元降到 0.16 元,降约 34.7%**。

---

5. C 端和 Harness 配套

- **网页/App 端**:快速、专家、识图三个模式**全部合并**,统一接入 V4.1 Flash,最先进模型直接开"深度思考+搜索"。- **新版 Harness(配套运行环境)**与模型深度绑定:更新系统提示词时**保留已有 KV Cache**(配合降价进一步省重复计算)、Web 端支持上传图片/PDF 由 Agent 按需读取、新增实验性 **Agent Teams** 多智能体协作(共享任务列表、成员互发消息、主 Agent 汇总)。- **生态侧**:腾讯 WorkBuddy、CodeBuddy 和 OpenCode 作为官方合作伙伴全量接入。

---

一句话总结底层逻辑

> V4.1 用非对称架构把"读"的成本打穿(这正是 Agent 范式下的大头),把旗舰能力塞进小尺寸模型,再以 Flash 价格计费、Pro 让位——DeepSeek 在用**架构创新而非补贴**打价格战,目标就是把 Agent 一次任务的总账单压到无可竞争的位置。---