群发资讯网

DeepSeek V4.1 Flash 这一刀砍向了模型推理过程中需要的HBM,直接将推理过程中KV缓存消耗打到地板,其首创的casual encoder decoder架构,前20层生成hidden states 被后20层的decoder 分别投影得到KV缓存,大大降低了缓存消耗,基于这个改进,

DeepSeek V4.1 Flash 这一刀砍向了模型推理过程中需要的HBM,直接将推理过程中KV缓存消耗打到地板,其首创的casual encoder decoder架构,前20层生成hidden states 被后20层的decoder 分别投影得到KV缓存,大大降低了缓存消耗,基于这个改进,模型价格仅为glm-5.3、kimi-k3 1/5,但综合性能比肩kimi-k3!