DeepSeek 正式发布并开源原生多模态 MoE 模型 DeepSeek V4.1 Flash,采用 MIT 许可在 Hugging Face 开放权重与代码(deepseek-ai/DeepSeek-V4.1-Flash),API 同步全面上线,新模型名为 deepseek-flash。
架构上,模型主干 552B 参数,另有 196B Engram 条件记忆,采用 Causal Encoder-Decoder 结构:语言主干 40 层被切成 20 层因果编码器加 20 层解码器,384 个路由专家配 1 个共享专家、每次激活 6 个;prefill 每token 激活 8B、解码激活 16B;上下文窗口达 100 万 token,支持 1 到 100 的整数级连续可控推理强度。
最引人注目的是内存成绩单:FP4 主 KV Cache 把全局缓存压到每 token 890 字节,约为上代 V4-Flash 的四分之一、初代 V1 的 1/437,完整 1M token 上下文的缓存成本不到 1GB;CSA2 机制配合 SWA Bounded Replay,使 HBM 与 SSD 需求分别降至上一代的 1/4 与 1/8。官方称 V4.1 Flash 在性能、费用、速度、总用时上全面超越 V4 Pro。
跑分方面:GPQA Diamond 90.9、Terminal-Bench 2.1 拿下 90.6、Codeforces Rating 3471、DocVQA 95.6。API 定价同步下调并保持峰谷分时,闲时价格为高峰一半;2026 年 9 月 14 日 12:00 后,所有 V4 Pro 请求将路由至 V4.1 Flash 并按 Flash 单价计费——相当于用 Flash 的钱买 Pro 的能力。
生态跟进速度罕见:第三方云 SiliconFlow 发布当天即上线托管,多家应用侧快速接入;DeepSeek 同时开源 deepseek-recipe、DeepSelect、DeepJIT 三个仓库,分别用于 API 协议转换与提示词编解码、稀疏注意力 TopK 算子加速(较 torch.topk 提速 2 至 20 倍)、以及面向 CUDA 与昇腾的内核 JIT 编译缓存,为私有化部署铺平道路。