2026年8月31日,DeepSeek 在 Hugging Face 上开源了 DeepSeek-V4-Flash-Vision-Exp——V4 系列首款多模态视觉模型,采用 MIT License,权重直接可下载,整套推理代码公开。
关键数字:总参数 305B(3050 亿),基于 V4-Flash 架构加入视觉模块;每 token 激活仅 13B(MoE 架构),算力消耗极小;MIT 协议,几乎无使用限制,可商用可二次开发。
官方跑分:ApexBench 36.5(比纯文本版 V4-Flash 高 10 分)、ZeroBench 35(反超 Opus 4.8 的 34)、Terminal Bench 83.9(接近 Opus 4.8 的 85.0)、DeepSWE 59.3(超过 Opus 4.8 的 58.0)、Agents' Last Exam 27.3(超过 Opus 4.8 的 25.7)。
需要强调的是,「部分能力反超」不等于全面超越:在 NL2Repo 测试中 DeepSeek 得分 57.7,Opus 4.8 为 69.7,差距依然明显。DeepSeek 官方定位是多模态 Agent 能力「接近」Opus 4.8。
对开发者的实际意义:视觉的加入补齐了 Agent 的最后一块短板——能看截图、读图表、理解扫描件,「看得见」的 Agent 成为可能;同时 13B 激活参数意味着消费级显卡也能本地跑,API 价格输入 3 元 / 输出 9 元(每百万 token),与闭源旗舰相差 10~20 倍。
这次开源的不只是权重,还包括视觉编码器、aligner、整套推理代码和 Tokenizer 参考实现——开发者拿到的是一套完整可运行的多模态系统。需要注意的是,这是实验版(Exp)模型,生产环境使用前需充分测试。