V4.1-Flash 是什么
V4 家族从 4 月到 9 月的时间线,V4.1-Flash 相对 V4-Flash 换掉了什么、沿用了什么,API 上的新模型名与旧名路由,以及 MIT 许可在这一代里有多难得。
先把来历理清楚。这一章回答三个问题:它从哪一步演变过来,和 V4-Flash 相比哪些是新的、哪些是沿用的,以及在 API 上该怎么叫它。
时间线
| 日期 | 事件 | 出处 |
|---|---|---|
| 2026-04-24 | V4 预览版发布:V4-Pro(1.6T,激活 49B)与 V4-Flash(284B,激活 13B),权重以 MIT 许可开放,1M 上下文,API 支持思考 / 非思考双模式 | [4][5] |
| 2026-04-26 | V4 论文上 arXiv(2606.19348) | [5] |
| 2026-06-27 | Hugging Face 出现 V4-Flash-DSpark 与 V4-Pro-DSpark:不是新模型,是同一检查点外挂一个投机解码模块 | [7] |
| 2026-07-31 | V4-Flash-0731:V4-Flash 的正式版,取代预览版,agentic 能力大幅提升 | [6] |
| 2026-08-13 | V4-Pro 正式版(V4-Pro-0813);V4-Pro 与 V4-Flash 的 API 支持 low / high / max 三档推理强度;宣布峰谷定价,8 月 16 日 16:00 UTC 生效 | [8] |
| 2026-08-21 | 实验性多模态模型 V4-Flash-Vision-Exp 上线 API | [9] |
| 2026-09-10 | V4.1-Flash 发布:权重与技术报告上 Hugging Face;API 模型名改为 deepseek-flash;V4-Flash 与 V4-Flash-Vision-Exp 下线;新价格北京时间 12:00 生效 | [1][2][3] |
| 2026-09-14 | 北京时间 12:00 起,发往 deepseek-v4-pro 的请求全部路由到 V4.1-Flash,并按 V4.1-Flash 单价计费,直到 V4.1-Pro 上线 | [3] |
| 2026-09-17 | V4.1 技术报告上 arXiv(2609.19969) | [1] |
五个月里,DeepSeek 在同一套 V4 架构上先后做了“外挂投机解码”“重做后训练”“加视觉模块”三件事,然后在 9 月换了一套新结构。
官方对 V4.1-Flash 的定位是“全新模型结构系列中的最小尺寸的模型”,新结构的设计初衷是“能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型”[3]。技术报告的结尾也说,它是继续扩大规模的“新起点”[1]。V4.1-Pro 会来,但截至 9 月 19 日官方没有给出时间表,只在路由安排里写了“至未来 V4.1 Pro 上线之前”。
换掉了什么,沿用了什么
V4.1 不是在 V4 上打补丁。技术报告的原话是:在 CED 与 CSA2 之外,“进一步精简了原有的 DeepSeek-V4 架构”,并加入几项“高效的架构扩展”[1]。逐项对照:
| 部件 | V4-Flash | V4.1-Flash | 判断 |
|---|---|---|---|
| 整体结构 | 43 层 decoder-only | 20 层因果编码器 + 20 层解码器(CED) | 新 |
| 全局注意力 | CSA 与 HCA 混合 | 纯 CSA2,跨层复用 KV 与 top-k 索引 | 替换:报告写明“不同于 V4 的 CSA–HCA 混合架构,V4.1-Flash 只用 CSA2” |
| 主 KV 缓存精度 | FP8(RoPE 维为 BF16) | FP4 | 替换 |
| 滑动窗口注意力 | 每层都有,窗口 128 | 每层都有,窗口 128 | 沿用:报告说“很大程度上保留局部注意力的设计” |
| MoE | 1 共享 + 256 路由,激活 6 | 1 共享 + 384 路由,激活 6 | 沿用 DeepSeekMoE,改了规模,负载均衡按模态分开 |
| 残差连接 | mHC | Single-Pass mHC | 沿用并改进 |
| 投机解码 | MTP(深度 1),与主干一起预训练 | DSpark,预训练后单独训练 | 替换:报告写明预训练时“省略 MTP 模块” |
| 条件记忆 | 无 | Engram,196B | 新 |
| 模态 | 文本 | 原生图像 + 文本输入 | 新 |
| 推理控制 | 三种离散模式 | 1–100 的标量推理强度 | 替换 |
| 优化器 | Muon + AdamW | head-wise Muon + AdamW + Sinkhorn 均衡更新 | 沿用并扩展 |
| 权重精度 | 专家 FP4、其余多为 FP8 | 专家 FP4、其余多为 FP8 | 沿用 |
| 后训练 | SFT、RL 与在线策略蒸馏(OPD) | SFT → RL → OPD,报告称“没有算法改动” | 沿用 |
| 上下文与许可 | 1M,MIT | 1M,MIT | 沿用 |
判断依据分别在后面各章展开。被替换掉的 CSA、HCA 及其排布,本专栏放在第 6 部分作为前代档案。
在 API 上怎么叫它
官方价格页把 deepseek-flash 对应的模型版本写作 DeepSeek-V4.1-Flash:1M 上下文,最大输出 384K,支持 JSON 输出、工具调用、Responses API、Anthropic API 与图像输入,思考模式默认打开 [10]。
旧名字的处理要单独记一下:
deepseek-v4-flash、deepseek-v4-flash-vision-exp仍然能调,但对应模型已下线,请求由 V4.1-Flash 服务、按 Flash 价格计费 [10]。- 公告说 9 月 14 日起
deepseek-v4-pro也路由到 V4.1-Flash、按 V4.1-Flash 单价计费 [3]。但截至 9 月 19 日,价格页上deepseek-v4-pro一栏仍标着 DeepSeek-V4-Pro-0813 和原来的价格 [10],两份官方文档对不上,实际以账单为准。
Hugging Face 上的旧仓库(V4-Flash、V4-Flash-0731、V4-Flash-Vision-Exp 等)没有删,仍可下载。
MIT 许可有多难得
这一代能称得上“前沿”的开放权重模型里,许可大致分三档:
- 完全宽松:MIT / Apache 2.0——可商用、可修改、可转售,无附加条件。DeepSeek V4 与 V4.1 都在这一档,V4.1 仓库的 LICENSE 就是标准 MIT 文本 [2]。
- 有条件商用:自订许可加营收门槛,Kimi K3 属于此类。
- 仅研究:禁止商用。
MIT 意味着没有营收门槛、没有转售限制、没有署名之外的义务。对企业采购来说,这一条能省掉一整轮法务评估。
小结
- V4.1-Flash 于 2026-09-10 发布,是 DeepSeek 新结构系列里最小的一个;V4-Flash 与 Vision-Exp 同日下线,V4-Pro 随后被路由到它。
- 换掉的是注意力的组织方式(CSA2 取代 CSA 与 HCA)、缓存精度、投机解码与推理控制;沿用的是 DeepSeekMoE、滑动窗口、mHC、Muon 与后训练范式。
- 新增的是编码器-解码器结构、Engram 与原生视觉。许可仍是 MIT。
下一章把规格摊开。👉 规格总表
参考文献
- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— “纯 CSA2”“精简 V4 架构”“省略 MTP 模块”“保留局部注意力设计”等判断的原文,arXiv 提交日期。
- [2] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4.1-Flash —— 仓库创建时间、MIT 许可、技术报告 PDF。
- [3] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. api-docs.deepseek.com/zh-cn/news/news260910 —— 定位原话、下线与路由安排、新价格生效时间。
- [4] DeepSeek. “DeepSeek-V4 Preview Release.” 2026-04-24. api-docs.deepseek.com/news/news260424 —— V4 预览版的参数、开源与双模式。
- [5] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. arXiv:2606.19348 —— V4 的架构与训练设置。
- [6] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash-0731 —— “V4-Flash 的正式版,取代预览版”。
- [7] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash-DSpark —— “不是新模型,是同一检查点外挂投机解码模块”。
- [8] DeepSeek. “DeepSeek-V4-Pro GA Release.” 2026-08-13. api-docs.deepseek.com/news/news260813 —— low / high / max 三档推理强度、峰谷定价生效时间。
- [9] DeepSeek. “DeepSeek-V4-Flash-Vision-Exp Release.” 2026-08-21. api-docs.deepseek.com/news/news260821 —— 实验性多模态模型上线。
- [10] DeepSeek API 文档. “模型 & 价格.” 2026-09-19 查阅. api-docs.deepseek.com/zh-cn/quick_start/pricing ——
deepseek-flash的模型版本、上下文、最大输出、功能,旧模型名的处理。