# V4.1-Flash 是什么

> V4 家族从 4 月到 9 月的时间线，V4.1-Flash 相对 V4-Flash 换掉了什么、沿用了什么，API 上的新模型名与旧名路由，以及 MIT 许可在这一代里有多难得。

- 作者：David（道雾轩）
- 专栏：DeepSeek V4.1 Flash 深度解析（https://daiw.net/manual/deepseek-v4-flash.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash/what-is-v4-flash
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

先把来历理清楚。这一章回答三个问题：它从哪一步演变过来，和 V4-Flash 相比哪些是新的、哪些是沿用的，以及在 API 上该怎么叫它。

## 时间线

| 日期 | 事件 | 出处 |
| --- | --- | --- |
| 2026-04-24 | **V4 预览版发布**：V4-Pro（1.6T，激活 49B）与 V4-Flash（284B，激活 13B），权重以 MIT 许可开放，1M 上下文，API 支持思考 / 非思考双模式 | [4][5] |
| 2026-04-26 | V4 论文上 arXiv（2606.19348） | [5] |
| 2026-06-27 | Hugging Face 出现 V4-Flash-DSpark 与 V4-Pro-DSpark：不是新模型，是同一检查点外挂一个投机解码模块 | [7] |
| 2026-07-31 | **V4-Flash-0731**：V4-Flash 的正式版，取代预览版，agentic 能力大幅提升 | [6] |
| 2026-08-13 | V4-Pro 正式版（V4-Pro-0813）；V4-Pro 与 V4-Flash 的 API 支持 low / high / max 三档推理强度；宣布峰谷定价，8 月 16 日 16:00 UTC 生效 | [8] |
| 2026-08-21 | 实验性多模态模型 V4-Flash-Vision-Exp 上线 API | [9] |
| 2026-09-10 | **V4.1-Flash 发布**：权重与技术报告上 Hugging Face；API 模型名改为 `deepseek-flash`；V4-Flash 与 V4-Flash-Vision-Exp 下线；新价格北京时间 12:00 生效 | [1][2][3] |
| 2026-09-14 | 北京时间 12:00 起，发往 `deepseek-v4-pro` 的请求全部路由到 V4.1-Flash，并按 V4.1-Flash 单价计费，直到 V4.1-Pro 上线 | [3] |
| 2026-09-17 | V4.1 技术报告上 arXiv（2609.19969） | [1] |

五个月里，DeepSeek 在同一套 V4 架构上先后做了“外挂投机解码”“重做后训练”“加视觉模块”三件事，然后在 9 月换了一套新结构。

<Callout type="info">
  官方对 V4.1-Flash 的定位是“全新模型结构系列中的最小尺寸的模型”，新结构的设计初衷是“能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型”[3]。技术报告的结尾也说，它是继续扩大规模的“新起点”[1]。**V4.1-Pro 会来，但截至 9 月 19 日官方没有给出时间表**，只在路由安排里写了“至未来 V4.1 Pro 上线之前”。
</Callout>

## 换掉了什么，沿用了什么

V4.1 不是在 V4 上打补丁。技术报告的原话是：在 CED 与 CSA2 之外，“进一步精简了原有的 DeepSeek-V4 架构”，并加入几项“高效的架构扩展”[1]。逐项对照：

| 部件 | V4-Flash | V4.1-Flash | 判断 |
| --- | --- | --- | --- |
| 整体结构 | 43 层 decoder-only | 20 层因果编码器 + 20 层解码器（CED） | **新** |
| 全局注意力 | CSA 与 HCA 混合 | 纯 CSA2，跨层复用 KV 与 top-k 索引 | **替换**：报告写明“不同于 V4 的 CSA–HCA 混合架构，V4.1-Flash 只用 CSA2” |
| 主 KV 缓存精度 | FP8（RoPE 维为 BF16） | FP4 | **替换** |
| 滑动窗口注意力 | 每层都有，窗口 128 | 每层都有，窗口 128 | **沿用**：报告说“很大程度上保留局部注意力的设计” |
| MoE | 1 共享 + 256 路由，激活 6 | 1 共享 + 384 路由，激活 6 | **沿用 DeepSeekMoE**，改了规模，负载均衡按模态分开 |
| 残差连接 | mHC | Single-Pass mHC | **沿用并改进** |
| 投机解码 | MTP（深度 1），与主干一起预训练 | DSpark，预训练后单独训练 | **替换**：报告写明预训练时“省略 MTP 模块” |
| 条件记忆 | 无 | Engram，196B | **新** |
| 模态 | 文本 | 原生图像 + 文本输入 | **新** |
| 推理控制 | 三种离散模式 | 1–100 的标量推理强度 | **替换** |
| 优化器 | Muon + AdamW | head-wise Muon + AdamW + Sinkhorn 均衡更新 | **沿用并扩展** |
| 权重精度 | 专家 FP4、其余多为 FP8 | 专家 FP4、其余多为 FP8 | **沿用** |
| 后训练 | SFT、RL 与在线策略蒸馏（OPD） | SFT → RL → OPD，报告称“没有算法改动” | **沿用** |
| 上下文与许可 | 1M，MIT | 1M，MIT | **沿用** |

判断依据分别在后面各章展开。被替换掉的 CSA、HCA 及其排布，本专栏放在[第 6 部分](https://daiw.net/manual/deepseek-v4-flash/csa)作为前代档案。

## 在 API 上怎么叫它

官方价格页把 `deepseek-flash` 对应的模型版本写作 DeepSeek-V4.1-Flash：1M 上下文，最大输出 384K，支持 JSON 输出、工具调用、Responses API、Anthropic API 与图像输入，思考模式默认打开 [10]。

旧名字的处理要单独记一下：

- `deepseek-v4-flash`、`deepseek-v4-flash-vision-exp` 仍然能调，但对应模型已下线，请求由 V4.1-Flash 服务、按 Flash 价格计费 [10]。
- 公告说 9 月 14 日起 `deepseek-v4-pro` 也路由到 V4.1-Flash、按 V4.1-Flash 单价计费 [3]。但截至 9 月 19 日，价格页上 `deepseek-v4-pro` 一栏仍标着 DeepSeek-V4-Pro-0813 和原来的价格 [10]，两份官方文档对不上，实际以账单为准。

Hugging Face 上的旧仓库（V4-Flash、V4-Flash-0731、V4-Flash-Vision-Exp 等）没有删，仍可下载。

## MIT 许可有多难得

这一代能称得上“前沿”的开放权重模型里，许可大致分三档：

- **完全宽松**：MIT / Apache 2.0——可商用、可修改、可转售，无附加条件。**DeepSeek V4 与 V4.1 都在这一档**，V4.1 仓库的 LICENSE 就是标准 MIT 文本 [2]。
- **有条件商用**：自订许可加营收门槛，[Kimi K3](https://daiw.net/manual/kimi-k3/deploy) 属于此类。
- **仅研究**：禁止商用。

MIT 意味着没有营收门槛、没有转售限制、没有署名之外的义务。对企业采购来说，这一条能省掉一整轮法务评估。

## 小结

- V4.1-Flash 于 2026-09-10 发布，是 DeepSeek 新结构系列里最小的一个；V4-Flash 与 Vision-Exp 同日下线，V4-Pro 随后被路由到它。
- 换掉的是注意力的组织方式（CSA2 取代 CSA 与 HCA）、缓存精度、投机解码与推理控制；沿用的是 DeepSeekMoE、滑动窗口、mHC、Muon 与后训练范式。
- 新增的是编码器-解码器结构、Engram 与原生视觉。许可仍是 MIT。

下一章把规格摊开。👉 [规格总表](https://daiw.net/manual/deepseek-v4-flash/spec-sheet)

## 参考文献

- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969) —— “纯 CSA2”“精简 V4 架构”“省略 MTP 模块”“保留局部注意力设计”等判断的原文，arXiv 提交日期。
- [2] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4.1-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) —— 仓库创建时间、MIT 许可、技术报告 PDF。
- [3] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. [api-docs.deepseek.com/zh-cn/news/news260910](https://api-docs.deepseek.com/zh-cn/news/news260910) —— 定位原话、下线与路由安排、新价格生效时间。
- [4] DeepSeek. “DeepSeek-V4 Preview Release.” 2026-04-24. [api-docs.deepseek.com/news/news260424](https://api-docs.deepseek.com/news/news260424) —— V4 预览版的参数、开源与双模式。
- [5] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. [arXiv:2606.19348](https://arxiv.org/abs/2606.19348) —— V4 的架构与训练设置。
- [6] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) —— “V4-Flash 的正式版，取代预览版”。
- [7] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4-Flash-DSpark](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-DSpark) —— “不是新模型，是同一检查点外挂投机解码模块”。
- [8] DeepSeek. “DeepSeek-V4-Pro GA Release.” 2026-08-13. [api-docs.deepseek.com/news/news260813](https://api-docs.deepseek.com/news/news260813) —— low / high / max 三档推理强度、峰谷定价生效时间。
- [9] DeepSeek. “DeepSeek-V4-Flash-Vision-Exp Release.” 2026-08-21. [api-docs.deepseek.com/news/news260821](https://api-docs.deepseek.com/news/news260821) —— 实验性多模态模型上线。
- [10] DeepSeek API 文档. “模型 & 价格.” 2026-09-19 查阅. [api-docs.deepseek.com/zh-cn/quick_start/pricing](https://api-docs.deepseek.com/zh-cn/quick_start/pricing) —— `deepseek-flash` 的模型版本、上下文、最大输出、功能，旧模型名的处理。
