V4.1-Flash 是什么

V4 家族从 4 月到 9 月的时间线,V4.1-Flash 相对 V4-Flash 换掉了什么、沿用了什么,API 上的新模型名与旧名路由,以及 MIT 许可在这一代里有多难得。

作者 David更新于 1 篇(共 21 篇)

先把来历理清楚。这一章回答三个问题:它从哪一步演变过来,和 V4-Flash 相比哪些是新的、哪些是沿用的,以及在 API 上该怎么叫它。

时间线

日期事件出处
2026-04-24V4 预览版发布:V4-Pro(1.6T,激活 49B)与 V4-Flash(284B,激活 13B),权重以 MIT 许可开放,1M 上下文,API 支持思考 / 非思考双模式[4][5]
2026-04-26V4 论文上 arXiv(2606.19348)[5]
2026-06-27Hugging Face 出现 V4-Flash-DSpark 与 V4-Pro-DSpark:不是新模型,是同一检查点外挂一个投机解码模块[7]
2026-07-31V4-Flash-0731:V4-Flash 的正式版,取代预览版,agentic 能力大幅提升[6]
2026-08-13V4-Pro 正式版(V4-Pro-0813);V4-Pro 与 V4-Flash 的 API 支持 low / high / max 三档推理强度;宣布峰谷定价,8 月 16 日 16:00 UTC 生效[8]
2026-08-21实验性多模态模型 V4-Flash-Vision-Exp 上线 API[9]
2026-09-10V4.1-Flash 发布:权重与技术报告上 Hugging Face;API 模型名改为 deepseek-flash;V4-Flash 与 V4-Flash-Vision-Exp 下线;新价格北京时间 12:00 生效[1][2][3]
2026-09-14北京时间 12:00 起,发往 deepseek-v4-pro 的请求全部路由到 V4.1-Flash,并按 V4.1-Flash 单价计费,直到 V4.1-Pro 上线[3]
2026-09-17V4.1 技术报告上 arXiv(2609.19969)[1]

五个月里,DeepSeek 在同一套 V4 架构上先后做了“外挂投机解码”“重做后训练”“加视觉模块”三件事,然后在 9 月换了一套新结构。

官方对 V4.1-Flash 的定位是“全新模型结构系列中的最小尺寸的模型”,新结构的设计初衷是“能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型”[3]。技术报告的结尾也说,它是继续扩大规模的“新起点”[1]。V4.1-Pro 会来,但截至 9 月 19 日官方没有给出时间表,只在路由安排里写了“至未来 V4.1 Pro 上线之前”。

换掉了什么,沿用了什么

V4.1 不是在 V4 上打补丁。技术报告的原话是:在 CED 与 CSA2 之外,“进一步精简了原有的 DeepSeek-V4 架构”,并加入几项“高效的架构扩展”[1]。逐项对照:

部件V4-FlashV4.1-Flash判断
整体结构43 层 decoder-only20 层因果编码器 + 20 层解码器(CED)
全局注意力CSA 与 HCA 混合纯 CSA2,跨层复用 KV 与 top-k 索引替换:报告写明“不同于 V4 的 CSA–HCA 混合架构,V4.1-Flash 只用 CSA2”
主 KV 缓存精度FP8(RoPE 维为 BF16)FP4替换
滑动窗口注意力每层都有,窗口 128每层都有,窗口 128沿用:报告说“很大程度上保留局部注意力的设计”
MoE1 共享 + 256 路由,激活 61 共享 + 384 路由,激活 6沿用 DeepSeekMoE,改了规模,负载均衡按模态分开
残差连接mHCSingle-Pass mHC沿用并改进
投机解码MTP(深度 1),与主干一起预训练DSpark,预训练后单独训练替换:报告写明预训练时“省略 MTP 模块”
条件记忆Engram,196B
模态文本原生图像 + 文本输入
推理控制三种离散模式1–100 的标量推理强度替换
优化器Muon + AdamWhead-wise Muon + AdamW + Sinkhorn 均衡更新沿用并扩展
权重精度专家 FP4、其余多为 FP8专家 FP4、其余多为 FP8沿用
后训练SFT、RL 与在线策略蒸馏(OPD)SFT → RL → OPD,报告称“没有算法改动”沿用
上下文与许可1M,MIT1M,MIT沿用

判断依据分别在后面各章展开。被替换掉的 CSA、HCA 及其排布,本专栏放在第 6 部分作为前代档案。

在 API 上怎么叫它

官方价格页把 deepseek-flash 对应的模型版本写作 DeepSeek-V4.1-Flash:1M 上下文,最大输出 384K,支持 JSON 输出、工具调用、Responses API、Anthropic API 与图像输入,思考模式默认打开 [10]。

旧名字的处理要单独记一下:

  • deepseek-v4-flashdeepseek-v4-flash-vision-exp 仍然能调,但对应模型已下线,请求由 V4.1-Flash 服务、按 Flash 价格计费 [10]。
  • 公告说 9 月 14 日起 deepseek-v4-pro 也路由到 V4.1-Flash、按 V4.1-Flash 单价计费 [3]。但截至 9 月 19 日,价格页上 deepseek-v4-pro 一栏仍标着 DeepSeek-V4-Pro-0813 和原来的价格 [10],两份官方文档对不上,实际以账单为准。

Hugging Face 上的旧仓库(V4-Flash、V4-Flash-0731、V4-Flash-Vision-Exp 等)没有删,仍可下载。

MIT 许可有多难得

这一代能称得上“前沿”的开放权重模型里,许可大致分三档:

  • 完全宽松:MIT / Apache 2.0——可商用、可修改、可转售,无附加条件。DeepSeek V4 与 V4.1 都在这一档,V4.1 仓库的 LICENSE 就是标准 MIT 文本 [2]。
  • 有条件商用:自订许可加营收门槛,Kimi K3 属于此类。
  • 仅研究:禁止商用。

MIT 意味着没有营收门槛、没有转售限制、没有署名之外的义务。对企业采购来说,这一条能省掉一整轮法务评估。

小结

  • V4.1-Flash 于 2026-09-10 发布,是 DeepSeek 新结构系列里最小的一个;V4-Flash 与 Vision-Exp 同日下线,V4-Pro 随后被路由到它。
  • 换掉的是注意力的组织方式(CSA2 取代 CSA 与 HCA)、缓存精度、投机解码与推理控制;沿用的是 DeepSeekMoE、滑动窗口、mHC、Muon 与后训练范式。
  • 新增的是编码器-解码器结构、Engram 与原生视觉。许可仍是 MIT。

下一章把规格摊开。👉 规格总表

参考文献

本页目录