DeepSeek V4.1 Flash 深度解析
拆开 2026 年 9 月 10 日发布的 DeepSeek V4.1 Flash:552B 主干、输入激活 8B / 输出激活 16B 的因果编码器-解码器,跨层共享的 CSA2 加 FP4 把每 token 全局 KV 缓存压到 890 字节,原生图文输入、1–100 的推理强度与 MIT 开源;被替换掉的前代 V4 Flash 设计留作对照。
序 · 更大的 Flash,更小的缓存
2026 年 9 月 10 日,DeepSeek 发布 V4.1-Flash,同一天把权重和技术报告放上 Hugging Face,许可仍是 MIT [1][2]。官方的定位是“全新模型结构系列中最小尺寸的模型”[3],可它一点也不小:主干 552B 参数,另挂 196B 参数的 Engram 查表记忆 [1]。只看主干,也接近前代 V4-Flash(284B)的两倍。
反直觉的是:模型变大了,每个 token 占用的全局 KV 缓存却从 3,514 字节降到 890 字节,约为前代的 1/4;落到 SSD 或主机内存里的持久化缓存约为前代的 1/8 [1][2]。处理输入时每 token 只激活 8B 参数,生成输出时激活 16B——官方公告的说法是“输入和输出不对称”[3]。
这一版值得单独写一个专栏,是因为它回答的问题变了。V4 解决的是“1M 上下文算不算得起”;V4.1 的技术报告开篇就说,长时程 Agent 让负载越来越“输入重”,瓶颈已经转到预填充的计算、HBM 与 SSD 的容量、以及搬运缓存的带宽 [1]。整套新结构都是冲着这笔账去的。
资料说明:本专栏以技术报告(arXiv:2609.19969,与 Hugging Face 仓库里 9 月 10 日上传的 PDF 内容一致)、Hugging Face 模型卡与 config.json、DeepSeek 官方 API 文档与公告为主要依据,改写于 2026 年 9 月 19 日。基准分数全部是 DeepSeek 自己的测量,正文标“官方口径”,目前还没有收录第三方复现。
本专栏初版(2026 年 8 月)写的是 V4-Flash。被 V4.1 替换掉的设计(CSA 与 HCA 混合注意力、0731 那次更新)移到了第 6 部分;改写时按 V4 论文与 config.json 核对,更正了初版里几处来自二手拆解的数字,更正处都在正文注明。
一句话概括这个模型
让大部分输入 token 只走一半的层,让大部分层不存自己的缓存,再把剩下的缓存存成 4 bit。
对应到三个设计:
- CED(因果编码器-解码器):40 层分成前 20 层编码器、后 20 层解码器,解码器的全局 KV 直接从编码器最后一层的输出投影出来,预填充基本只跑编码器,于是“输入 8B、输出 16B”。
- CSA2:40 层里只有 4 层自己产生全局 KV,其余层复用;压缩后的主 KV 以 FP4 存储。
- SWA 有界重放:滑动窗口的缓存不再写进 SSD,缺了就只重算最后 128 个 token。
和前代比,变了什么
| V4-Flash(2026-04) | V4.1-Flash(2026-09) | |
|---|---|---|
| 结构 | 43 层 decoder-only | 20 层因果编码器 + 20 层解码器 |
| 参数 | 284B,每 token 激活 13B | 552B 主干 + 196B Engram,预填充 8B / 解码 16B |
| 全局注意力 | CSA 与 HCA 逐层交替 | 纯 CSA2,跨层共享 KV 与索引 |
| 每 token 全局 KV | 3,514 字节 | 890 字节 |
| 模态 | 文本 | 原生图像 + 文本输入 |
| 推理控制 | Non-think / Think High / Think Max 三种模式 | 1–100 的连续推理强度(API 分三档) |
| 预训练 | 32T token | 45T 多模态 token |
| 许可 | MIT | MIT |
数字出处见规格总表。官方同时宣布:V4-Flash 与实验性的 V4-Flash-Vision-Exp 下线,V4-Pro 也在“有序下线”,理由是多方测试里 V4.1-Flash 在性能、费用、速度与总用时上都超过了 V4-Pro(官方口径)[3]。
它和 Kimi K3 仍是两条路
同样是 1M 上下文,两家的解法方向依旧相反:
| Kimi K3 | DeepSeek V4.1-Flash | |
|---|---|---|
| 核心思路 | 线性化——69/93 层换成固定状态的线性注意力 | 压缩 + 共享——保留 softmax,缓存按序列压缩、在层间共享、存成 FP4 |
| 缓存增长 | 大部分层与长度无关 | 仍随长度线性增长,但每 token 只有 890 字节 |
| 规模 | 2.8T / 104B 激活 | 552B 主干(另有 196B Engram)/ 8B–16B 激活 |
| 许可 | 自订许可,有营收门槛 | MIT |
| 权重体积 | 约 1.42 TiB | 约 510 GB(其中约 197 GB 是 FP8 的 Engram 表) |
《AI 大模型解构》里讲过,省 KV 缓存有两条路:让缓存不随长度增长,或者让它增长得慢。K3 选了第一条;V4 在第二条上把序列压得很狠(4 倍与 128 倍),V4.1 反而放松了序列维,转到“层”和“字节”两个维度上继续省。 本专栏会反复和 K3 专栏对照。
这个专栏怎么走
第 0 部分 · 先看全貌
- V4.1-Flash 是什么 —— V4 家族的时间线、变了什么与沿用了什么、API 上的新名字。
- 规格总表 —— 参数、层配置、缓存、精度、训练与价格,和 V4-Flash 并排摊开。
第 1 部分 · 新架构:CED 与 CSA2
- 百万 token 的成本账 —— 预填充、HBM、SSD 三笔账,以及缓存大小的四个因子。
- CED:输入 8B、输出 16B —— 因果编码器-解码器怎么把预填充砍掉一半。
- CSA2:跨层共享的压缩稀疏注意力 —— Full / Reindex / Reuse 三种模式,890 字节是怎么来的。
- SWA 有界重放 —— 持久化缓存为什么只剩八分之一,代价是什么。
第 2 部分 · 主干与扩展
- 1 + 384 选 6 —— 沿用的 DeepSeekMoE,以及按模态分开的负载均衡。
- mHC 与 Single-Pass mHC —— 双随机矩阵约束的多路残差流,和一次读写的新实现。
- Engram 与 DSpark —— 196B 的查表记忆,与取代 MTP 的投机解码草稿头。
第 3 部分 · 多模态与推理强度
- 原生多模态 —— 从零训练的 DeepSeek-ViT、图像数据与 API 用法。
- 推理强度:从三档模式到 1–100 —— 连续旋钮怎么训出来,API 三档与开源编码器的映射。
第 4 部分 · 训练与精度
- 45T token、Muon 与 Sinkhorn —— 预训练规模、学习率日程与三套优化器。
- FP4 从权重走进 KV 缓存 —— 专家 FP4 沿用,主 KV 也改成 FP4。
- 后训练:算法不变,数据与环境放大 —— 任务合成、DSec 沙箱与多智能体实验。
第 5 部分 · 落地
- 基准怎么读 —— 官方表格、脚手架差异、模型卡与报告对不上的地方。
- 自己跑起来 —— 510 GB 权重、Engram 放在哪、推理引擎与采样参数。
第 6 部分 · 前代:V4 Flash
- CSA、HCA、CSA 与 HCA 怎么排、0731 正式版 —— V4.1 已经不再使用的设计,保留原文要点并按一手资料更正。
收尾
- 回顾:压缩路线走到哪了
读之前,你最好有
- 读过 《AI 大模型解构》 的注意力与 MoE 几章。
- 读过 《Kimi K3 深度解析》 会更好,但不是必需——两个专栏可以任意顺序读。
从头开始:V4.1-Flash 是什么。
参考文献
- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 552B 主干与 196B Engram、8B / 16B 激活、890 字节与 1/4、1/8 的缓存对比、“输入重”的问题陈述。
- [2] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4.1-Flash —— MIT 许可、各代每 token 全局 KV 字节数的对比图。
- [3] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. api-docs.deepseek.com/zh-cn/news/news260910 —— “最小尺寸的模型”“输入和输出不对称”的原话,V4-Flash 与 V4-Pro 下线安排。