回顾:压缩路线走到哪了
把 V4.1-Flash 的设计收成一张表:编码器-解码器、CSA2 与 FP4 缓存、有界重放、Engram 与 DSpark、原生多模态与连续推理强度;再看压缩路线从 V4 到 V4.1 怎样转了向,以及还缺哪些独立验证。
二十章走完,收束一下。
V4.1-Flash 的设计一览
| 设计 | 具体做法 | 换来什么 | 代价或未知 |
|---|---|---|---|
| CED | 20 层因果编码器 + 20 层解码器,解码器的全局 KV 从编码器输出投影 | 预填充约减半,输入 8B / 输出 16B 激活 | 解码器的长程信息只来自编码器最后一层;没有公开消融 |
| CSA2 | 三种模式跨层复用,只有 4 层产生全局 KV;解码器用候选池限制索引 | 每 token 全局 KV 890 字节,约为前代 1/4 | 选择错误是静默的;缺少百万级检索评测 |
| FP4 主 KV | 量化感知训练,E2M1 加每 16 通道一个 E4M3 缩放 | 缓存存储再减近一半 | 滑动窗口 KV 太敏感,只能留在 FP8 |
| SWA 有界重放 | 滑动窗口缓存不落盘,缺了只重算最后 128 个 token | 持久化缓存约为前代 1/8 | 状态是近似的,且与缓存命中位置有关 |
| MoE | 1 + 384 选 6,按模态分开的负载均衡 | 552B 主干里约 99% 是专家 | 知识类仍明显弱于 V4-Pro |
| Single-Pass mHC | 4 条残差流、双随机约束,混合系数错后一层 | 残差更新一次读写,激活读写量减半 | 官方称性能损失可忽略 |
| Engram | 第 1、14 层按 n-gram 哈希查表,196B,FP8 | 表可放主机内存甚至 SSD | 对 V4.1 的贡献没有消融 |
| DSpark | 3 个块一次草拟 5 个 token,按置信度决定验证长度 | 取代 MTP,预训练后单独训练 | 加速比依赖负载 |
| 原生多模态 | 从零训练的 DeepSeek-ViT,预训练第一天就混入图像 | 单图最多 1024 个 token 的图文输入 | 与大型闭源系统仍有整体差距 |
| 推理强度 | 1–100 的标量条件,RL 里按强度分组、长度惩罚随强度衰减 | 一份权重覆盖整条成本—质量曲线 | API 只开放三档;开源映射改过一次 |
再加一条不在架构里、但同样关键的:MIT 许可。
压缩路线转了向
本专栏初版在这里写过一句预言:“压缩路线的下一步显然是‘压得更狠’,压到极限就是固定大小的状态,那就是线性注意力。”V4.1 没有照这个方向走。
| V4-Flash | V4.1-Flash | |
|---|---|---|
| 序列维 | 狠:CSA 压 4 倍,HCA 压 128 倍 | 松:编码器压 2 倍,解码器不压 |
| 层维 | 41 层各存一份 | 4 层产生,其余复用 |
| 字节 | 主 KV 用 FP8 | 主 KV 用 FP4 |
| 计算 | 每个输入 token 走全部层 | 大部分输入 token 只走一半层 |
| 结果 | 3,514 字节 / token | 890 字节 / token |
序列维反而放松了,省下来的主要是“存几份”和“每份多大”,再加上“输入少算一半”。V4.1 报告给的理由是换一个视角:把 V4 看成“滑动窗口负责局部、压缩的全局上下文做补充”,于是去简化全局分支,而不是继续加码压缩 [1]。
这让和 K3 专栏的对照也变了味道。K3 仍在“线性化”:用固定大小的状态让大部分层的缓存不随长度增长。DeepSeek 的回答是:缓存可以继续随长度增长,只要每 token 的常数足够小、存的层足够少——890 字节 / token 意味着百万 token 的全局缓存不到 1 GB。两条路还在各自往前走,谁也没有并入谁。
这个模型最值得记住的三件事
一、账变了:Agent 时代贵的是输入和存储。 V4 解决“百万上下文算不算得起”,V4.1 解决“反复送进来的长输入算不算得起、存不存得下”。CED、CSA2、有界重放都在同一笔账上:预填充、HBM、SSD。API 里缓存命中价只有未命中的 1/50,这笔账直接写在了价格表上。
二、后训练的分量,两次得到印证。 0731 没动主干,DeepSWE 从 7.3 到 54.4;V4.1 的报告干脆说后训练“没有算法创新”,收益几乎全部来自合成任务与环境。架构决定上限,数据和环境决定你实际拿到多少。
三、MIT 还在,但部署门槛变了。 官方权重约 510 GB,全部进显存要一台多卡服务器;前代那种“一台好工作站就能试”的说法不再成立。变数在 Engram:近 200 GB 的查表记忆可以放在主机内存或 SSD 上,社区已经在这条路上试。
几处清醒的提醒
- 所有基准都是官方口径,模型卡与报告还有一处数字对不上(NL2Repo-Bench 的 64.0 与 65.4)。写作时没有第三方复现。
- 长上下文精确检索没有数字。一个主打百万上下文、又大量复用稀疏选择的模型,报告只给了基座的 LongBench-V2。
- 知识仍是弱项:基座 SimpleQA-Verified 42.3,高于前代但远低于 V4-Pro。配上检索,扬长避短这条建议没变。
- 有界重放是近似:同一段对话,缓存命中在哪里,内部状态就可能略有不同。
这个专栏更正了什么
改写时按 V4 论文与 config.json 核对了初版,更正了四处来自二手资料的说法,各页都已注明:
- 27% FLOPs 与 10% KV 缓存是 V4-Pro 的数字,V4-Flash 是 10% 与 7%(成本账);
- CSA 与 HCA 是逐层交替、约 1:1,不是“3:1 与 4:1、HCA 集中在后 2/3”(怎么排);
- mHC 约束的是双随机矩阵,不是“学习到的低维流形”(mHC);
- 0731 是挂了投机解码模块的正式版,“结构完全不变”不准确;“自适应路由温度”在两份报告里都找不到,已删去(0731、MoE)。
接着读什么
- 对照阅读:《Kimi K3 深度解析》 —— 线性化路线的完整拆解。
- 同期第三条路:《Qwen3.8-Max 深度解析》 —— 赌注押在长时程自主任务上的旗舰。
- 打底:《AI 大模型解构》 —— 上一代架构的系统梳理。
- 模型自己造训练题:《RSI 技术探究》 —— V4.1 后训练里“让模型构造任务”的那一类做法,放在更大的背景里看。
参考文献
- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969
- [2] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4.1-Flash
- [3] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. arXiv:2606.19348
- [4] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. api-docs.deepseek.com/zh-cn/news/news260910
- [5] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash-0731