# 回顾：压缩路线走到哪了

> 把 V4.1-Flash 的设计收成一张表：编码器-解码器、CSA2 与 FP4 缓存、有界重放、Engram 与 DSpark、原生多模态与连续推理强度；再看压缩路线从 V4 到 V4.1 怎样转了向，以及还缺哪些独立验证。

- 作者：David（道雾轩）
- 专栏：DeepSeek V4.1 Flash 深度解析（https://daiw.net/manual/deepseek-v4-flash.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash/recap
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

二十章走完，收束一下。

## V4.1-Flash 的设计一览

| 设计 | 具体做法 | 换来什么 | 代价或未知 |
| --- | --- | --- | --- |
| **CED** | 20 层因果编码器 + 20 层解码器，解码器的全局 KV 从编码器输出投影 | 预填充约减半，输入 8B / 输出 16B 激活 | 解码器的长程信息只来自编码器最后一层；没有公开消融 |
| **CSA2** | 三种模式跨层复用，只有 4 层产生全局 KV；解码器用候选池限制索引 | 每 token 全局 KV 890 字节，约为前代 1/4 | 选择错误是静默的；缺少百万级检索评测 |
| **FP4 主 KV** | 量化感知训练，E2M1 加每 16 通道一个 E4M3 缩放 | 缓存存储再减近一半 | 滑动窗口 KV 太敏感，只能留在 FP8 |
| **SWA 有界重放** | 滑动窗口缓存不落盘，缺了只重算最后 128 个 token | 持久化缓存约为前代 1/8 | 状态是近似的，且与缓存命中位置有关 |
| **MoE** | 1 + 384 选 6，按模态分开的负载均衡 | 552B 主干里约 99% 是专家 | 知识类仍明显弱于 V4-Pro |
| **Single-Pass mHC** | 4 条残差流、双随机约束，混合系数错后一层 | 残差更新一次读写，激活读写量减半 | 官方称性能损失可忽略 |
| **Engram** | 第 1、14 层按 n-gram 哈希查表，196B，FP8 | 表可放主机内存甚至 SSD | 对 V4.1 的贡献没有消融 |
| **DSpark** | 3 个块一次草拟 5 个 token，按置信度决定验证长度 | 取代 MTP，预训练后单独训练 | 加速比依赖负载 |
| **原生多模态** | 从零训练的 DeepSeek-ViT，预训练第一天就混入图像 | 单图最多 1024 个 token 的图文输入 | 与大型闭源系统仍有整体差距 |
| **推理强度** | 1–100 的标量条件，RL 里按强度分组、长度惩罚随强度衰减 | 一份权重覆盖整条成本—质量曲线 | API 只开放三档；开源映射改过一次 |

再加一条不在架构里、但同样关键的：**MIT 许可**。

## 压缩路线转了向

本专栏初版在这里写过一句预言：“压缩路线的下一步显然是‘压得更狠’，压到极限就是固定大小的状态，那就是线性注意力。”**V4.1 没有照这个方向走。**

| | **V4-Flash** | **V4.1-Flash** |
| --- | --- | --- |
| 序列维 | 狠：CSA 压 4 倍，HCA 压 128 倍 | 松：编码器压 2 倍，解码器不压 |
| 层维 | 41 层各存一份 | 4 层产生，其余复用 |
| 字节 | 主 KV 用 FP8 | 主 KV 用 FP4 |
| 计算 | 每个输入 token 走全部层 | 大部分输入 token 只走一半层 |
| 结果 | 3,514 字节 / token | 890 字节 / token |

序列维反而放松了，省下来的主要是“存几份”和“每份多大”，再加上“输入少算一半”。V4.1 报告给的理由是换一个视角：把 V4 看成“滑动窗口负责局部、压缩的全局上下文做补充”，于是去简化全局分支，而不是继续加码压缩 [1]。

这让和 [K3 专栏](https://daiw.net/manual/kimi-k3)的对照也变了味道。K3 仍在“线性化”：用固定大小的状态让大部分层的缓存不随长度增长。DeepSeek 的回答是：**缓存可以继续随长度增长，只要每 token 的常数足够小、存的层足够少**——890 字节 / token 意味着百万 token 的全局缓存不到 1 GB。两条路还在各自往前走，谁也没有并入谁。

## 这个模型最值得记住的三件事

**一、账变了：Agent 时代贵的是输入和存储。** V4 解决“百万上下文算不算得起”，V4.1 解决“反复送进来的长输入算不算得起、存不存得下”。CED、CSA2、有界重放都在同一笔账上：预填充、HBM、SSD。API 里缓存命中价只有未命中的 1/50，这笔账直接写在了价格表上。

**二、后训练的分量，两次得到印证。** 0731 没动主干，DeepSWE 从 7.3 到 54.4；V4.1 的报告干脆说后训练“没有算法创新”，收益几乎全部来自合成任务与环境。**架构决定上限，数据和环境决定你实际拿到多少。**

**三、MIT 还在，但部署门槛变了。** 官方权重约 510 GB，全部进显存要一台多卡服务器；前代那种“一台好工作站就能试”的说法不再成立。变数在 Engram：近 200 GB 的查表记忆可以放在主机内存或 SSD 上，社区已经在这条路上试。

## 几处清醒的提醒

- **所有基准都是官方口径**，模型卡与报告还有一处数字对不上（NL2Repo-Bench 的 64.0 与 65.4）。写作时没有第三方复现。
- **长上下文精确检索没有数字**。一个主打百万上下文、又大量复用稀疏选择的模型，报告只给了基座的 LongBench-V2。
- **知识仍是弱项**：基座 SimpleQA-Verified 42.3，高于前代但远低于 V4-Pro。**配上检索，扬长避短**这条建议没变。
- **有界重放是近似**：同一段对话，缓存命中在哪里，内部状态就可能略有不同。

## 这个专栏更正了什么

改写时按 V4 论文与 `config.json` 核对了初版，更正了四处来自二手资料的说法，各页都已注明：

1. 27% FLOPs 与 10% KV 缓存是 V4-Pro 的数字，V4-Flash 是 10% 与 7%（[成本账](https://daiw.net/manual/deepseek-v4-flash/million-token-cost)）；
2. CSA 与 HCA 是逐层交替、约 1:1，不是“3:1 与 4:1、HCA 集中在后 2/3”（[怎么排](https://daiw.net/manual/deepseek-v4-flash/hybrid-ratio)）；
3. mHC 约束的是双随机矩阵，不是“学习到的低维流形”（[mHC](https://daiw.net/manual/deepseek-v4-flash/mhc)）；
4. 0731 是挂了投机解码模块的正式版，“结构完全不变”不准确；“自适应路由温度”在两份报告里都找不到，已删去（[0731](https://daiw.net/manual/deepseek-v4-flash/post-training-0731)、[MoE](https://daiw.net/manual/deepseek-v4-flash/moe)）。

## 接着读什么

- **对照阅读**：[《Kimi K3 深度解析》](https://daiw.net/manual/kimi-k3) —— 线性化路线的完整拆解。
- **同期第三条路**：[《Qwen3.8-Max 深度解析》](https://daiw.net/manual/qwen3-8-max) —— 赌注押在长时程自主任务上的旗舰。
- **打底**：[《AI 大模型解构》](https://daiw.net/manual/llm-anatomy) —— 上一代架构的系统梳理。
- **模型自己造训练题**：[《RSI 技术探究》](https://daiw.net/manual/rsi) —— V4.1 后训练里“让模型构造任务”的那一类做法，放在更大的背景里看。

## 参考文献

- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969)
- [2] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4.1-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)
- [3] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. [arXiv:2606.19348](https://arxiv.org/abs/2606.19348)
- [4] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. [api-docs.deepseek.com/zh-cn/news/news260910](https://api-docs.deepseek.com/zh-cn/news/news260910)
- [5] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)
