# DeepSeek V4.1 Flash 深度解析

> 拆开 2026 年 9 月 10 日发布的 DeepSeek V4.1 Flash：552B 主干、输入激活 8B / 输出激活 16B 的因果编码器-解码器，跨层共享的 CSA2 加 FP4 把每 token 全局 KV 缓存压到 890 字节，原生图文输入、1–100 的推理强度与 MIT 开源；被替换掉的前代 V4 Flash 设计留作对照。

- 作者：David（道雾轩）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 序 · 更大的 Flash，更小的缓存

2026 年 9 月 10 日，DeepSeek 发布 **V4.1-Flash**，同一天把权重和技术报告放上 Hugging Face，许可仍是 MIT [1][2]。官方的定位是“全新模型结构系列中最小尺寸的模型”[3]，可它一点也不小：**主干 552B 参数，另挂 196B 参数的 Engram 查表记忆** [1]。只看主干，也接近前代 V4-Flash（284B）的两倍。

反直觉的是：模型变大了，**每个 token 占用的全局 KV 缓存却从 3,514 字节降到 890 字节**，约为前代的 1/4；落到 SSD 或主机内存里的持久化缓存约为前代的 1/8 [1][2]。处理输入时每 token 只激活 8B 参数，生成输出时激活 16B——官方公告的说法是“输入和输出不对称”[3]。

这一版值得单独写一个专栏，是因为它回答的问题变了。V4 解决的是“1M 上下文算不算得起”；V4.1 的技术报告开篇就说，长时程 Agent 让负载越来越“输入重”，瓶颈已经转到**预填充的计算、HBM 与 SSD 的容量、以及搬运缓存的带宽** [1]。整套新结构都是冲着这笔账去的。

<Callout type="info">
  **资料说明**：本专栏以技术报告（[arXiv:2609.19969](https://arxiv.org/abs/2609.19969)，与 Hugging Face 仓库里 9 月 10 日上传的 PDF 内容一致）、Hugging Face 模型卡与 `config.json`、DeepSeek 官方 API 文档与公告为主要依据，改写于 **2026 年 9 月 19 日**。基准分数全部是 DeepSeek 自己的测量，正文标“官方口径”，目前还没有收录第三方复现。

  本专栏初版（2026 年 8 月）写的是 V4-Flash。被 V4.1 替换掉的设计（CSA 与 HCA 混合注意力、0731 那次更新）移到了第 6 部分；改写时按 V4 论文与 `config.json` 核对，更正了初版里几处来自二手拆解的数字，更正处都在正文注明。
</Callout>

## 一句话概括这个模型

**让大部分输入 token 只走一半的层，让大部分层不存自己的缓存，再把剩下的缓存存成 4 bit。**

对应到三个设计：

- **CED（因果编码器-解码器）**：40 层分成前 20 层编码器、后 20 层解码器，解码器的全局 KV 直接从编码器最后一层的输出投影出来，预填充基本只跑编码器，于是“输入 8B、输出 16B”。
- **CSA2**：40 层里只有 4 层自己产生全局 KV，其余层复用；压缩后的主 KV 以 FP4 存储。
- **SWA 有界重放**：滑动窗口的缓存不再写进 SSD，缺了就只重算最后 128 个 token。

## 和前代比，变了什么

| | **V4-Flash（2026-04）** | **V4.1-Flash（2026-09）** |
| --- | --- | --- |
| 结构 | 43 层 decoder-only | 20 层因果编码器 + 20 层解码器 |
| 参数 | 284B，每 token 激活 13B | 552B 主干 + 196B Engram，预填充 8B / 解码 16B |
| 全局注意力 | CSA 与 HCA 逐层交替 | 纯 CSA2，跨层共享 KV 与索引 |
| 每 token 全局 KV | 3,514 字节 | **890 字节** |
| 模态 | 文本 | **原生图像 + 文本输入** |
| 推理控制 | Non-think / Think High / Think Max 三种模式 | **1–100 的连续推理强度**（API 分三档） |
| 预训练 | 32T token | 45T 多模态 token |
| 许可 | MIT | MIT |

数字出处见[规格总表](https://daiw.net/manual/deepseek-v4-flash/spec-sheet)。官方同时宣布：V4-Flash 与实验性的 V4-Flash-Vision-Exp 下线，V4-Pro 也在“有序下线”，理由是多方测试里 V4.1-Flash 在性能、费用、速度与总用时上都超过了 V4-Pro（官方口径）[3]。

## 它和 Kimi K3 仍是两条路

同样是 1M 上下文，两家的解法方向依旧相反：

| | **Kimi K3** | **DeepSeek V4.1-Flash** |
| --- | --- | --- |
| 核心思路 | **线性化**——69/93 层换成固定状态的线性注意力 | **压缩 + 共享**——保留 softmax，缓存按序列压缩、在层间共享、存成 FP4 |
| 缓存增长 | 大部分层与长度无关 | 仍随长度线性增长，但每 token 只有 890 字节 |
| 规模 | 2.8T / 104B 激活 | 552B 主干（另有 196B Engram）/ 8B–16B 激活 |
| 许可 | 自订许可，有营收门槛 | **MIT** |
| 权重体积 | 约 1.42 TiB | 约 510 GB（其中约 197 GB 是 FP8 的 Engram 表） |

[《AI 大模型解构》里讲过](https://daiw.net/manual/llm-anatomy/attention-mha-gqa-mla)，省 KV 缓存有两条路：让缓存不随长度增长，或者让它增长得慢。**K3 选了第一条；V4 在第二条上把序列压得很狠（4 倍与 128 倍），V4.1 反而放松了序列维，转到“层”和“字节”两个维度上继续省。** 本专栏会反复和 [K3 专栏](https://daiw.net/manual/kimi-k3)对照。

## 这个专栏怎么走

**第 0 部分 · 先看全貌**
- **V4.1-Flash 是什么** —— V4 家族的时间线、变了什么与沿用了什么、API 上的新名字。
- **规格总表** —— 参数、层配置、缓存、精度、训练与价格，和 V4-Flash 并排摊开。

**第 1 部分 · 新架构：CED 与 CSA2**
- **百万 token 的成本账** —— 预填充、HBM、SSD 三笔账，以及缓存大小的四个因子。
- **CED：输入 8B、输出 16B** —— 因果编码器-解码器怎么把预填充砍掉一半。
- **CSA2：跨层共享的压缩稀疏注意力** —— Full / Reindex / Reuse 三种模式，890 字节是怎么来的。
- **SWA 有界重放** —— 持久化缓存为什么只剩八分之一，代价是什么。

**第 2 部分 · 主干与扩展**
- **1 + 384 选 6** —— 沿用的 DeepSeekMoE，以及按模态分开的负载均衡。
- **mHC 与 Single-Pass mHC** —— 双随机矩阵约束的多路残差流，和一次读写的新实现。
- **Engram 与 DSpark** —— 196B 的查表记忆，与取代 MTP 的投机解码草稿头。

**第 3 部分 · 多模态与推理强度**
- **原生多模态** —— 从零训练的 DeepSeek-ViT、图像数据与 API 用法。
- **推理强度：从三档模式到 1–100** —— 连续旋钮怎么训出来，API 三档与开源编码器的映射。

**第 4 部分 · 训练与精度**
- **45T token、Muon 与 Sinkhorn** —— 预训练规模、学习率日程与三套优化器。
- **FP4 从权重走进 KV 缓存** —— 专家 FP4 沿用，主 KV 也改成 FP4。
- **后训练：算法不变，数据与环境放大** —— 任务合成、DSec 沙箱与多智能体实验。

**第 5 部分 · 落地**
- **基准怎么读** —— 官方表格、脚手架差异、模型卡与报告对不上的地方。
- **自己跑起来** —— 510 GB 权重、Engram 放在哪、推理引擎与采样参数。

**第 6 部分 · 前代：V4 Flash**
- **CSA**、**HCA**、**CSA 与 HCA 怎么排**、**0731 正式版** —— V4.1 已经不再使用的设计，保留原文要点并按一手资料更正。

**收尾**
- **回顾：压缩路线走到哪了**

## 读之前，你最好有

- **读过 [《AI 大模型解构》](https://daiw.net/manual/llm-anatomy)** 的注意力与 MoE 几章。
- 读过 [《Kimi K3 深度解析》](https://daiw.net/manual/kimi-k3) 会更好，但不是必需——两个专栏可以任意顺序读。

从头开始：[V4.1-Flash 是什么](https://daiw.net/manual/deepseek-v4-flash/what-is-v4-flash)。

## 参考文献

- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969) —— 552B 主干与 196B Engram、8B / 16B 激活、890 字节与 1/4、1/8 的缓存对比、“输入重”的问题陈述。
- [2] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4.1-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) —— MIT 许可、各代每 token 全局 KV 字节数的对比图。
- [3] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. [api-docs.deepseek.com/zh-cn/news/news260910](https://api-docs.deepseek.com/zh-cn/news/news260910) —— “最小尺寸的模型”“输入和输出不对称”的原话，V4-Flash 与 V4-Pro 下线安排。

## 本专栏篇目

- [DeepSeek V4.1 Flash 深度解析](https://daiw.net/manual/deepseek-v4-flash.md): 拆开 2026 年 9 月 10 日发布的 DeepSeek V4.1 Flash：552B 主干、输入激活 8B / 输出激活 16B 的因果编码器-解码器，跨层共享的 CSA2 加 FP4 把每 token 全局 KV 缓存压到 890 字节，原生图文输入、1–100 的推理强度与 MIT 开源；被替换掉的前代 V4 Flash 设计留作对照。

### 第 0 部分 · 先看全貌

- [V4.1-Flash 是什么](https://daiw.net/manual/deepseek-v4-flash/what-is-v4-flash.md): V4 家族从 4 月到 9 月的时间线，V4.1-Flash 相对 V4-Flash 换掉了什么、沿用了什么，API 上的新模型名与旧名路由，以及 MIT 许可在这一代里有多难得。
- [规格总表](https://daiw.net/manual/deepseek-v4-flash/spec-sheet.md): 把 V4.1-Flash 与前代 V4-Flash 的规格并排摊开：参数口径、层配置、注意力与缓存、MoE、训练、推理控制、精度、API 价格与部署门槛，每一行都标出处。

### 第 1 部分 · 新架构：CED 与 CSA2

- [百万 token 的成本账](https://daiw.net/manual/deepseek-v4-flash/million-token-cost.md): 长上下文的账从“算力与显存”两笔变成了三笔：预填充的计算、常驻 HBM 的全局 KV、落到 SSD 的持久化 KV。先把账算清，再看 V4.1 在哪几个因子上动了刀。
- [CED：输入 8B、输出 16B](https://daiw.net/manual/deepseek-v4-flash/ced.md): 因果编码器-解码器把 40 层拆成前后两半，解码器的全局 KV 直接从编码器最后一层投影出来，输入 token 大多只走前 20 层，预填充的计算差不多减半。
- [CSA2：跨层共享的压缩稀疏注意力](https://daiw.net/manual/deepseek-v4-flash/csa2.md): CSA2 给每层指定 Full、Reindex、Reuse 三种模式之一，40 层里只有 4 层自己产生全局 KV；解码器再用分层候选池限制索引范围，配合 FP4 把每 token 全局缓存压到 890 字节。
- [SWA 有界重放：SSD 上只剩八分之一](https://daiw.net/manual/deepseek-v4-flash/swa-bounded-replay.md): 滑动窗口缓存不再写进 SSD，缺了就只重算最后 128 个 token。这个部署层面的取舍让持久化缓存缩到前代的约 1/8，代价是恢复出来的状态只是近似。

### 第 2 部分 · 主干与扩展

- [1 + 384 选 6](https://daiw.net/manual/deepseek-v4-flash/moe.md): V4.1-Flash 沿用 DeepSeekMoE：每层 1 个共享专家加 384 个路由专家，每 token 点 6 个。专家数追平了 V4-Pro，负载均衡改成图像与文本各算各的，开头几层的哈希路由不见了。
- [mHC 与 Single-Pass mHC](https://daiw.net/manual/deepseek-v4-flash/mhc.md): mHC 把一条残差主干扩成 4 条并行的残差流，并把流间的混合矩阵约束成双随机矩阵；V4.1 沿用它，只把混合系数错后一层，让整个残差更新能在一次读写里做完。
- [Engram 与 DSpark：查表记忆和草稿头](https://daiw.net/manual/deepseek-v4-flash/engram-dspark.md): V4.1 新加的两个组件：196B 参数的 Engram 按 n-gram 哈希查表，把“记住”从“计算”里拆出来；DSpark 取代 MTP 做投机解码，一次草拟 5 个 token，并按置信度决定验证多长。

### 第 3 部分 · 多模态与推理强度

- [原生多模态：从零训练的 DeepSeek-ViT](https://daiw.net/manual/deepseek-v4-flash/multimodal.md): V4.1 从语言模型预训练的第一天就混入图像数据：自研的 DeepSeek-ViT 把图片变成最多 1024 个 token，和文本一起进主干。这一章讲视觉通路、训练数据、评测，以及 API 里图像怎么传、怎么计费。
- [推理强度：从三档模式到 1–100](https://daiw.net/manual/deepseek-v4-flash/reasoning-effort.md): V4 的三种思考模式是分别训练的专家模型；V4.1 把“想多少”做成一个 1 到 100 的整数，在强化学习里当条件信号训练。API 仍分 low、high、max 三档，开源编码器的映射在发布当天还改过一次。

### 第 4 部分 · 训练与精度

- [45T token、Muon 与 Sinkhorn](https://daiw.net/manual/deepseek-v4-flash/pretrain.md): V4.1 从零预训练在 45T 多模态 token 上，稀疏注意力从第一步就开着；优化器沿用 Muon 并改成按注意力头分开，巨大的嵌入与 Engram 表则换成动量加 Sinkhorn 均衡的更新。
- [FP4 从权重走进 KV 缓存](https://daiw.net/manual/deepseek-v4-flash/fp8-fp4.md): 专家权重 FP4、其余 FP8 的方案 V4.1 原样沿用；新的一步是把主 KV 缓存也用量化感知训练压到 4 bit，而且特意选了和索引器不同的格式。滑动窗口缓存则留在 FP8。
- [后训练：算法不变，数据与环境放大](https://daiw.net/manual/deepseek-v4-flash/post-training.md): V4.1 的后训练没有新算法，仍是 SFT → RL → 在线策略蒸馏；报告把几乎全部收益归于自动合成的任务与环境。这一章看任务怎么造、百万级沙箱怎么管、Agent 怎么钻空子，以及多智能体的初步实验。

### 第 5 部分 · 落地

- [基准怎么读](https://daiw.net/manual/deepseek-v4-flash/benchmarks.md): 逐表读 V4.1-Flash 的官方评测：基座对比、与前沿模型的对照、脚手架差异。能力形状是 Agent 大涨、知识仍弱于 V4-Pro；也要看清模型卡与报告对不上的数字、对照列的真实版本，以及还没有第三方复现这件事。
- [自己跑起来](https://daiw.net/manual/deepseek-v4-flash/self-host.md): V4.1-Flash 的官方权重约 510 GB，其中近 200 GB 是可以放在主机内存甚至 SSD 上的 Engram 表。这一章算硬件账，介绍官方参考实现与推理引擎的支持情况、提示词格式与采样参数，以及 MIT 许可放开了什么。

### 第 6 部分 · 前代：V4 Flash

- [前代 · CSA：4 倍压缩 + 闪电索引器](https://daiw.net/manual/deepseek-v4-flash/csa.md): 前代 V4-Flash 的压缩稀疏注意力：先把每 4 个 token 的 KV 压成一条，再用 FP4 的闪电索引器挑出 top-512——省两次，省的是不同的东西。V4.1 已改用 CSA2。
- [前代 · HCA：128 倍压缩后再做稠密注意力](https://daiw.net/manual/deepseek-v4-flash/hca.md): 前代 V4-Flash 的重压缩注意力：把每 128 个 token 压成一条，再在压缩序列上老老实实全看一遍——用“看得粗但看得全”补稀疏注意力可能漏看的风险。V4.1 已整个拿掉 HCA。
- [前代 · CSA 与 HCA 怎么排](https://daiw.net/manual/deepseek-v4-flash/hybrid-ratio.md): 前代 V4 的两种压缩注意力其实是一层隔一层交替排的：V4-Flash 为 21 层 CSA 对 20 层 HCA，V4-Pro 为 30 对 31。本篇按论文与 config 更正初版的“3:1 与 4:1”，并和 K3、V4.1 的排法对照。
- [前代 · 0731：V4-Flash 正式版](https://daiw.net/manual/deepseek-v4-flash/post-training-0731.md): 7 月 31 日的 V4-Flash-0731 主干结构没动，DeepSWE 从 7.3 涨到 54.4。拆开这次更新，看清“模型能力”里有多大一块其实是“工具使用与格式对齐”——这条教训在 V4.1 的报告里被说得更直白。

### 收尾

- [回顾：压缩路线走到哪了](https://daiw.net/manual/deepseek-v4-flash/recap.md): 把 V4.1-Flash 的设计收成一张表：编码器-解码器、CSA2 与 FP4 缓存、有界重放、Engram 与 DSpark、原生多模态与连续推理强度；再看压缩路线从 V4 到 V4.1 怎样转了向，以及还缺哪些独立验证。
