回顾:压缩路线走到哪了

把 V4.1-Flash 的设计收成一张表:编码器-解码器、CSA2 与 FP4 缓存、有界重放、Engram 与 DSpark、原生多模态与连续推理强度;再看压缩路线从 V4 到 V4.1 怎样转了向,以及还缺哪些独立验证。

作者 David更新于 21 篇(共 21 篇)

二十章走完,收束一下。

V4.1-Flash 的设计一览

设计具体做法换来什么代价或未知
CED20 层因果编码器 + 20 层解码器,解码器的全局 KV 从编码器输出投影预填充约减半,输入 8B / 输出 16B 激活解码器的长程信息只来自编码器最后一层;没有公开消融
CSA2三种模式跨层复用,只有 4 层产生全局 KV;解码器用候选池限制索引每 token 全局 KV 890 字节,约为前代 1/4选择错误是静默的;缺少百万级检索评测
FP4 主 KV量化感知训练,E2M1 加每 16 通道一个 E4M3 缩放缓存存储再减近一半滑动窗口 KV 太敏感,只能留在 FP8
SWA 有界重放滑动窗口缓存不落盘,缺了只重算最后 128 个 token持久化缓存约为前代 1/8状态是近似的,且与缓存命中位置有关
MoE1 + 384 选 6,按模态分开的负载均衡552B 主干里约 99% 是专家知识类仍明显弱于 V4-Pro
Single-Pass mHC4 条残差流、双随机约束,混合系数错后一层残差更新一次读写,激活读写量减半官方称性能损失可忽略
Engram第 1、14 层按 n-gram 哈希查表,196B,FP8表可放主机内存甚至 SSD对 V4.1 的贡献没有消融
DSpark3 个块一次草拟 5 个 token,按置信度决定验证长度取代 MTP,预训练后单独训练加速比依赖负载
原生多模态从零训练的 DeepSeek-ViT,预训练第一天就混入图像单图最多 1024 个 token 的图文输入与大型闭源系统仍有整体差距
推理强度1–100 的标量条件,RL 里按强度分组、长度惩罚随强度衰减一份权重覆盖整条成本—质量曲线API 只开放三档;开源映射改过一次

再加一条不在架构里、但同样关键的:MIT 许可

压缩路线转了向

本专栏初版在这里写过一句预言:“压缩路线的下一步显然是‘压得更狠’,压到极限就是固定大小的状态,那就是线性注意力。”V4.1 没有照这个方向走。

V4-FlashV4.1-Flash
序列维狠:CSA 压 4 倍,HCA 压 128 倍松:编码器压 2 倍,解码器不压
层维41 层各存一份4 层产生,其余复用
字节主 KV 用 FP8主 KV 用 FP4
计算每个输入 token 走全部层大部分输入 token 只走一半层
结果3,514 字节 / token890 字节 / token

序列维反而放松了,省下来的主要是“存几份”和“每份多大”,再加上“输入少算一半”。V4.1 报告给的理由是换一个视角:把 V4 看成“滑动窗口负责局部、压缩的全局上下文做补充”,于是去简化全局分支,而不是继续加码压缩 [1]。

这让和 K3 专栏的对照也变了味道。K3 仍在“线性化”:用固定大小的状态让大部分层的缓存不随长度增长。DeepSeek 的回答是:缓存可以继续随长度增长,只要每 token 的常数足够小、存的层足够少——890 字节 / token 意味着百万 token 的全局缓存不到 1 GB。两条路还在各自往前走,谁也没有并入谁。

这个模型最值得记住的三件事

一、账变了:Agent 时代贵的是输入和存储。 V4 解决“百万上下文算不算得起”,V4.1 解决“反复送进来的长输入算不算得起、存不存得下”。CED、CSA2、有界重放都在同一笔账上:预填充、HBM、SSD。API 里缓存命中价只有未命中的 1/50,这笔账直接写在了价格表上。

二、后训练的分量,两次得到印证。 0731 没动主干,DeepSWE 从 7.3 到 54.4;V4.1 的报告干脆说后训练“没有算法创新”,收益几乎全部来自合成任务与环境。架构决定上限,数据和环境决定你实际拿到多少。

三、MIT 还在,但部署门槛变了。 官方权重约 510 GB,全部进显存要一台多卡服务器;前代那种“一台好工作站就能试”的说法不再成立。变数在 Engram:近 200 GB 的查表记忆可以放在主机内存或 SSD 上,社区已经在这条路上试。

几处清醒的提醒

  • 所有基准都是官方口径,模型卡与报告还有一处数字对不上(NL2Repo-Bench 的 64.0 与 65.4)。写作时没有第三方复现。
  • 长上下文精确检索没有数字。一个主打百万上下文、又大量复用稀疏选择的模型,报告只给了基座的 LongBench-V2。
  • 知识仍是弱项:基座 SimpleQA-Verified 42.3,高于前代但远低于 V4-Pro。配上检索,扬长避短这条建议没变。
  • 有界重放是近似:同一段对话,缓存命中在哪里,内部状态就可能略有不同。

这个专栏更正了什么

改写时按 V4 论文与 config.json 核对了初版,更正了四处来自二手资料的说法,各页都已注明:

  1. 27% FLOPs 与 10% KV 缓存是 V4-Pro 的数字,V4-Flash 是 10% 与 7%(成本账);
  2. CSA 与 HCA 是逐层交替、约 1:1,不是“3:1 与 4:1、HCA 集中在后 2/3”(怎么排);
  3. mHC 约束的是双随机矩阵,不是“学习到的低维流形”(mHC);
  4. 0731 是挂了投机解码模块的正式版,“结构完全不变”不准确;“自适应路由温度”在两份报告里都找不到,已删去(0731MoE)。

接着读什么

参考文献

本页目录