45T token、Muon 与 Sinkhorn

V4.1 从零预训练在 45T 多模态 token 上,稀疏注意力从第一步就开着;优化器沿用 Muon 并改成按注意力头分开,巨大的嵌入与 Engram 表则换成动量加 Sinkhorn 均衡的更新。

作者 David更新于 12 篇(共 21 篇)

V4.1-Flash 是从零训练的,不是在 V4 的权重上接着训 [1]。这一章拆三件事:数据有多少、怎么选;训练日程怎么排;三套优化器各管什么。

45 万亿 token 是什么量级

模型预训练 token
DeepSeek-V314.8T
DeepSeek-V4(Flash / Pro)32T 以上
DeepSeek-V4.1-Flash45T,多模态

V3 的数字见其技术报告摘要,V4 与 V4.1 见各自报告 [1][2][3]。V4.1 的 45T 里,纯文本与多模态数据的 token 比例是 7:1 [1]。

数据:对“模型生成的内容”更挑剔

V4 时代本专栏讨论过“高质量文本见底”之后的几条出路:多轮次、合成数据、多模态、提高数据效率。V4.1 报告的数据一节可以对照着读 [1]:

  • 过滤掉信息增益有限的模型生成内容,包括能力较弱的模型的输出和低质量机器翻译。报告把这类内容视为“隐性重复”:它们大多只是换个说法复述已有信息,在很长的训练过程里可能反而有害。
  • 合成数据只是在探索:报告说在尝试“模型参与循环”的数据迭代方法,作为未来大规模合成数据的基础。多模态那一侧更是明确“没有做大规模数据合成”,而是清洗、利用原生网页数据(见多模态那一章)。
  • 更系统的配方研究:用一条随参数量和数据量递增的“规模阶梯”来指导大规模训练,请更多领域专家定义细粒度的数据质量维度,并补充了新近开源仓库、提交记录和新框架的代码。
  • 工程细节:超长文档在混合前按确定性规则切开,改进的最佳适配打包把填充率压到万分之一以下。

也就是说,多模态是 V4.1 实际走了的那条路;合成数据被当成风险来管理,而不是当成主要来源。

训练日程

项目V4-FlashV4.1-Flash
数据量32T45T
批量从小逐步增大到 75.5M token全程固定 100.6M token
学习率预热 2000 步,大部分时间 2.7×10⁻⁴,末段余弦降到 2.7×10⁻⁵预热 2000 步,2.6×10⁻⁴ 保持到 28T;28T–40T 余弦降到 2.6×10⁻⁵,此后保持到 45T
序列长度4K → 16K → 64K → 1M从 64K 起训,34T 时扩到 1M
稀疏注意力前 1T token 用稠密注意力热身,64K 时引入稀疏从头就是稀疏,不做稠密热身

两份报告的出处分别是 V4 第 4.2.2 节与 V4.1 第 4.2.2 节 [1][2]。V4.1 报告还特意写了一句:45T token 的训练过程“没有出现不稳定”[1]。

视觉编码器另有自己的两段训练,接入主干后先冻结、到学习率衰减阶段再解冻,细节见多模态那一章 [1]。

三套优化器,各管一摊

V4 已经把主力优化器从 AdamW 换成了 Muon [2]。V4.1 在此基础上又分出了第三套 [1]:

参数优化器
主干里线性变换的权重矩阵、Engram 的投影层、视觉-语言投影器Muon;其中 Query 与 Key 的权重用 head-wise Muon
归一化层权重、偏置、缩放因子等非矩阵参数AdamW
Engram 嵌入表、token 嵌入、输出预测头动量更新 + Sinkhorn 均衡

Muon 是什么

AdamW 逐个参数维护一阶、二阶动量,按元素归一化梯度。Muon 换了个角度:把权重矩阵当矩阵看,对动量矩阵做一次近似正交化(Newton–Schulz 迭代),让更新在各个方向上更均衡,而不是被少数几个主导方向吃掉 [4]。Kimi 的 Moonlight 工作较早把它推到大模型规模 [5]。

head-wise Muon

把 Muon 看成一种带预条件的梯度下降,普通 Muon 对一整块 Query 权重只用一个预条件器,而不同注意力头之间差异很大。head-wise Muon 先把 Query(以及 Key)权重按头切开,每个头各自做 Muon 更新。报告说这比普通 Muon 效果好,并称 GLM-5 与 Kimi K3 也验证过它的优势 [1]。

Sinkhorn 均衡更新

Engram 表、token 嵌入和预测头都是“一行对应一个 token 或 n-gram、一列对应一个隐藏特征”的巨大矩阵。给它们用 Adam,优化器状态会大到难以承受 [1]。V4.1 的替代方案沿用 Muon 的流程,只是把 Newton–Schulz 正交化换成 Sinkhorn 均衡:交替做行归一化和列归一化,让更新矩阵的行 RMS 与列 RMS 大致相等;数值接近零的行被屏蔽。和 Muon 一样,它只需要一个动量缓冲区,报告说实测效果还优于 Adam [1]。Engram 的学习率另外放大 5 倍 [1]。

一个有意思的对称:mHC 用 Sinkhorn-Knopp 把残差混合矩阵投影成双随机矩阵,这里又用 Sinkhorn 均衡给嵌入表的更新做行列归一化。同一个古老的矩阵缩放算法,在这一代模型里出现在结构和优化器两个地方(见 mHC 那一章)。

训出来的基座怎么样

报告的结论(官方口径)是:V4.1-Flash-Base 在世界知识、推理与编程上与 V4-Pro-Base 相当,总参数约为后者的 1/3、激活参数约为 1/4;在内部留出的评测上还好 5%–10% [1]。那个“留出评测”是用日常研发中的内部文档、私有代码仓库与学术材料测每字节比特数(BPB),三个基座里 V4.1 最低 [1]。基座的逐项分数见基准那一章

和 V4 一样,报告没有披露训练用的算力规模、集群配置与训练时长。这是各家公开材料里最一致的空白。任何声称知道这些数字的说法,请先问出处。

下一章讲精度:FP4 这次从权重走进了缓存。👉 FP4 从权重走进 KV 缓存

参考文献

  • [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 第 1 节(基座与 V4-Pro-Base 的对比)、第 2.5 节(head-wise Muon、Sinkhorn 均衡更新、优化器分工)、第 4.1 节(数据构建)、第 4.2.2 节(训练日程)、第 4.3 节(BPB 评测)。
  • [2] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. arXiv:2606.19348 —— 32T 以上的数据量、V4-Flash 的训练日程、Muon 与 AdamW 的分工。
  • [3] DeepSeek-AI. “DeepSeek-V3 Technical Report.” 2024-12. arXiv:2412.19437 —— 14.8T token 的对照。
  • [4] Keller Jordan. “Muon: An optimizer for hidden layers in neural networks.” 2024. kellerjordan.github.io/posts/muon —— Muon 的原始介绍。
  • [5] Liu et al. “Muon is Scalable for LLM Training.” 2025-02. arXiv:2502.16982 —— Moonlight:Muon 在大模型规模上的验证。

本页目录