# 45T token、Muon 与 Sinkhorn

> V4.1 从零预训练在 45T 多模态 token 上，稀疏注意力从第一步就开着；优化器沿用 Muon 并改成按注意力头分开，巨大的嵌入与 Engram 表则换成动量加 Sinkhorn 均衡的更新。

- 作者：David（道雾轩）
- 专栏：DeepSeek V4.1 Flash 深度解析（https://daiw.net/manual/deepseek-v4-flash.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash/pretrain
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

V4.1-Flash 是**从零训练**的，不是在 V4 的权重上接着训 [1]。这一章拆三件事：数据有多少、怎么选；训练日程怎么排；三套优化器各管什么。

## 45 万亿 token 是什么量级

| 模型 | 预训练 token |
| --- | --- |
| DeepSeek-V3 | 14.8T |
| DeepSeek-V4（Flash / Pro） | 32T 以上 |
| **DeepSeek-V4.1-Flash** | **45T**，多模态 |

V3 的数字见其技术报告摘要，V4 与 V4.1 见各自报告 [1][2][3]。V4.1 的 45T 里，纯文本与多模态数据的 token 比例是 7:1 [1]。

## 数据：对“模型生成的内容”更挑剔

V4 时代本专栏讨论过“高质量文本见底”之后的几条出路：多轮次、合成数据、多模态、提高数据效率。V4.1 报告的数据一节可以对照着读 [1]：

- **过滤掉信息增益有限的模型生成内容**，包括能力较弱的模型的输出和低质量机器翻译。报告把这类内容视为“隐性重复”：它们大多只是换个说法复述已有信息，在很长的训练过程里可能反而有害。
- **合成数据只是在探索**：报告说在尝试“模型参与循环”的数据迭代方法，作为未来大规模合成数据的基础。多模态那一侧更是明确“没有做大规模数据合成”，而是清洗、利用原生网页数据（见[多模态那一章](https://daiw.net/manual/deepseek-v4-flash/multimodal)）。
- **更系统的配方研究**：用一条随参数量和数据量递增的“规模阶梯”来指导大规模训练，请更多领域专家定义细粒度的数据质量维度，并补充了新近开源仓库、提交记录和新框架的代码。
- 工程细节：超长文档在混合前按确定性规则切开，改进的最佳适配打包把填充率压到万分之一以下。

也就是说，多模态是 V4.1 实际走了的那条路；合成数据被当成风险来管理，而不是当成主要来源。

## 训练日程

| 项目 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| 数据量 | 32T | 45T |
| 批量 | 从小逐步增大到 75.5M token | **全程固定 100.6M token** |
| 学习率 | 预热 2000 步，大部分时间 2.7×10⁻⁴，末段余弦降到 2.7×10⁻⁵ | 预热 2000 步，2.6×10⁻⁴ 保持到 28T；28T–40T 余弦降到 2.6×10⁻⁵，此后保持到 45T |
| 序列长度 | 4K → 16K → 64K → 1M | 从 64K 起训，34T 时扩到 1M |
| 稀疏注意力 | 前 1T token 用稠密注意力热身，64K 时引入稀疏 | **从头就是稀疏**，不做稠密热身 |

两份报告的出处分别是 V4 第 4.2.2 节与 V4.1 第 4.2.2 节 [1][2]。V4.1 报告还特意写了一句：45T token 的训练过程“没有出现不稳定”[1]。

视觉编码器另有自己的两段训练，接入主干后先冻结、到学习率衰减阶段再解冻，细节见多模态那一章 [1]。

## 三套优化器，各管一摊

V4 已经把主力优化器从 AdamW 换成了 **Muon** [2]。V4.1 在此基础上又分出了第三套 [1]：

| 参数 | 优化器 |
| --- | --- |
| 主干里线性变换的权重矩阵、Engram 的投影层、视觉-语言投影器 | **Muon**；其中 Query 与 Key 的权重用 **head-wise Muon** |
| 归一化层权重、偏置、缩放因子等非矩阵参数 | **AdamW** |
| Engram 嵌入表、token 嵌入、输出预测头 | **动量更新 + Sinkhorn 均衡** |

### Muon 是什么

AdamW 逐个参数维护一阶、二阶动量，按元素归一化梯度。Muon 换了个角度：**把权重矩阵当矩阵看**，对动量矩阵做一次近似正交化（Newton–Schulz 迭代），让更新在各个方向上更均衡，而不是被少数几个主导方向吃掉 [4]。Kimi 的 Moonlight 工作较早把它推到大模型规模 [5]。

### head-wise Muon

把 Muon 看成一种带预条件的梯度下降，普通 Muon 对一整块 Query 权重只用一个预条件器，而不同注意力头之间差异很大。head-wise Muon 先把 Query（以及 Key）权重**按头切开**，每个头各自做 Muon 更新。报告说这比普通 Muon 效果好，并称 GLM-5 与 Kimi K3 也验证过它的优势 [1]。

### Sinkhorn 均衡更新

Engram 表、token 嵌入和预测头都是“一行对应一个 token 或 n-gram、一列对应一个隐藏特征”的巨大矩阵。给它们用 Adam，优化器状态会大到难以承受 [1]。V4.1 的替代方案沿用 Muon 的流程，只是把 Newton–Schulz 正交化换成 **Sinkhorn 均衡**：交替做行归一化和列归一化，让更新矩阵的行 RMS 与列 RMS 大致相等；数值接近零的行被屏蔽。和 Muon 一样，它只需要一个动量缓冲区，报告说实测效果还优于 Adam [1]。Engram 的学习率另外放大 5 倍 [1]。

<Callout type="info">
  一个有意思的对称：**mHC 用 Sinkhorn-Knopp 把残差混合矩阵投影成双随机矩阵，这里又用 Sinkhorn 均衡给嵌入表的更新做行列归一化**。同一个古老的矩阵缩放算法，在这一代模型里出现在结构和优化器两个地方（见 [mHC 那一章](https://daiw.net/manual/deepseek-v4-flash/mhc)）。
</Callout>

## 训出来的基座怎么样

报告的结论（官方口径）是：V4.1-Flash-Base 在世界知识、推理与编程上与 V4-Pro-Base 相当，**总参数约为后者的 1/3、激活参数约为 1/4**；在内部留出的评测上还好 5%–10% [1]。那个“留出评测”是用日常研发中的内部文档、私有代码仓库与学术材料测每字节比特数（BPB），三个基座里 V4.1 最低 [1]。基座的逐项分数见[基准那一章](https://daiw.net/manual/deepseek-v4-flash/benchmarks)。

<Callout type="warn">
  和 V4 一样，**报告没有披露训练用的算力规模、集群配置与训练时长**。这是各家公开材料里最一致的空白。任何声称知道这些数字的说法，请先问出处。
</Callout>

下一章讲精度：FP4 这次从权重走进了缓存。👉 [FP4 从权重走进 KV 缓存](https://daiw.net/manual/deepseek-v4-flash/fp8-fp4)

## 参考文献

- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969) —— 第 1 节（基座与 V4-Pro-Base 的对比）、第 2.5 节（head-wise Muon、Sinkhorn 均衡更新、优化器分工）、第 4.1 节（数据构建）、第 4.2.2 节（训练日程）、第 4.3 节（BPB 评测）。
- [2] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. [arXiv:2606.19348](https://arxiv.org/abs/2606.19348) —— 32T 以上的数据量、V4-Flash 的训练日程、Muon 与 AdamW 的分工。
- [3] DeepSeek-AI. “DeepSeek-V3 Technical Report.” 2024-12. [arXiv:2412.19437](https://arxiv.org/abs/2412.19437) —— 14.8T token 的对照。
- [4] Keller Jordan. “Muon: An optimizer for hidden layers in neural networks.” 2024. [kellerjordan.github.io/posts/muon](https://kellerjordan.github.io/posts/muon/) —— Muon 的原始介绍。
- [5] Liu et al. “Muon is Scalable for LLM Training.” 2025-02. [arXiv:2502.16982](https://arxiv.org/abs/2502.16982) —— Moonlight：Muon 在大模型规模上的验证。
