# 让它训得稳

> 极端稀疏下 MoE 最怕两件事——路由塌缩与数值发散。负载均衡为什么必须做、无辅助损失方案好在哪，以及 K3 名字里的「Stable」到底在承诺什么。

- 作者：David（道雾轩）
- 专栏：Kimi K3 深度解析（https://daiw.net/manual/kimi-k3.md）
- 最后更新：2026-08-06
- 原文：https://daiw.net/manual/kimi-k3/moe-stability
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 让它训得稳

896 选 16 是个漂亮的数字，但 MoE 的历史上，**漂亮的稀疏度死在训练里的例子比成功的多**。这一章讲两个必须迈过的坎。

## 坎一：路由塌缩

MoE 的路由器是学出来的。训练早期，某个专家碰巧对某类 token 表现稍好，就会拿到更多 token；拿到更多 token 就学得更好；学得更好又拿到更多——**正反馈**。

结果是**路由塌缩（routing collapse）**：少数专家承担绝大部分流量，剩下几百个几乎收不到梯度，等于白设。896 个专家里如果只有 100 个真在工作，那 2.8T 参数就是 2.8T 的虚标。

标准解法是**辅助损失（auxiliary loss）**：在主损失之外加一项，惩罚「分配不均」，逼路由器把 token 摊平。有效，但有副作用——**它和主目标是冲突的**。主目标要「把 token 送给最合适的专家」，辅助损失要「送得均匀点」，两者在拉扯，损失权重成了一个难调的超参。

DeepSeek-V3 提出的**无辅助损失均衡**是这条线上的重要改进：不加损失项，而是给每个专家一个**可动态调整的偏置**——过载了就调低它的打分，冷清了就调高。均衡通过偏置实现，梯度不受污染。

K3 的架构名叫 **Stable** LatentMoE，「稳定」正是对这一坎的正面回应。**在 896 个专家的规模上，均衡机制的质量直接决定这个模型成不成立。**

<Callout type="info">
  **为什么专家越多越难均衡**：路由是个 top-k 选择，本质上是离散的、不可导的。专家从 256 涨到 896，路由器要在更陡峭的分布上做选择，早期的随机偏好被放大得更快。同时，每个专家分到的 token 变少（激活率 1.8%），统计噪声更大，「谁真的更合适」的信号更弱。**塌缩的风险随专家数超线性上升。**
</Callout>

## 坎二：数值稳定性

第二个坎和精度有关。K3 从 SFT 阶段起就在做 **MXFP4 权重 + MXFP8 激活**的量化感知训练——4 bit 权重的动态范围极窄，任何一处数值放大都可能直接溢出。

MoE 在这件事上尤其危险：**路由的 softmax 会产生极端值**。当某个专家的打分远高于其余，softmax 输出接近 one-hot，梯度在低精度下容易失去有效位。再叠加 93 层的深度，问题会逐层累积。

这类问题的通用对策，在[《AI 大模型解构》的稳定性一章](https://daiw.net/manual/llm-anatomy/moe-stability)里有系统梳理——归一化的位置、QK-Norm、头几层保持稠密等等。K3 具体用了哪几样，官方摘要没有逐条列出。

## 一个务实的提醒

关于 K3 的稳定性设计，目前能确证的只有两件事：

1. 架构名里有 **Stable**，且技术报告把它列为一项主要贡献；
2. 它确实在 2.8T 规模、1.8% 激活率下训成了，并放出了权重。

第二条其实是最硬的证据。**在这个规模上，「它跑通了」本身就是对稳定性方案的最强背书**——没跑通的架构不会有技术报告。

<Callout type="warn">
  但也要老实说：**「它训成了」不等于「它训得高效」**。同样跑通，代价可能差好几倍算力。这一层信息属于厂商最不愿意公开的部分，外界基本无从核实。任何声称知道 K3 训练成本的说法，都请先问出处。
</Callout>

## 小结

- 极端稀疏的两个坎：路由塌缩、低精度下的数值发散。
- 均衡的主流方案已从「辅助损失」转向「动态偏置」这类不污染梯度的做法。
- K3 的 `Stable` 是对第一个坎的正面回应；它在 896 专家规模上跑通并开放权重，本身就是最有分量的证据。
- 具体机制细节公开有限，本专栏不做填空。

架构讲完了。下一部分转向训练——特别是那句「规模效率提升 2.5 倍」到底在说什么。👉 [规模效率提升 2.5 倍](https://daiw.net/manual/kimi-k3/pretrain-scaling)

## 参考文献

- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
- [2] DeepSeek-AI. “DeepSeek-V3 Technical Report.” 2024. arXiv:2412.19437. —— 无辅助损失负载均衡。
- [3] Fedus et al. “Switch Transformers.” JMLR 2022. arXiv:2101.03961. —— 路由塌缩与辅助损失的经典论述。
