让它训得稳
极端稀疏下 MoE 最怕两件事——路由塌缩与数值发散。负载均衡为什么必须做、无辅助损失方案好在哪,以及 K3 名字里的「Stable」到底在承诺什么。
让它训得稳
896 选 16 是个漂亮的数字,但 MoE 的历史上,漂亮的稀疏度死在训练里的例子比成功的多。这一章讲两个必须迈过的坎。
坎一:路由塌缩
MoE 的路由器是学出来的。训练早期,某个专家碰巧对某类 token 表现稍好,就会拿到更多 token;拿到更多 token 就学得更好;学得更好又拿到更多——正反馈。
结果是路由塌缩(routing collapse):少数专家承担绝大部分流量,剩下几百个几乎收不到梯度,等于白设。896 个专家里如果只有 100 个真在工作,那 2.8T 参数就是 2.8T 的虚标。
标准解法是辅助损失(auxiliary loss):在主损失之外加一项,惩罚「分配不均」,逼路由器把 token 摊平。有效,但有副作用——它和主目标是冲突的。主目标要「把 token 送给最合适的专家」,辅助损失要「送得均匀点」,两者在拉扯,损失权重成了一个难调的超参。
DeepSeek-V3 提出的无辅助损失均衡是这条线上的重要改进:不加损失项,而是给每个专家一个可动态调整的偏置——过载了就调低它的打分,冷清了就调高。均衡通过偏置实现,梯度不受污染。
K3 的架构名叫 Stable LatentMoE,「稳定」正是对这一坎的正面回应。在 896 个专家的规模上,均衡机制的质量直接决定这个模型成不成立。
为什么专家越多越难均衡:路由是个 top-k 选择,本质上是离散的、不可导的。专家从 256 涨到 896,路由器要在更陡峭的分布上做选择,早期的随机偏好被放大得更快。同时,每个专家分到的 token 变少(激活率 1.8%),统计噪声更大,「谁真的更合适」的信号更弱。塌缩的风险随专家数超线性上升。
坎二:数值稳定性
第二个坎和精度有关。K3 从 SFT 阶段起就在做 MXFP4 权重 + MXFP8 激活的量化感知训练——4 bit 权重的动态范围极窄,任何一处数值放大都可能直接溢出。
MoE 在这件事上尤其危险:路由的 softmax 会产生极端值。当某个专家的打分远高于其余,softmax 输出接近 one-hot,梯度在低精度下容易失去有效位。再叠加 93 层的深度,问题会逐层累积。
这类问题的通用对策,在《AI 大模型解构》的稳定性一章里有系统梳理——归一化的位置、QK-Norm、头几层保持稠密等等。K3 具体用了哪几样,官方摘要没有逐条列出。
一个务实的提醒
关于 K3 的稳定性设计,目前能确证的只有两件事:
- 架构名里有 Stable,且技术报告把它列为一项主要贡献;
- 它确实在 2.8T 规模、1.8% 激活率下训成了,并放出了权重。
第二条其实是最硬的证据。在这个规模上,「它跑通了」本身就是对稳定性方案的最强背书——没跑通的架构不会有技术报告。
但也要老实说:「它训成了」不等于「它训得高效」。同样跑通,代价可能差好几倍算力。这一层信息属于厂商最不愿意公开的部分,外界基本无从核实。任何声称知道 K3 训练成本的说法,都请先问出处。
小结
- 极端稀疏的两个坎:路由塌缩、低精度下的数值发散。
- 均衡的主流方案已从「辅助损失」转向「动态偏置」这类不污染梯度的做法。
- K3 的
Stable是对第一个坎的正面回应;它在 896 专家规模上跑通并开放权重,本身就是最有分量的证据。 - 具体机制细节公开有限,本专栏不做填空。
架构讲完了。下一部分转向训练——特别是那句「规模效率提升 2.5 倍」到底在说什么。👉 规模效率提升 2.5 倍
参考文献
- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
- [2] DeepSeek-AI. “DeepSeek-V3 Technical Report.” 2024. arXiv:2412.19437. —— 无辅助损失负载均衡。
- [3] Fedus et al. “Switch Transformers.” JMLR 2022. arXiv:2101.03961. —— 路由塌缩与辅助损失的经典论述。