回顾:K3 押对了什么
把四处赌注收进一张表——线性注意力大规模上主干、稀疏度推到 1.8%、原生低精度训练、效率取代规模成为主指标,以及这一代之后往哪走。
作者 David更新于 第 13 篇(共 13 篇)
回顾:K3 押对了什么
十三章走完,把 K3 的设计收成一张表,再谈两句趋势。
四处赌注
| 赌注 | 具体做法 | 换来什么 | 代价 |
|---|---|---|---|
| 线性注意力上主干 | 93 层里 69 层用 KDA | 长上下文缓存不随长度增长 | 精确回看能力,靠 24 层 Gated MLA 补 |
| 稀疏度推到极致 | 896 选 16 + 2 共享,激活率 1.8% | 2.8T 参数只算 104B | 路由与通信开销、均衡难度陡增 |
| 原生低精度 | MXFP4 权重 + MXFP8 激活,QAT 自 SFT 起 | 权重从 5.6 TB 压到 1.42 TiB,且无量化损失 | 训练时的数值稳定性要求极高 |
| 深度方向补一条旁路 | Attention Residuals | 深层网络的信息流 | 结构复杂度 |
四条串起来是同一句话:为「1M 上下文能被便宜地用起来」这一件事,从架构到精度做了一整套配套改造。
一个反复出现的模式
如果这个专栏只让你带走一条读架构的方法,我希望是这条:
每一处激进的节省,都配着一处针对性的补偿。
- 用线性注意力省缓存 → 保留 24 层 softmax 补精确检索;
- 用极端稀疏省算力 → 加 2 个共享专家补通用知识、加稳定性机制补路由塌缩;
- 用 4 bit 省存储 → 用量化感知训练补精度损失;
- 用 93 层堆深度 → 用 AttnRes 补信息稀释。
看任何一代模型的架构图,先找「它在省什么」,再找「它拿什么补」。这两个问题答完,架构就读懂了七成。 反过来,如果一个设计只有省没有补,那它多半没跑通,或者代价被藏起来了。
这一代的三个信号
信号一:线性注意力从边缘走进了主干。 Mamba 那一波之后,线性注意力长期停留在「小模型上有效、大模型上不敢用」的位置。K3 用 69/93 的比例、2.8T 的规模,把它推到了主干上。这件事的意义超出 K3 本身——它证明了混合架构在前沿规模上是可行的。
信号二:低精度训练成为默认。 从「训完再量化」到「带着量化训」,这个转变在 K3 与同期的 DeepSeek V4(FP8/FP4 QAT)上同时发生。往后看,BF16 训练可能会像 FP32 训练一样,逐渐变成历史。
信号三:效率取代规模,成为主要叙事。 K3 的技术报告把「2.5 倍规模效率」放在摘要里,而不是把参数量当卖点。这个转向是被算力天花板逼出来的,但方向是对的——前面那一章讲过原因。
还没有答案的问题
老实说,这个专栏留下了几处空白:
- 逐层排布 —— 24 层 Gated MLA 具体插在哪里,公开材料未给出。
- Stable LatentMoE 的机制细节 ——
Latent与Stable各自对应什么具体做法,摘要层面看不出来。 - 训练成本与数据量 —— 未披露。
- 独立复现的基准 —— 目前主要是官方口径与第三方模型库的整理,真正独立的评测覆盖有限。
这些空白会随着社区拆解逐步填上。权重已经在那儿了,这正是开放权重最大的好处:问题终究会有人去答。
接着读什么
- 同代横向对照:《DeepSeek V4 Flash 深度解析》 —— 同样是 1M 上下文,DeepSeek 选了完全不同的路(压缩而非线性化),两个专栏对着读最有收获。
- 另一条路线:《Qwen3.8-Max 深度解析》 —— 同期的 2.4T 旗舰,赌注押在长时自主任务上。
- 打底:《AI 大模型解构》 —— 上一代架构的系统梳理,本专栏多次引用它。
参考文献
- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
- [2] Moonshot AI. “Kimi Linear: An Expressive, Efficient Attention Architecture.” 2025. arXiv:2510.26692.
- [3] Hugging Face 模型卡:moonshotai/Kimi-K3