# 回顾：K3 押对了什么

> 把四处赌注收进一张表——线性注意力大规模上主干、稀疏度推到 1.8%、原生低精度训练、效率取代规模成为主指标，以及这一代之后往哪走。

- 作者：David（道雾轩）
- 专栏：Kimi K3 深度解析（https://daiw.net/manual/kimi-k3.md）
- 最后更新：2026-08-06
- 原文：https://daiw.net/manual/kimi-k3/recap
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 回顾：K3 押对了什么

十三章走完，把 K3 的设计收成一张表，再谈两句趋势。

## 四处赌注

| 赌注 | 具体做法 | 换来什么 | 代价 |
| --- | --- | --- | --- |
| **线性注意力上主干** | 93 层里 69 层用 KDA | 长上下文缓存不随长度增长 | 精确回看能力，靠 24 层 Gated MLA 补 |
| **稀疏度推到极致** | 896 选 16 + 2 共享，激活率 1.8% | 2.8T 参数只算 104B | 路由与通信开销、均衡难度陡增 |
| **原生低精度** | MXFP4 权重 + MXFP8 激活，QAT 自 SFT 起 | 权重从 5.6 TB 压到 1.42 TiB，且无量化损失 | 训练时的数值稳定性要求极高 |
| **深度方向补一条旁路** | Attention Residuals | 深层网络的信息流 | 结构复杂度 |

四条串起来是同一句话：**为「1M 上下文能被便宜地用起来」这一件事，从架构到精度做了一整套配套改造。**

## 一个反复出现的模式

如果这个专栏只让你带走一条读架构的方法，我希望是这条：

> **每一处激进的节省，都配着一处针对性的补偿。**

- 用线性注意力省缓存 → 保留 24 层 softmax 补精确检索；
- 用极端稀疏省算力 → 加 2 个共享专家补通用知识、加稳定性机制补路由塌缩；
- 用 4 bit 省存储 → 用量化感知训练补精度损失；
- 用 93 层堆深度 → 用 AttnRes 补信息稀释。

看任何一代模型的架构图，先找「它在省什么」，再找「它拿什么补」。**这两个问题答完，架构就读懂了七成。** 反过来，如果一个设计只有省没有补，那它多半没跑通，或者代价被藏起来了。

## 这一代的三个信号

**信号一：线性注意力从边缘走进了主干。**
Mamba 那一波之后，线性注意力长期停留在「小模型上有效、大模型上不敢用」的位置。K3 用 69/93 的比例、2.8T 的规模，把它推到了主干上。这件事的意义超出 K3 本身——**它证明了混合架构在前沿规模上是可行的**。

**信号二：低精度训练成为默认。**
从「训完再量化」到「带着量化训」，这个转变在 K3 与同期的 DeepSeek V4（FP8/FP4 QAT）上同时发生。往后看，**BF16 训练可能会像 FP32 训练一样，逐渐变成历史**。

**信号三：效率取代规模，成为主要叙事。**
K3 的技术报告把「2.5 倍规模效率」放在摘要里，而不是把参数量当卖点。这个转向是被算力天花板逼出来的，但方向是对的——[前面那一章](https://daiw.net/manual/kimi-k3/pretrain-scaling)讲过原因。

## 还没有答案的问题

老实说，这个专栏留下了几处空白：

- **逐层排布** —— 24 层 Gated MLA 具体插在哪里，公开材料未给出。
- **Stable LatentMoE 的机制细节** —— `Latent` 与 `Stable` 各自对应什么具体做法，摘要层面看不出来。
- **训练成本与数据量** —— 未披露。
- **独立复现的基准** —— 目前主要是官方口径与第三方模型库的整理，真正独立的评测覆盖有限。

这些空白会随着社区拆解逐步填上。权重已经在那儿了，**这正是开放权重最大的好处：问题终究会有人去答。**

## 接着读什么

- **同代横向对照**：[《DeepSeek V4 Flash 深度解析》](https://daiw.net/manual/deepseek-v4-flash) —— 同样是 1M 上下文，DeepSeek 选了完全不同的路（压缩而非线性化），两个专栏对着读最有收获。
- **另一条路线**：[《Qwen3.8-Max 深度解析》](https://daiw.net/manual/qwen3-8-max) —— 同期的 2.4T 旗舰，赌注押在长时自主任务上。
- **打底**：[《AI 大模型解构》](https://daiw.net/manual/llm-anatomy) —— 上一代架构的系统梳理，本专栏多次引用它。

## 参考文献

- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
- [2] Moonshot AI. “Kimi Linear: An Expressive, Efficient Attention Architecture.” 2025. arXiv:2510.26692.
- [3] Hugging Face 模型卡：[moonshotai/Kimi-K3](https://huggingface.co/moonshotai/Kimi-K3)
