# Kimi K3 深度解析

> 拆开 2.8T 参数的 Kimi K3：Kimi Delta Attention 与注意力残差怎么撑住 1M 上下文、896 选 16 的 Stable LatentMoE 如何训得稳、MXFP4 权重与开放许可的成色如何。

- 作者：David（道雾轩）
- 最后更新：2026-08-06
- 原文：https://daiw.net/manual/kimi-k3
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 序 · 2.8T 参数摆上桌面

2026 年 7 月 16 日，月之暗面发布 Kimi K3；7 月 28 日，**完整权重落地 Hugging Face**。到这一步，一件此前只在闭源实验室内部发生的事第一次摆到了公众面前：**一个 2.8 万亿参数的前沿模型，连同技术报告一起，可以被任何人下载、检视、复现。**

这个专栏要做的，就是把它拆开。

<Callout type="info">
  本专栏以官方技术报告《Kimi K3: Open Frontier Intelligence》（arXiv:2607.24653）与 Hugging Face 上的 `moonshotai/Kimi-K3` 模型卡为主要依据，成文于 **2026 年 8 月**。凡是厂商自述而缺少第三方复现的数字，正文里会明确标注——这类标注请当真，它是读这一代模型资料时最重要的一道过滤。
</Callout>

## 它凭什么值得拆

如果你读过[《AI 大模型解构》](https://daiw.net/manual/llm-anatomy)，会记得那个专栏的结论：2024–2025 的开源大模型「骨架高度雷同」，真正分道扬镳的只有少数几处——**怎么省 KV 缓存**、**怎么稀疏化**。

Kimi K3 有意思的地方在于，它在这两处都把赌注下到了**当时没人敢下的位置**：

| 维度 | 上一代的常规做法 | K3 的选择 |
| --- | --- | --- |
| 注意力 | 全部层用 MHA / GQA / MLA 这类 softmax 注意力 | **93 层里 69 层是线性注意力（KDA）**，只留 24 层 Gated MLA |
| 层间信息流 | 标准残差连接 | 额外加一路 **Attention Residuals（AttnRes）** |
| MoE 稀疏度 | 256 选 8（DeepSeek-V3）、128 选 8（Qwen3） | **896 选 16**，外加 2 个共享专家 |
| 权重精度 | BF16 训练，事后量化 | **原生 MXFP4 权重 + MXFP8 激活**，从 SFT 阶段起做量化感知训练 |

每一行都不是微调，而是**换零件**。而且这四处不是各自独立的花活——它们串成一条线：**要把 1M 上下文做到能用、能便宜地用，就得同时压住 KV 缓存、压住每步算力、压住权重体积。**

## 这个专栏怎么走

分四部分，先看骨架，再看两条主线，最后落到能不能自己跑起来。

**第 0 部分 · 先看全貌**
- **Kimi K3 是什么** —— 发布时间线、和 K2 的关系、开放权重的实际含义与许可边界。
- **规格总表** —— 一页把参数、层数、专家、上下文、精度、价格全部摊开，后面每章都回来查它。

**第 1 部分 · 注意力：KDA 与 AttnRes**
- **1M 上下文撞上的那堵墙** —— KV 缓存为什么随长度线性膨胀，以及为什么它比算力更早成为瓶颈。
- **Kimi Delta Attention** —— delta 规则 + 通道级门控，一个固定大小的矩阵状态如何替代无限增长的缓存。
- **69 + 24 的混合堆叠** —— 线性注意力不是免费的，为什么必须留下那 24 层 softmax。
- **Attention Residuals** —— 一条跨层的旁路，补的是深度方向上的信息流。

**第 2 部分 · 稀疏：Stable LatentMoE**
- **896 选 16** —— 把稀疏度推到 1.8%，组合空间与路由代价的账怎么算。
- **让它训得稳** —— 极端稀疏下的负载均衡与数值稳定性。

**第 3 部分 · 训练与后训练**
- **规模效率提升 2.5 倍** —— 这个说法到底在说什么，以及它为什么比参数量更值得关心。
- **后训练：三个域的强化学习与多档思考预算** —— agentic 能力是训出来的，不是涌现出来的。

**第 4 部分 · 落地**
- **基准怎么读** —— 逐条对照官方数字，分清哪些有第三方复现、哪些没有。
- **自己跑得起来吗** —— 1.42 TiB 权重的显存账、三种推理引擎、许可证里那条营收红线。

**收尾**
- **回顾：K3 押对了什么** —— 把四处赌注收进一张表，并给出「这一代之后往哪走」的判断。

## 读之前，你最好有

- **读过 [《AI 大模型解构》](https://daiw.net/manual/llm-anatomy)**，至少读到 MoE 那几章——本专栏默认你知道什么是 KV 缓存、什么是路由专家、共享专家干什么用。
- 不需要读过 Kimi Linear 或 K3 的原论文；关键推导本专栏会讲清来龙去脉。

准备好了，先把这个模型的来历和它的「开放」到底开到什么程度弄清楚：[Kimi K3 是什么](https://daiw.net/manual/kimi-k3/what-is-k3)。

## 本专栏篇目

- [Kimi K3 深度解析](https://daiw.net/manual/kimi-k3.md): 拆开 2.8T 参数的 Kimi K3：Kimi Delta Attention 与注意力残差怎么撑住 1M 上下文、896 选 16 的 Stable LatentMoE 如何训得稳、MXFP4 权重与开放许可的成色如何。

### 第 0 部分 · 先看全貌

- [Kimi K3 是什么](https://daiw.net/manual/kimi-k3/what-is-k3.md): 从 K2 到 K3 的时间线、2.8T/104B 的定位、以及「开放权重」在 Kimi K3 License 下到底开到什么程度——包括那条年营收 2000 万美元的商用红线。
- [规格总表](https://daiw.net/manual/kimi-k3/spec-sheet.md): 一页摊开 Kimi K3 的全部规格：2.8T/104B 参数、93 层的 69+24+1 排布、896 选 16 的专家配置、1M 上下文、MXFP4 权重与两地定价。

### 第 1 部分 · 注意力：KDA 与 AttnRes

- [1M 上下文撞上的那堵墙](https://daiw.net/manual/kimi-k3/kv-cache-wall.md): 长上下文的第一瓶颈不是算力而是显存——KV 缓存随序列长度线性膨胀，一次 1M token 的对话要占掉多少显存，以及为什么「压缩」和「稀疏」是仅有的两条出路。
- [Kimi Delta Attention](https://daiw.net/manual/kimi-k3/kda.md): 拆开 KDA 的更新式：delta 规则只写「预测误差」、通道级门控让每个特征维度各自决定遗忘速度，以及它相对 Gated DeltaNet、Mamba2 的位置。
- [69 + 24 的混合堆叠](https://daiw.net/manual/kimi-k3/hybrid-stack.md): 为什么 K3 不把 93 层全换成线性注意力——线性层与 softmax 层各自补什么，Gated MLA 在其中的角色，以及混合比例这个旋钮怎么拧。
- [Attention Residuals](https://daiw.net/manual/kimi-k3/attn-res.md): 除了序列方向的信息流，深度方向也会衰减——AttnRes 给注意力层之间接了一条旁路，让上层能直接取用下层的注意力结果。

### 第 2 部分 · 稀疏：Stable LatentMoE

- [896 选 16](https://daiw.net/manual/kimi-k3/latent-moe.md): Stable LatentMoE 把稀疏度推到 1.8%——专家总数比 DeepSeek-V3 多 3.5 倍，激活率却更低。组合空间、路由代价与「潜空间」这个词的分量。
- [让它训得稳](https://daiw.net/manual/kimi-k3/moe-stability.md): 极端稀疏下 MoE 最怕两件事——路由塌缩与数值发散。负载均衡为什么必须做、无辅助损失方案好在哪，以及 K3 名字里的「Stable」到底在承诺什么。

### 第 3 部分 · 训练与后训练

- [规模效率提升 2.5 倍](https://daiw.net/manual/kimi-k3/pretrain-scaling.md): 技术报告最值钱的一句话不是「2.8T 参数」，而是「相对 K2 规模效率提升约 2.5 倍」——拆开这个口径在说什么，以及为什么它比参数量更该被关心。
- [后训练：三个域的强化学习](https://daiw.net/manual/kimi-k3/post-training.md): K3 的 agentic 能力不是涌现的，是训出来的——通用、agentic、编码三个域上的强化学习，以及「多档思考预算」这个正在成为标配的设计。

### 第 4 部分 · 落地

- [基准怎么读](https://daiw.net/manual/kimi-k3/benchmarks.md): 逐条对照 K3 的公开基准分数，分清哪些是官方口径、哪些有第三方榜单支撑，以及为什么「agentic 类基准领先、硬推理类仍落后」这个组合本身就是信息。
- [自己跑得起来吗](https://daiw.net/manual/kimi-k3/deploy.md): 1.42 TiB 的 MXFP4 权重意味着什么样的硬件账，三种官方推荐的推理引擎，以及许可证里那条真正需要读原文的条款。

### 收尾

- [回顾：K3 押对了什么](https://daiw.net/manual/kimi-k3/recap.md): 把四处赌注收进一张表——线性注意力大规模上主干、稀疏度推到 1.8%、原生低精度训练、效率取代规模成为主指标，以及这一代之后往哪走。
