Kimi K3 深度解析

拆开 2.8T 参数的 Kimi K3:Kimi Delta Attention 与注意力残差怎么撑住 1M 上下文、896 选 16 的 Stable LatentMoE 如何训得稳、MXFP4 权重与开放许可的成色如何。

作者 David更新于

序 · 2.8T 参数摆上桌面

2026 年 7 月 16 日,月之暗面发布 Kimi K3;7 月 28 日,完整权重落地 Hugging Face。到这一步,一件此前只在闭源实验室内部发生的事第一次摆到了公众面前:一个 2.8 万亿参数的前沿模型,连同技术报告一起,可以被任何人下载、检视、复现。

这个专栏要做的,就是把它拆开。

本专栏以官方技术报告《Kimi K3: Open Frontier Intelligence》(arXiv:2607.24653)与 Hugging Face 上的 moonshotai/Kimi-K3 模型卡为主要依据,成文于 2026 年 8 月。凡是厂商自述而缺少第三方复现的数字,正文里会明确标注——这类标注请当真,它是读这一代模型资料时最重要的一道过滤。

它凭什么值得拆

如果你读过《AI 大模型解构》,会记得那个专栏的结论:2024–2025 的开源大模型「骨架高度雷同」,真正分道扬镳的只有少数几处——怎么省 KV 缓存怎么稀疏化

Kimi K3 有意思的地方在于,它在这两处都把赌注下到了当时没人敢下的位置

维度上一代的常规做法K3 的选择
注意力全部层用 MHA / GQA / MLA 这类 softmax 注意力93 层里 69 层是线性注意力(KDA),只留 24 层 Gated MLA
层间信息流标准残差连接额外加一路 Attention Residuals(AttnRes)
MoE 稀疏度256 选 8(DeepSeek-V3)、128 选 8(Qwen3)896 选 16,外加 2 个共享专家
权重精度BF16 训练,事后量化原生 MXFP4 权重 + MXFP8 激活,从 SFT 阶段起做量化感知训练

每一行都不是微调,而是换零件。而且这四处不是各自独立的花活——它们串成一条线:要把 1M 上下文做到能用、能便宜地用,就得同时压住 KV 缓存、压住每步算力、压住权重体积。

这个专栏怎么走

分四部分,先看骨架,再看两条主线,最后落到能不能自己跑起来。

第 0 部分 · 先看全貌

  • Kimi K3 是什么 —— 发布时间线、和 K2 的关系、开放权重的实际含义与许可边界。
  • 规格总表 —— 一页把参数、层数、专家、上下文、精度、价格全部摊开,后面每章都回来查它。

第 1 部分 · 注意力:KDA 与 AttnRes

  • 1M 上下文撞上的那堵墙 —— KV 缓存为什么随长度线性膨胀,以及为什么它比算力更早成为瓶颈。
  • Kimi Delta Attention —— delta 规则 + 通道级门控,一个固定大小的矩阵状态如何替代无限增长的缓存。
  • 69 + 24 的混合堆叠 —— 线性注意力不是免费的,为什么必须留下那 24 层 softmax。
  • Attention Residuals —— 一条跨层的旁路,补的是深度方向上的信息流。

第 2 部分 · 稀疏:Stable LatentMoE

  • 896 选 16 —— 把稀疏度推到 1.8%,组合空间与路由代价的账怎么算。
  • 让它训得稳 —— 极端稀疏下的负载均衡与数值稳定性。

第 3 部分 · 训练与后训练

  • 规模效率提升 2.5 倍 —— 这个说法到底在说什么,以及它为什么比参数量更值得关心。
  • 后训练:三个域的强化学习与多档思考预算 —— agentic 能力是训出来的,不是涌现出来的。

第 4 部分 · 落地

  • 基准怎么读 —— 逐条对照官方数字,分清哪些有第三方复现、哪些没有。
  • 自己跑得起来吗 —— 1.42 TiB 权重的显存账、三种推理引擎、许可证里那条营收红线。

收尾

  • 回顾:K3 押对了什么 —— 把四处赌注收进一张表,并给出「这一代之后往哪走」的判断。

读之前,你最好有

  • 读过 《AI 大模型解构》,至少读到 MoE 那几章——本专栏默认你知道什么是 KV 缓存、什么是路由专家、共享专家干什么用。
  • 不需要读过 Kimi Linear 或 K3 的原论文;关键推导本专栏会讲清来龙去脉。

准备好了,先把这个模型的来历和它的「开放」到底开到什么程度弄清楚:Kimi K3 是什么

本页目录