回顾:K3 押对了什么

把四处赌注收进一张表——线性注意力大规模上主干、稀疏度推到 1.8%、原生低精度训练、效率取代规模成为主指标,以及这一代之后往哪走。

作者 David更新于 13 篇(共 13 篇)

回顾:K3 押对了什么

十三章走完,把 K3 的设计收成一张表,再谈两句趋势。

四处赌注

赌注具体做法换来什么代价
线性注意力上主干93 层里 69 层用 KDA长上下文缓存不随长度增长精确回看能力,靠 24 层 Gated MLA 补
稀疏度推到极致896 选 16 + 2 共享,激活率 1.8%2.8T 参数只算 104B路由与通信开销、均衡难度陡增
原生低精度MXFP4 权重 + MXFP8 激活,QAT 自 SFT 起权重从 5.6 TB 压到 1.42 TiB,且无量化损失训练时的数值稳定性要求极高
深度方向补一条旁路Attention Residuals深层网络的信息流结构复杂度

四条串起来是同一句话:为「1M 上下文能被便宜地用起来」这一件事,从架构到精度做了一整套配套改造。

一个反复出现的模式

如果这个专栏只让你带走一条读架构的方法,我希望是这条:

每一处激进的节省,都配着一处针对性的补偿。

  • 用线性注意力省缓存 → 保留 24 层 softmax 补精确检索;
  • 用极端稀疏省算力 → 加 2 个共享专家补通用知识、加稳定性机制补路由塌缩;
  • 用 4 bit 省存储 → 用量化感知训练补精度损失;
  • 用 93 层堆深度 → 用 AttnRes 补信息稀释。

看任何一代模型的架构图,先找「它在省什么」,再找「它拿什么补」。这两个问题答完,架构就读懂了七成。 反过来,如果一个设计只有省没有补,那它多半没跑通,或者代价被藏起来了。

这一代的三个信号

信号一:线性注意力从边缘走进了主干。 Mamba 那一波之后,线性注意力长期停留在「小模型上有效、大模型上不敢用」的位置。K3 用 69/93 的比例、2.8T 的规模,把它推到了主干上。这件事的意义超出 K3 本身——它证明了混合架构在前沿规模上是可行的

信号二:低精度训练成为默认。 从「训完再量化」到「带着量化训」,这个转变在 K3 与同期的 DeepSeek V4(FP8/FP4 QAT)上同时发生。往后看,BF16 训练可能会像 FP32 训练一样,逐渐变成历史

信号三:效率取代规模,成为主要叙事。 K3 的技术报告把「2.5 倍规模效率」放在摘要里,而不是把参数量当卖点。这个转向是被算力天花板逼出来的,但方向是对的——前面那一章讲过原因。

还没有答案的问题

老实说,这个专栏留下了几处空白:

  • 逐层排布 —— 24 层 Gated MLA 具体插在哪里,公开材料未给出。
  • Stable LatentMoE 的机制细节 —— LatentStable 各自对应什么具体做法,摘要层面看不出来。
  • 训练成本与数据量 —— 未披露。
  • 独立复现的基准 —— 目前主要是官方口径与第三方模型库的整理,真正独立的评测覆盖有限。

这些空白会随着社区拆解逐步填上。权重已经在那儿了,这正是开放权重最大的好处:问题终究会有人去答。

接着读什么

参考文献

  • [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
  • [2] Moonshot AI. “Kimi Linear: An Expressive, Efficient Attention Architecture.” 2025. arXiv:2510.26692.
  • [3] Hugging Face 模型卡:moonshotai/Kimi-K3

本页目录