# Attention Residuals

> 除了序列方向的信息流，深度方向也会衰减——AttnRes 给注意力层之间接了一条旁路，让上层能直接取用下层的注意力结果。

- 作者：David（道雾轩）
- 专栏：Kimi K3 深度解析（https://daiw.net/manual/kimi-k3.md）
- 最后更新：2026-08-06
- 原文：https://daiw.net/manual/kimi-k3/attn-res
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# Attention Residuals

技术报告摘要里有一句话值得逐字读：KDA 与 Attention Residuals 一起，「改善了**跨序列长度**与**跨模型深度**的信息流动」。

**跨序列长度**那半句是 KDA 干的活，前两章讲完了。这一章讲**跨模型深度**——也就是 AttnRes。

## 深度方向也有信息流问题

一个 93 层的模型，信息要从第 1 层一路传到第 93 层。标准 Transformer 靠的是**残差连接**：每个子层的输出加回主干，主干像一条高速公路贯穿全模型。

这套机制解决了梯度消失，但它有个特点：**所有信息都挤在同一条主干上**。第 80 层想用第 12 层注意力算出的某个结果，只能指望它一路「幸存」在主干里没被后续 80 次读写覆盖掉。层数越深，这条链路越长，稀释越严重。

**AttnRes 的做法是：在注意力层之间再接一条专用旁路。**

## 它补的是什么

普通残差是**层内**的：注意力子层的输出加回它自己的输入。AttnRes 是**跨层**的：让后面的注意力层可以直接取用前面注意力层的结果，不必经由被反复改写的主干中转。

用两句话对比：

- **标准残差**：「每一层都把自己的贡献汇入同一条河，下游想用什么就去河里捞。」
- **AttnRes**：「注意力层之间另修一条专线，上游算出的东西可以直接送到下游。」

<Callout type="info">
  为什么偏偏是注意力层需要这条专线？一个合理的解读是：在 K3 的混合堆叠里，**注意力层的性质并不一致**——69 层 KDA 与 24 层 Gated MLA 记忆形态完全不同。让 softmax 层能直接够到线性层的中间结果（反之亦然），等于给两种记忆之间架了桥。这是本专栏的**解读**，技术报告只陈述了机制与收益，未展开动机。
</Callout>

## 它与 K3 的整体设计是配套的

把三章串起来看，注意力这条线上的三个零件各司其职：

| 零件 | 解决的问题 | 方向 |
| --- | --- | --- |
| KDA | 缓存随长度膨胀 | 序列方向 |
| 69:24 混合 | 线性注意力丢失精确检索 | 序列方向（能力补偿） |
| **AttnRes** | **深层网络里信息被稀释** | **深度方向** |

前两个是「省」，第三个是「补」。省到极致会伤能力，所以要补——这是读架构时反复出现的模式：**每一处激进的节省，通常都配着一处针对性的补偿。** 记住这个模式，你看任何一代模型的架构图都会轻松很多。

## 一个提醒：不要过度解读名字

「Attention Residuals」这个名字很朴素，公开材料对其具体形式（旁路怎么加权、跨几层、是否可学习）披露有限。本页讲的是它**在整体设计中的位置与作用**，不是它的实现细节。若你要复现，请以权重配置与官方代码为准。

注意力讲完了。下一部分转向另一条主线：**稀疏**。896 个专家里只点 16 个，这是目前公开模型里最激进的稀疏度。👉 [896 选 16](https://daiw.net/manual/kimi-k3/latent-moe)

## 参考文献

- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— AttnRes 与「跨长度、跨深度信息流」的表述出自其摘要。
- [2] He et al. “Deep Residual Learning for Image Recognition.” 2015. arXiv:1512.03385. —— 残差连接的原始出处。
