Attention Residuals
除了序列方向的信息流,深度方向也会衰减——AttnRes 给注意力层之间接了一条旁路,让上层能直接取用下层的注意力结果。
Attention Residuals
技术报告摘要里有一句话值得逐字读:KDA 与 Attention Residuals 一起,「改善了跨序列长度与跨模型深度的信息流动」。
跨序列长度那半句是 KDA 干的活,前两章讲完了。这一章讲跨模型深度——也就是 AttnRes。
深度方向也有信息流问题
一个 93 层的模型,信息要从第 1 层一路传到第 93 层。标准 Transformer 靠的是残差连接:每个子层的输出加回主干,主干像一条高速公路贯穿全模型。
这套机制解决了梯度消失,但它有个特点:所有信息都挤在同一条主干上。第 80 层想用第 12 层注意力算出的某个结果,只能指望它一路「幸存」在主干里没被后续 80 次读写覆盖掉。层数越深,这条链路越长,稀释越严重。
AttnRes 的做法是:在注意力层之间再接一条专用旁路。
它补的是什么
普通残差是层内的:注意力子层的输出加回它自己的输入。AttnRes 是跨层的:让后面的注意力层可以直接取用前面注意力层的结果,不必经由被反复改写的主干中转。
用两句话对比:
- 标准残差:「每一层都把自己的贡献汇入同一条河,下游想用什么就去河里捞。」
- AttnRes:「注意力层之间另修一条专线,上游算出的东西可以直接送到下游。」
为什么偏偏是注意力层需要这条专线?一个合理的解读是:在 K3 的混合堆叠里,注意力层的性质并不一致——69 层 KDA 与 24 层 Gated MLA 记忆形态完全不同。让 softmax 层能直接够到线性层的中间结果(反之亦然),等于给两种记忆之间架了桥。这是本专栏的解读,技术报告只陈述了机制与收益,未展开动机。
它与 K3 的整体设计是配套的
把三章串起来看,注意力这条线上的三个零件各司其职:
| 零件 | 解决的问题 | 方向 |
|---|---|---|
| KDA | 缓存随长度膨胀 | 序列方向 |
| 69:24 混合 | 线性注意力丢失精确检索 | 序列方向(能力补偿) |
| AttnRes | 深层网络里信息被稀释 | 深度方向 |
前两个是「省」,第三个是「补」。省到极致会伤能力,所以要补——这是读架构时反复出现的模式:每一处激进的节省,通常都配着一处针对性的补偿。 记住这个模式,你看任何一代模型的架构图都会轻松很多。
一个提醒:不要过度解读名字
「Attention Residuals」这个名字很朴素,公开材料对其具体形式(旁路怎么加权、跨几层、是否可学习)披露有限。本页讲的是它在整体设计中的位置与作用,不是它的实现细节。若你要复现,请以权重配置与官方代码为准。
注意力讲完了。下一部分转向另一条主线:稀疏。896 个专家里只点 16 个,这是目前公开模型里最激进的稀疏度。👉 896 选 16
参考文献
- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— AttnRes 与「跨长度、跨深度信息流」的表述出自其摘要。
- [2] He et al. “Deep Residual Learning for Image Recognition.” 2015. arXiv:1512.03385. —— 残差连接的原始出处。