Attention Residuals

除了序列方向的信息流,深度方向也会衰减——AttnRes 给注意力层之间接了一条旁路,让上层能直接取用下层的注意力结果。

作者 David更新于 6 篇(共 13 篇)

Attention Residuals

技术报告摘要里有一句话值得逐字读:KDA 与 Attention Residuals 一起,「改善了跨序列长度跨模型深度的信息流动」。

跨序列长度那半句是 KDA 干的活,前两章讲完了。这一章讲跨模型深度——也就是 AttnRes。

深度方向也有信息流问题

一个 93 层的模型,信息要从第 1 层一路传到第 93 层。标准 Transformer 靠的是残差连接:每个子层的输出加回主干,主干像一条高速公路贯穿全模型。

这套机制解决了梯度消失,但它有个特点:所有信息都挤在同一条主干上。第 80 层想用第 12 层注意力算出的某个结果,只能指望它一路「幸存」在主干里没被后续 80 次读写覆盖掉。层数越深,这条链路越长,稀释越严重。

AttnRes 的做法是:在注意力层之间再接一条专用旁路。

它补的是什么

普通残差是层内的:注意力子层的输出加回它自己的输入。AttnRes 是跨层的:让后面的注意力层可以直接取用前面注意力层的结果,不必经由被反复改写的主干中转。

用两句话对比:

  • 标准残差:「每一层都把自己的贡献汇入同一条河,下游想用什么就去河里捞。」
  • AttnRes:「注意力层之间另修一条专线,上游算出的东西可以直接送到下游。」

为什么偏偏是注意力层需要这条专线?一个合理的解读是:在 K3 的混合堆叠里,注意力层的性质并不一致——69 层 KDA 与 24 层 Gated MLA 记忆形态完全不同。让 softmax 层能直接够到线性层的中间结果(反之亦然),等于给两种记忆之间架了桥。这是本专栏的解读,技术报告只陈述了机制与收益,未展开动机。

它与 K3 的整体设计是配套的

把三章串起来看,注意力这条线上的三个零件各司其职:

零件解决的问题方向
KDA缓存随长度膨胀序列方向
69:24 混合线性注意力丢失精确检索序列方向(能力补偿)
AttnRes深层网络里信息被稀释深度方向

前两个是「省」,第三个是「补」。省到极致会伤能力,所以要补——这是读架构时反复出现的模式:每一处激进的节省,通常都配着一处针对性的补偿。 记住这个模式,你看任何一代模型的架构图都会轻松很多。

一个提醒:不要过度解读名字

「Attention Residuals」这个名字很朴素,公开材料对其具体形式(旁路怎么加权、跨几层、是否可学习)披露有限。本页讲的是它在整体设计中的位置与作用,不是它的实现细节。若你要复现,请以权重配置与官方代码为准。

注意力讲完了。下一部分转向另一条主线:稀疏。896 个专家里只点 16 个,这是目前公开模型里最激进的稀疏度。👉 896 选 16

参考文献

  • [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— AttnRes 与「跨长度、跨深度信息流」的表述出自其摘要。
  • [2] He et al. “Deep Residual Learning for Image Recognition.” 2015. arXiv:1512.03385. —— 残差连接的原始出处。

本页目录