MoE 与混合注意力

只有“2.4T 总参数、95B 激活、稀疏 MoE、混合注意力”这四条信息,能推出什么、推不出什么——一次克制的架构推断练习。

作者 David更新于 3 篇(共 11 篇)

MoE 与混合注意力

本章写于 2026 年 8 月 6 日,权重发布之前。 当时关于架构只有四条公开信息,这一章示范的是“资料不足时怎么推断”。8 月 12 日权重公开后,答案已经揭晓——下一章逐条对照了这里的推断:算术推论和横向定位都对了,有一条机制推断错了。本章保留原貌。

关于架构,公开信息只有四条:2.4T 总参数、95B 激活、稀疏 MoE、混合注意力机制

这一章做一件有点特别的事:在只有这四条的前提下,看看能严谨地推出什么。 这既是对 Qwen3.8-Max 的分析,也是一次“怎么从有限信息里榨取判断”的示范。

能推出的:激活率的定位

95B / 2.4T ≈ 4.0%。把它放进同代坐标系:

模型总参数激活激活率
DeepSeek V4-Flash284B13B4.6%
Qwen3.8-Max2.4T95B4.0%
DeepSeek V4-Pro1.6T49B3.1%
Kimi K32.8T104B1.8%

结论一:在同量级模型里,Qwen3.8-Max 的稀疏度偏保守。

规模和 K3 接近(2.4T vs 2.8T),激活率却是它的两倍多。这意味着:

  • 每 token 的计算量更大 —— 推理成本的结构和 K3 不同;
  • 专家可能更少或更大 —— 保守的稀疏度通常对应“少而大”或中等粒度的专家配置,而不是 K3 那种 896 选 16 的极端细粒度;
  • 训练更稳、工程更简单 —— 稀疏度越低,路由塌缩与通信瓶颈的压力越小。

这是一个求稳的选择。 结合 Qwen 团队一贯的风格(Qwen3 曾主动砍掉共享专家,理由是“收益不明显,图个简单”),这个判断是自洽的。

能推出的:它在做长上下文的取舍

“混合注意力”这个词本身就是信息。它意味着这个模型没有全用同一种注意力——和 K3(线性 + softmax 混合)、V4(两种压缩率混合)一样,Qwen3.8-Max 也走了混合路线。

这不奇怪。支持 1M 上下文的模型,几乎不可能全部层用标准 softmax 注意力——那笔账算不过来。所以“混合”几乎是必然的。

推不出的:混的是哪两种

这是最关键、也最没法回答的问题。至少有三种可能:

  1. 线性 + softmax(K3 路线)—— Qwen 生态里有先例:Qwen3-Next 就用过门控线性注意力。
  2. 压缩 + 稀疏(V4 路线)。
  3. 全局 + 滑动窗口(Gemma 路线)—— 最成熟、最保守的一种混合。

三种都说得通,没有任何公开证据能在它们之间做区分。本专栏拒绝猜——猜中了是运气,猜错了会被当成事实传播。

值得一提的是,Qwen 的开源线(Qwen3-Next 等)用过门控线性注意力,这让第 1 种有一点先验上的可能性。但开源线与 Max 线是不同的模型系列,架构不必相同,这个先验很弱。

推不出的:一切内部结构

层数、隐藏维度、头数、专家数、专家粒度、共享专家的有无、位置编码、归一化方案——全部无法从这四条信息推出

任何声称知道这些的说法,要么有本专栏未掌握的信源(欢迎指正),要么是在编。

这一章的方法论价值

在资料不足时,分析可以分三层,越往下越不可靠:

层次例子可信度
算术推论95B/2.4T = 4.0% 激活率——只要输入数字对,结论必然对
横向定位“在同代里偏保守”——依赖对照组的选择
机制推断“所以它的专家可能更大”——有多种架构能给出同样的激活率
具体猜测“它用的是 XXX 注意力”不做

本专栏在前三层工作,第四层留白。 读任何模型分析文章时,也建议用这个分层去检验作者——如果一篇文章在没有技术报告的情况下讲出了层数和专家数,先问它的来源。

下一章用配置文件对答案。👉 架构拆解:配置文件里的答案

参考文献

  • [1] DataLearner 模型库 Qwen3.8-Max —— 参数与“稀疏 MoE + 混合注意力”的表述。
  • [2] Qwen Team. “Qwen3 Technical Report.” 2025. arXiv:2505.09388. —— 上一代的设计取向。
  • [3] 本站《AI 大模型解构》MoE 的三个旋钮

本页目录