MoE 与混合注意力
只有“2.4T 总参数、95B 激活、稀疏 MoE、混合注意力”这四条信息,能推出什么、推不出什么——一次克制的架构推断练习。
MoE 与混合注意力
本章写于 2026 年 8 月 6 日,权重发布之前。 当时关于架构只有四条公开信息,这一章示范的是“资料不足时怎么推断”。8 月 12 日权重公开后,答案已经揭晓——下一章逐条对照了这里的推断:算术推论和横向定位都对了,有一条机制推断错了。本章保留原貌。
关于架构,公开信息只有四条:2.4T 总参数、95B 激活、稀疏 MoE、混合注意力机制。
这一章做一件有点特别的事:在只有这四条的前提下,看看能严谨地推出什么。 这既是对 Qwen3.8-Max 的分析,也是一次“怎么从有限信息里榨取判断”的示范。
能推出的:激活率的定位
95B / 2.4T ≈ 4.0%。把它放进同代坐标系:
| 模型 | 总参数 | 激活 | 激活率 |
|---|---|---|---|
| DeepSeek V4-Flash | 284B | 13B | 4.6% |
| Qwen3.8-Max | 2.4T | 95B | 4.0% |
| DeepSeek V4-Pro | 1.6T | 49B | 3.1% |
| Kimi K3 | 2.8T | 104B | 1.8% |
结论一:在同量级模型里,Qwen3.8-Max 的稀疏度偏保守。
规模和 K3 接近(2.4T vs 2.8T),激活率却是它的两倍多。这意味着:
- 每 token 的计算量更大 —— 推理成本的结构和 K3 不同;
- 专家可能更少或更大 —— 保守的稀疏度通常对应“少而大”或中等粒度的专家配置,而不是 K3 那种 896 选 16 的极端细粒度;
- 训练更稳、工程更简单 —— 稀疏度越低,路由塌缩与通信瓶颈的压力越小。
这是一个求稳的选择。 结合 Qwen 团队一贯的风格(Qwen3 曾主动砍掉共享专家,理由是“收益不明显,图个简单”),这个判断是自洽的。
能推出的:它在做长上下文的取舍
“混合注意力”这个词本身就是信息。它意味着这个模型没有全用同一种注意力——和 K3(线性 + softmax 混合)、V4(两种压缩率混合)一样,Qwen3.8-Max 也走了混合路线。
这不奇怪。支持 1M 上下文的模型,几乎不可能全部层用标准 softmax 注意力——那笔账算不过来。所以“混合”几乎是必然的。
推不出的:混的是哪两种
这是最关键、也最没法回答的问题。至少有三种可能:
- 线性 + softmax(K3 路线)—— Qwen 生态里有先例:Qwen3-Next 就用过门控线性注意力。
- 压缩 + 稀疏(V4 路线)。
- 全局 + 滑动窗口(Gemma 路线)—— 最成熟、最保守的一种混合。
三种都说得通,没有任何公开证据能在它们之间做区分。本专栏拒绝猜——猜中了是运气,猜错了会被当成事实传播。
值得一提的是,Qwen 的开源线(Qwen3-Next 等)用过门控线性注意力,这让第 1 种有一点先验上的可能性。但开源线与 Max 线是不同的模型系列,架构不必相同,这个先验很弱。
推不出的:一切内部结构
层数、隐藏维度、头数、专家数、专家粒度、共享专家的有无、位置编码、归一化方案——全部无法从这四条信息推出。
任何声称知道这些的说法,要么有本专栏未掌握的信源(欢迎指正),要么是在编。
这一章的方法论价值
在资料不足时,分析可以分三层,越往下越不可靠:
| 层次 | 例子 | 可信度 |
|---|---|---|
| 算术推论 | 95B/2.4T = 4.0% 激活率 | 高——只要输入数字对,结论必然对 |
| 横向定位 | “在同代里偏保守” | 中——依赖对照组的选择 |
| 机制推断 | “所以它的专家可能更大” | 低——有多种架构能给出同样的激活率 |
| 具体猜测 | “它用的是 XXX 注意力” | 不做 |
本专栏在前三层工作,第四层留白。 读任何模型分析文章时,也建议用这个分层去检验作者——如果一篇文章在没有技术报告的情况下讲出了层数和专家数,先问它的来源。
下一章用配置文件对答案。👉 架构拆解:配置文件里的答案
参考文献
- [1] DataLearner 模型库 Qwen3.8-Max —— 参数与“稀疏 MoE + 混合注意力”的表述。
- [2] Qwen Team. “Qwen3 Technical Report.” 2025. arXiv:2505.09388. —— 上一代的设计取向。
- [3] 本站《AI 大模型解构》MoE 的三个旋钮。