# MoE 与混合注意力

> 只有“2.4T 总参数、95B 激活、稀疏 MoE、混合注意力”这四条信息，能推出什么、推不出什么——一次克制的架构推断练习。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.net/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max/moe-and-attention
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# MoE 与混合注意力

<Callout type="info">
  **本章写于 2026 年 8 月 6 日，权重发布之前。** 当时关于架构只有四条公开信息，这一章示范的是“资料不足时怎么推断”。8 月 12 日权重公开后，答案已经揭晓——[下一章](https://daiw.net/manual/qwen3-8-max/architecture)逐条对照了这里的推断：算术推论和横向定位都对了，有一条机制推断错了。本章保留原貌。
</Callout>

关于架构，公开信息只有四条：**2.4T 总参数、95B 激活、稀疏 MoE、混合注意力机制**。

这一章做一件有点特别的事：**在只有这四条的前提下，看看能严谨地推出什么。** 这既是对 Qwen3.8-Max 的分析，也是一次“怎么从有限信息里榨取判断”的示范。

## 能推出的：激活率的定位

95B / 2.4T ≈ **4.0%**。把它放进同代坐标系：

| 模型 | 总参数 | 激活 | 激活率 |
| --- | --- | --- | --- |
| DeepSeek V4-Flash | 284B | 13B | 4.6% |
| **Qwen3.8-Max** | **2.4T** | **95B** | **4.0%** |
| DeepSeek V4-Pro | 1.6T | 49B | 3.1% |
| Kimi K3 | 2.8T | 104B | 1.8% |

结论一：**在同量级模型里，Qwen3.8-Max 的稀疏度偏保守。**

规模和 K3 接近（2.4T vs 2.8T），激活率却是它的两倍多。这意味着：

- **每 token 的计算量更大** —— 推理成本的结构和 K3 不同；
- **专家可能更少或更大** —— 保守的稀疏度通常对应“少而大”或中等粒度的专家配置，而不是 K3 那种 896 选 16 的极端细粒度；
- **训练更稳、工程更简单** —— 稀疏度越低，路由塌缩与通信瓶颈的压力越小。

**这是一个求稳的选择。** 结合 Qwen 团队一贯的风格（[Qwen3 曾主动砍掉共享专家](https://daiw.net/manual/llm-anatomy/moe-knobs)，理由是“收益不明显，图个简单”），这个判断是自洽的。

## 能推出的：它在做长上下文的取舍

“混合注意力”这个词本身就是信息。**它意味着这个模型没有全用同一种注意力**——和 K3（线性 + softmax 混合）、V4（两种压缩率混合）一样，Qwen3.8-Max 也走了混合路线。

这不奇怪。**支持 1M 上下文的模型，几乎不可能全部层用标准 softmax 注意力**——[那笔账算不过来](https://daiw.net/manual/deepseek-v4-flash/million-token-cost)。所以“混合”几乎是必然的。

## 推不出的：混的是哪两种

这是最关键、也最没法回答的问题。至少有三种可能：

1. **线性 + softmax**（K3 路线）—— Qwen 生态里有先例：Qwen3-Next 就用过门控线性注意力。
2. **压缩 + 稀疏**（V4 路线）。
3. **全局 + 滑动窗口**（Gemma 路线）—— 最成熟、最保守的一种混合。

<Callout type="warn">
  三种都说得通，**没有任何公开证据能在它们之间做区分**。本专栏拒绝猜——猜中了是运气，猜错了会被当成事实传播。

  值得一提的是，Qwen 的开源线（Qwen3-Next 等）用过门控线性注意力，这让第 1 种有一点先验上的可能性。但**开源线与 Max 线是不同的模型系列，架构不必相同**，这个先验很弱。
</Callout>

## 推不出的：一切内部结构

层数、隐藏维度、头数、专家数、专家粒度、共享专家的有无、位置编码、归一化方案——**全部无法从这四条信息推出**。

任何声称知道这些的说法，要么有本专栏未掌握的信源（欢迎指正），要么是在编。

## 这一章的方法论价值

在资料不足时，分析可以分三层，越往下越不可靠：

| 层次 | 例子 | 可信度 |
| --- | --- | --- |
| **算术推论** | 95B/2.4T = 4.0% 激活率 | **高**——只要输入数字对，结论必然对 |
| **横向定位** | “在同代里偏保守” | **中**——依赖对照组的选择 |
| **机制推断** | “所以它的专家可能更大” | **低**——有多种架构能给出同样的激活率 |
| **具体猜测** | “它用的是 XXX 注意力” | **不做** |

**本专栏在前三层工作，第四层留白。** 读任何模型分析文章时，也建议用这个分层去检验作者——**如果一篇文章在没有技术报告的情况下讲出了层数和专家数，先问它的来源。**

下一章用配置文件对答案。👉 [架构拆解：配置文件里的答案](https://daiw.net/manual/qwen3-8-max/architecture)

## 参考文献

- [1] DataLearner 模型库 [Qwen3.8-Max](https://www.datalearner.com/ai-models/pretrained-models/qwen3-8-max) —— 参数与“稀疏 MoE + 混合注意力”的表述。
- [2] Qwen Team. “Qwen3 Technical Report.” 2025. arXiv:2505.09388. —— 上一代的设计取向。
- [3] 本站《AI 大模型解构》[MoE 的三个旋钮](https://daiw.net/manual/llm-anatomy/moe-knobs)。
