# Qwen3.8-Max 深度解析

> 2.4T 参数、95B 激活的阿里旗舰，Max 级第一次开放权重——拆开它的架构、长时程主张与开源成色，并完整记录一个模型从“只有发布会”到“权重落地”、再到“API 换了新快照”的判断过程。

- 作者：David（道雾轩）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 序 · 一个先发布、后交底的旗舰

2026 年 8 月 3 日，阿里正式发布 **Qwen3.8-Max**：2.4 万亿参数、每 token 激活 95B、1M 上下文，并**首次承诺开放 Max 级模型的权重**。

本专栏初稿写于 **2026 年 8 月 6 日**，那时权重还没落地。之后的事情按顺序是：权重 8 月 9 日上传到 Hugging Face、8 月 12 日公开（仓库名 `Qwen3.8-2.4T-A95B`），承诺按期兑现；8 月底，Qwen 团队又放出了 E-Commerce Bench 的论文与代码、Qwen3.8-Flash-Next 的技术报告；9 月 2 日，API 换上了继续后训练的 **Qwen3.8-Max-0902** 快照，开放权重则停在 8 月的版本。本专栏在 9 月做了两轮更新，全文以 **2026 年 9 月 19 日**能查到的一手资料为准。

<Callout type="warn">
  **这个专栏和另外两个不一样，请先读这段。**

  [Kimi K3](https://daiw.net/manual/kimi-k3) 与 [DeepSeek V4-Flash](https://daiw.net/manual/deepseek-v4-flash) 的专栏建立在**已公开的技术报告 + 已下载的权重**之上。初稿写作时，Qwen3.8-Max 只有 API、发布会材料与一份开源承诺，**没有技术报告，没有模型卡，没有权重**。

  所以本专栏最初做的是：**整理已知，标出未知，并把“怎么在证据不足时读一个模型”这件事本身讲清楚。** 权重公开后，模型卡与配置文件填上了架构的空白；回到官方博客原文逐条核对，又订正了几处当初沿用二手资料的说法。专栏保留了发布前的推断章节，另补写章节对照答案。**Qwen3.8-Max 本身的技术报告至今没有发布**，训练侧的细节仍然大多空白。
</Callout>

## 它值得单独写一个专栏的三个理由

**一、Max 级第一次开放权重。**
Qwen 的开源线一直是 3.6、27B 这些中小尺寸；Max 级（3.6-Max、3.7-Max）全部闭源、只走 API。3.8-Max 放出了权重，**是这条线上的第一次**，意义不小。

**二、它把赌注押在了别处。**
K3 押注长上下文效率，V4 押注压缩注意力，**Qwen3.8-Max 押注“长时程自主任务”**——发布材料里最醒目的不是基准分，而是“连续自主开发 16 天”“365 天电商模拟”这类主张。这是一个不同的产品判断。

**三、它是观察“厂商叙事”的好样本。**
在缺少技术报告的情况下，一个模型的公开形象几乎完全由发布材料塑造。**学会读这类材料——哪些可信、哪些需要打折、哪些根本无法验证——本身就是一项有用的技能。** 本专栏会把这件事当作明线来讲，并在资料陆续公开后回头检验当初的判断：有的判断站住了，有的数字回到原始出处一看，意思并不一样。

## 这个专栏怎么走

**第 0 部分 · 先看全貌**
- **Qwen3.8-Max 是什么** —— 从 7 月预览、8 月发布、权重公开到 9 月 0902 快照的时间线，与 3.7-Max 的关系，访问方式。
- **规格总表** —— 全部规格与官方定价，以及那张“未公开清单”的填补情况。

**第 1 部分 · 架构**
- **MoE 与混合注意力** —— 写于权重发布前：只凭 2.4T / 95B 能推出什么、推不出什么。
- **架构拆解：配置文件里的答案** —— 权重公开后补写：92 层、3:1 混合注意力、512 个小专家，并逐条对照上一章的推断。
- **思考档位与思考模式** —— 三档 `reasoning_effort`，开放权重必须思考，API 版可以关；默认思考预算有多大。

**第 2 部分 · 长时自主：这一代的赌注**
- **那些长时程主张** —— 16 天、365 天、500 轮，逐条看这些数字在说什么；其中两项现在已经可以自己核对。
- **4000 个 RL 环境：一张图里的数字** —— 支撑长时程能力的训练侧投入，以及“4,000”这个数的真实出处。

**第 3 部分 · 证据与口径**
- **基准怎么读** —— 发布期各来源的数字互相矛盾，这一章先把冲突摆出来，再用官方分数表定案，最后看第三方评测与 0902 快照。
- **开源承诺的成色** —— 承诺了什么、兑现了多少、许可里藏着什么。

**第 4 部分 · 同系列的开源兄弟**
- **同期开放的 27B 与 Flash-Next** —— 同一代的三份开放权重、三种许可，以及这一代唯一的技术报告讲了什么。

**收尾**
- **回顾：在证据不足时怎么判断一个模型**

## 读之前

- 建议先读 [《Kimi K3 深度解析》](https://daiw.net/manual/kimi-k3) 或 [《DeepSeek V4 Flash 深度解析》](https://daiw.net/manual/deepseek-v4-flash) 中的任意一个——有了“资料充分时能拆到多细”的参照，你才会对这里曾经的空白有实感。
- 打底可读 [《AI 大模型解构》](https://daiw.net/manual/llm-anatomy)。

开始：[Qwen3.8-Max 是什么](https://daiw.net/manual/qwen3-8-max/what-is-qwen38-max)。

## 本专栏篇目

- [Qwen3.8-Max 深度解析](https://daiw.net/manual/qwen3-8-max.md): 2.4T 参数、95B 激活的阿里旗舰，Max 级第一次开放权重——拆开它的架构、长时程主张与开源成色，并完整记录一个模型从“只有发布会”到“权重落地”、再到“API 换了新快照”的判断过程。

### 第 0 部分 · 先看全貌

- [Qwen3.8-Max 是什么](https://daiw.net/manual/qwen3-8-max/what-is-qwen38-max.md): 从 7 月 19 日预览、8 月 3 日正式发布、8 月 12 日权重公开到 9 月 2 日 0902 快照的时间线，与 Qwen3.7-Max 的关系、访问渠道，以及同期开放的 27B 与 Flash-Next。
- [规格总表](https://daiw.net/manual/qwen3-8-max/spec-sheet.md): Qwen3.8-Max 的全部规格——2.4T/95B、92 层、512 个专家、官方的上下文与思考上限、两地定价——以及那张“未公开清单”在权重公开后的填补情况。

### 第 1 部分 · 已知的架构

- [MoE 与混合注意力](https://daiw.net/manual/qwen3-8-max/moe-and-attention.md): 只有“2.4T 总参数、95B 激活、稀疏 MoE、混合注意力”这四条信息，能推出什么、推不出什么——一次克制的架构推断练习。
- [架构拆解：配置文件里的答案](https://daiw.net/manual/qwen3-8-max/architecture.md): 权重公开后补写的一章——92 层、3:1 的 Gated DeltaNet 与门控注意力混排、512 个专家选 10 加 1 个共享专家。逐项读 config.json，用算术核对 2.4T 与 95B，并对照上一章的推断：哪些对了、哪些错了。
- [思考档位与思考模式](https://daiw.net/manual/qwen3-8-max/thinking-effort.md): 官方定名的三档 reasoning_effort（low / medium / xhigh，默认 xhigh）、开放权重必须开启思考而 API 版支持非思考模式，以及 26 万 token 的默认思考预算对账单的影响。

### 第 2 部分 · 长时自主：这一代的赌注

- [那些长时程主张](https://daiw.net/manual/qwen3-8-max/long-horizon.md): 16 天自主开发一个项目、365 天电商模拟、500 轮芯片优化——逐条拆开阿里的长时程演示；其中两项的轨迹与环境后来公开了，核对之后，有的数字站得住，有的换了一副面孔。
- [4000 个 RL 环境：一张图里的数字](https://daiw.net/manual/qwen3-8-max/rl-environments.md): 长时程能力不是涌现的，是训出来的——但“4,000 个 RL 环境”并不是官方写下的一句话，而是一张图上最佳检查点的位置。回到原图与博客原文，看训练侧到底公开了什么。

### 第 3 部分 · 证据与口径

- [基准怎么读](https://daiw.net/manual/qwen3-8-max/benchmarks.md): 发布期各来源的 Qwen3.8-Max 基准数字互相矛盾——这一章先把冲突原样摆出来，再用官方分数表定案、讲清读表时要打的折扣，最后看第三方评测与 9 月的 0902 快照。
- [开源承诺的成色](https://daiw.net/manual/qwen3-8-max/open-weights.md): 承诺了什么、兑现了多少、许可里藏着什么——Max 级第一次开放权重。这一章先记录承诺与写作时的状态，再用发布后的一手材料逐项检验。

### 第 4 部分 · 同系列的开源兄弟

- [同期开放的 27B 与 Flash-Next](https://daiw.net/manual/qwen3-8-max/qwen38-family.md): Qwen3.8 这一代放出了三份开放权重——2.4T 的 Max、27B 稠密模型与 Qwen4 结构预览 Flash-Next，三种许可各不相同；Flash-Next 还带来了这一代唯一的技术报告。

### 收尾

- [回顾：在证据不足时怎么判断一个模型](https://daiw.net/manual/qwen3-8-max/recap.md): 把 Qwen3.8-Max 的已知、可推断、未知三层收成一张表，对照权重公开前后、9 月核对前后的变化，并给出一套读厂商发布材料的通用方法。
