# 回顾：在证据不足时怎么判断一个模型

> 把 Qwen3.8-Max 的已知、可推断、未知三层收成一张表，对照权重公开前后、9 月核对前后的变化，并给出一套读厂商发布材料的通用方法。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.net/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max/recap
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 回顾：在证据不足时怎么判断一个模型

这个专栏写作时和另外两个不同——**它没能把模型拆开**，因为可拆的材料还不存在。权重公开后，模型卡与配置文件补上了架构的空白；9 月回到一手出处逐条核对，又订正了几处当初沿用二手资料的说法。所以这一章收束的不只是 Qwen3.8-Max，还有“**证据从无到有时，判断该怎么走**”。

## 三层收束

**已知（有公开来源，可引用）**

| 项目 | 内容 |
| --- | --- |
| 规格 | 2.4T / 95B 激活；92 层、隐藏维度 8192；512 个专家选 10，外加 1 个共享专家；Gated DeltaNet 与门控注意力 3:1 混排 |
| 上下文与思考上限 | API 版上下文 1M、最大思维链 262,144、最大输出 131,072；开放权重原生 256K，可外推到约 1M |
| 产品形态 | 三档 `low` / `medium` / `xhigh`，默认最高；开放权重必须思考，API 版支持非思考模式 |
| 定价 | \$2 / \$6（国际），￥12 / ￥36（国内）；0902 快照同价 |
| 训练侧 | 组合式扩展 RL 环境、统一奖励（可执行校验 + rubric + agentic 检查）、在线数据均衡；一条环境数与分数的曲线，最佳检查点在 4,000 处（官方博客） |
| 开源 | 8 月 9 日上传、12 日公开；许可有条件商用，大体量的直接竞争者需另行授权 |
| 版本 | 9 月 5 日起 `qwen3.8-max` 指向继续后训练的 0902 快照；开放权重仍是 8 月版 |
| 时间线 | 07-19 预览 → 08-03 正式发布 → 08-12 权重公开 → 08-14 官宣（连同 27B）→ 09-02 0902 快照 |
| 第三方评测 | Artificial Analysis 8 月的综合指数 56（与 Opus 4.8 持平），同时测出幻觉率上升；Arena 的 WebDev 榜上 0902 排第 1 |

**可推断（本专栏的分析，非官方）**

- 激活率约 3.9%，**在同代同规模里偏保守**——配置证实了这一点；但初稿由此推出的“专家更少更大”是错的，实际是 512 个小专家（见[架构拆解](https://daiw.net/manual/qwen3-8-max/architecture)）。
- 按配置估算，95B 激活参数里约**四成在注意力层**，专家只占一半多一点。
- 官方分数表**大概率取自最高思考档位**，且多项是在 Claude Code 框架里测得的，跨模型比较时要打折。
- **API 与开放权重正在分叉**：先是能力（视觉、非思考、内置工具），再是版本（0902 没有开放权重）。

**未知（无公开来源）**

预训练 token 数与数据构成、训练精度、优化器、强化学习的规模与构成、0902 快照具体改了什么——**仍然空白**。Max 本身的技术报告至今没有发布；这一代唯一的技术报告属于 [Flash-Next](https://daiw.net/manual/qwen3-8-max/qwen38-family)。

## 三个专栏并排看

写完这三个专栏，同代三家的性格已经很清楚：

| | **Kimi K3** | **DeepSeek V4-Flash** | **Qwen3.8-Max** |
| --- | --- | --- | --- |
| 规模 | 2.8T / 104B | 284B / 13B | 2.4T / 95B |
| 押注 | 长上下文**效率**（线性化） | 长上下文**效率**（压缩）+ **可部署性** | **长时程自主任务** |
| 透明度 | 技术报告 + 模型卡 + 权重 | 论文 + 模型卡 + 权重 | 模型卡 + 配置 + 权重，**无技术报告** |
| 许可 | 自订，有营收门槛 | **MIT** | 自订，有营收与业务门槛 |
| 输出价（8 月） | \$15 | **\$0.28** | \$6 |
| 能拆到多深 | **很深** | **很深** | **能拆架构，拆不了训练** |

Qwen 这一列在专栏写作期间变化最大：从“拆不了”变成了“能拆一半”。**能拆多深，取决于厂商放不放材料，与模型本身好不好无关**——而材料是会随时间补齐的。

<Callout type="info">
  这一点值得所有读技术内容的人记住：**你能读到的深度分析，永远只覆盖那些愿意公开的模型。** 这会造成一种系统性偏差——开放的模型被反复分析、被充分讨论；闭源的模型只有跑分和口碑。

  **不要把“分析得多”误当成“做得好”。** 反过来也一样：材料少不代表模型差，只代表它（暂时）选择了不公开。
</Callout>

## 一套读发布材料的方法

把这个专栏里反复用到的判断标准整理成一份清单，下次读任何模型发布时都能用：

**一、先分清三类陈述。**

| 类型 | 例子 | 怎么对待 |
| --- | --- | --- |
| **可核验事实** | 参数量、定价、上下文长度 | 直接采信（但注明来源） |
| **可量化但无基线的宣称** | “门数从 8298 降到 678” | 问基线是什么 |
| **不可验证的演示** | “365 天模拟赚了 4 倍” | 只当作“做过这件事” |

这张表里的两个例子，后来都有了下文：芯片设计的基线是模型自己的初版，电商模拟的环境开源了、完整排行也公布了。**分类不是定论，而是告诉你该去找什么证据。**

**二、优先看“怎么做到的”，而不是“做到了什么”。**
训练侧的方法描述比五个长时程演示更有信息量——**方法比成果更难编。**

**三、留意它承认了什么。**
一份承认自己在某些项上落后的材料，其余部分更可信。全面碾压的材料反而要小心。

**四、区分“延期”和“不提了”。**
承诺没兑现时，看厂商是给出新时间表，还是悄悄从材料里删掉。Qwen3.8 这次属于第三种情况：按期兑现，还多放了一个。

**五、给时间。**
发布后两三周，第三方评测、独立复现、社区实测会陆续出现。**在那之前的所有判断都是暂定的**——包括这个专栏里的。这个专栏本身就是例子：写作时空白的规格表，六天后就被配置文件填上了；第三方的独立评测，三天后就来了。

**六、推断要分层，答案出来后回头对照。**
把判断分成算术推论、横向定位、机制推断三层，并事先标明各自的可信度。本专栏的推断在权重公开后被逐条核对：算术和定位都对了，错的那条正好落在标为“低可信度”的机制推断里。**分层的价值不是保证不犯错，而是让错误落在事先标好“不可靠”的地方。**

**七、回到原始出处，留意被省略的限定词。**
这个专栏在 9 月的核对里栽过三次跟头，每一次都出在“转述”上：“训练跨 4,000 个 RL 环境”其实是一张图上最佳检查点的横坐标；“365 天模拟胜出、第二名 GLM 5.2”在论文里的原话是“**在开放权重模型中**领先”，所有模型一起排，它前面还有四个闭源模型；“OSWorld 86.1 无法核实”只是因为没翻到博客的多模态表。**二手资料最常丢的不是数字，是数字旁边的那半句话。**

**八、API 名字是移动靶。**
`qwen3.8-max` 在 9 月 5 日自动换成了 0902 快照：模型卡上的分数、开放权重、你今天调用到的模型，已经是三样东西。引用分数时写清版本，做产品时锁定带日期的快照名。

## 本专栏的更新记录

**2026 年 9 月 13 日**，按写作时的承诺完成了三项更新：

1. 补写了[架构拆解](https://daiw.net/manual/qwen3-8-max/architecture)一章（层数、专家、注意力设计，都从配置文件读出）；
2. 填上了[规格总表](https://daiw.net/manual/qwen3-8-max/spec-sheet)里那张“未公开清单”；
3. 更新了[开源那一章](https://daiw.net/manual/qwen3-8-max/open-weights)的许可评估。

同时修订了[思考档位](https://daiw.net/manual/qwen3-8-max/thinking-effort)与[基准](https://daiw.net/manual/qwen3-8-max/benchmarks)两章。

**2026 年 9 月 19 日**，回到一手出处逐条核对，做了第二轮更新：

1. 订正权重的公开日期（8 月 9 日是上传，12 日才公开）、API 的上下文与默认思考预算（1,000,000 与 262,144）、Flash-Next 的发布日期（8 月 26 日）；
2. 重写了[长时程](https://daiw.net/manual/qwen3-8-max/long-horizon)与 [RL 环境](https://daiw.net/manual/qwen3-8-max/rl-environments)两章：oh-my-cli 的轨迹与 E-Commerce Bench 已经公开，“4,000”出自一张图；
3. [基准](https://daiw.net/manual/qwen3-8-max/benchmarks)一章补上多模态表、第三方评测与 0902 快照；
4. 新增[同期开放的 27B 与 Flash-Next](https://daiw.net/manual/qwen3-8-max/qwen38-family)一章。

仍待更新的是训练侧：如果官方发布 Qwen3.8-Max 的技术报告，本专栏会补上。

## 接着读什么

- [《Kimi K3 深度解析》](https://daiw.net/manual/kimi-k3) —— 材料充分时，一个模型能被拆到多细。
- [《DeepSeek V4 Flash 深度解析》](https://daiw.net/manual/deepseek-v4-flash) —— 另一条长上下文路线，且是三者里最能自己跑起来的一个。
- [《AI 大模型解构》](https://daiw.net/manual/llm-anatomy) —— 上一代架构的系统梳理。

## 参考文献

- [1] Qwen Team. “[Qwen3.8-Max：编程与办公，全面跃升](https://qwen.ai/blog?id=qwen3.8).” 2026-08-03。
- [2] Qwen Team. [Qwen3.8-2.4T-A95B 模型卡](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B)、`config.json` 与 LICENSE，2026-08；Hugging Face 上的提交与讨论记录。
- [3] 阿里云百炼. [qwen3.8-max 模型页](https://help.aliyun.com/zh/model-studio/qwen3-8-max)，2026-09-19 查阅；阿里云关于 0902 快照的[更新公告](https://www.alibabacloud.com/en/notice/model_studio_update_notice_for_qwen38max_models_863)。
- [4] Wei Fan, et al. “E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation.” 2026-08-31. [arXiv:2608.30730](https://arxiv.org/abs/2608.30730)。
- [5] Artificial Analysis. [Qwen3.8 Max 评测帖子](https://x.com/ArtificialAnlys/status/2085270415614828675)，2026-08-06；Arena. [Code Arena：WebDev 榜单帖子](https://x.com/arena/status/2094974637704913198)，2026-09-02。
- [6] DataLearner 模型库 [Qwen3.8-Max](https://www.datalearner.com/ai-models/pretrained-models/qwen3-8-max) 与第三方报道、分析（2026-08）—— 初稿依据的二手资料（待核，多数已被一手材料取代）。
