# 基准怎么读

> 发布期各来源的 Qwen3.8-Max 基准数字互相矛盾——这一章先把冲突原样摆出来，再用官方分数表定案、讲清读表时要打的折扣，最后看第三方评测与 9 月的 0902 快照。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.net/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max/benchmarks
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 基准怎么读

<Callout type="info">
  **本章在权重公开后补充过两次（2026 年 9 月 13 日、19 日）。** 原稿写于只有发布会图表的时候，两组二手数字互相矛盾。第一次补充用模型卡的分数表逐条核对；第二次补充找到了官方博客里的多模态分数表，订正了一处“无法核实”，并新增第三方评测与 0902 快照两节。前半部分保留原貌，因为“在冲突中怎么判断”本身就是这一章要讲的。
</Callout>

这一章和另外两个专栏的同名章节不一样。K3 与 V4-Flash 那边，数字来自技术报告与模型卡，可以直接引用；**这里的数字（初稿写作时）来自发布会图表与二手整理，且各来源互相矛盾。**

那就把矛盾原样摆出来。

## 两组互相冲突的数字

**来源 A** 给出的三项：

| 基准 | 分数 |
| --- | --- |
| PaperBench | 93.0 |
| IFBench | 82.8 |
| OSWorld-Verified | 86.1 |

**来源 B** 给出的三项：

| 基准 | 分数 |
| --- | --- |
| 编程类评测 | 93.0 |
| WideSearch | 81.9 |
| Agent's Last Exam | 52.4 |

<Callout type="warn">
  **两组数字对不上，但又有诡异的相似。** 93.0 在两边都出现，只是一边归给 PaperBench、一边归给“编程类评测”；82.8 与 81.9 也接近但不相等。

  最可能的解释是：**两边都在从同一张发布会图表里读数**，而那张图表的坐标轴、标签或分组被不同的人读出了不同结果。这在“只有图没有表”的发布材料里非常常见。

  **本专栏不替它们调和，也不选一个当真。** 在官方发布可复制的基准表之前，这些数字只能当作“量级参考”——大致在 80–93 这个区间，具体归属存疑。
</Callout>

## 定案：官方分数表给出的答案

官方博客文末有一张“完整性能结果”表（与后来的模型卡一致），另有一张多模态分数表；初稿写作时依据的是二手整理，没有用到它们。拿它们逐条核对：

| 原稿中的说法 | 官方分数表 | 结论 |
| --- | --- | --- |
| 来源 A：PaperBench 93.0 | PaperBench 93.0 | 对 |
| 来源 A：IFBench 82.8 | IFBench 82.8 | 对 |
| 来源 A：OSWorld-Verified 86.1 | 博客的多模态表：86.1 | 对（这一项要看屏幕，只适用于带视觉的 API 版） |
| 来源 B：“编程类评测”93.0 | 实为 PaperBench 93.0 | 标签错了 |
| 来源 B：WideSearch 81.9 | WideSearch 81.9 | 对 |
| 来源 B：Agent's Last Exam 52.4 | Agents' Last Exam：27.0 / 52.4（通过率 / 得分） | 对，但 52.4 是得分，不是通过率 |

原稿的解释站住了：**两边读的确实是同一套数字，冲突出在标签上。**“编程类评测 93.0”就是被贴错标签的 PaperBench。9 月 13 日那次补充把 OSWorld 一行记作“无法核实”，是因为只查了模型卡；它其实在博客的多模态表里——**查一手资料，也要查全。**

<Callout type="info">
  **还有一处容易被忽略：这两张表的列名都是“Qwen3.8-Max”，也就是 8 月 3 日的 API 版。** 模型卡没有单独给出开放权重 `Qwen3.8-2.4T-A95B` 的分数。API 版多了视觉、非思考模式和内置工具（见[架构那一章](https://daiw.net/manual/qwen3-8-max/architecture)），纯文本任务上两者应当接近，但**这是推断，不是官方口径**。

  官方自己的页面在这件事上也不严谨：百炼上托管开放权重版本的模型页，列出的“核心基准”里有 OSWorld 86.1 和 BabyVision 82.0——两项都要看图，而这个版本只收文本。
</Callout>

## 有一致口径的部分：它不是第一

发布期两个来源在一件事上是一致的，官方表也证实了：

- **Claude Fable 5 在 SWE-bench Pro（80.0 对 67.7）与 FrontierSWE（88.8 对 73.5）上领先**；
- **GPT-5.6 Sol 在 Terminal Bench 2.1 上领先**（88.8 对 86.6）；
- Qwen3.8-Max 在 **PaperBench（93.0）**、IFBench（82.8）、WideSearch（81.9）等项上领先。

把整张表数一遍更清楚。文本与 agent 部分共 31 行，Qwen3.8-Max 拿第一的只有 6 行——PaperBench、WideSearch、IFBench、HealthBench、PLawBench、PRBench-Finance，另有 PRBench-Legal 与人并列；**五项自家的内部文本基准（QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench）一项也没拿第一**。多模态表是另一幅景象：55 行里拿了 34 个第一（另有 1 个并列），但这部分只属于带视觉的 API 版。

这个“有赢有输”的格局比任何单项分数都有价值。**当一份材料承认自己在某些项上落后——甚至在自家考卷上落后——它在其余项上的说法可信度会上升。**

## 读这张官方表时要打的折扣

表格下方的脚注值得逐条读，它们本身就是一堂“怎么读基准”的课：

- **很多编程项是在 Claude Code 里跑的。** Terminal Bench 2.1、SWE-bench Pro、DeepSWE、NL2Repo-Bench、FrontierSWE 等都用了 Claude Code 作为测试框架；DeepSWE 取的是两种框架里的较高分，脚注还特意写道“Qwen3.8-Max 在 Claude Code 上表现最好”。
- **框架并不总是对齐。** WideSearch 上，对手用 Claude Code，Qwen 用自家的 Qwen-Agent；SkillsBench 上，Anthropic 的模型用 Claude Code、GPT 用 Codex、Qwen 用 OpenCode，而且全部是 Qwen 自己测的。反过来，办公类的三项做得比较规矩：博客的配图显示，CoWorkBench、WorkSpaceBench 的表内分数与对手同在 OpenClaw 上测得，JobBench 同在 OpenCode 上。
- **对手的分数不是同条件复测。** Terminal Bench 2.1 的对手分数取自各家“在所有框架里公开过的最好成绩”，FrontierSWE、MLS-Bench-Lite 等取自官方榜单——条件并不统一。
- **有的考卷改过。** SWE-bench Pro 的脚注写明“修正了存在问题的任务”，所有基线都在修正后的版本上重测；多模态表里 MathVision 与 CharXiv 的少量标准答案也做了人工修正。改得可能有道理，但这些分数就不能和别处公布的同名成绩直接比了。
- **五项是自家基准。** QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench 都是内部评测，外部无法复现。
- **部分项由其它模型打分。** PaperBench 由 Claude Opus 4.6 评判，`$OneMillion-Bench` 与 PLawBench 由 gemini-3.1-pro-preview 评判。
- **对手的结果有保留。** 脚注写明 Fable 5 的结果“可能涉及回退”（fallbacks）。

**以上全部属于官方口径，待独立验证。**

## 一个必须打的折扣：档位

[前面讲过](https://daiw.net/manual/qwen3-8-max/thinking-effort)，Qwen3.8 的思考档位**默认是最高档**（`xhigh`），API 版的默认思考预算高达 262,144 token。

评测通常在默认配置下进行。官方脚注写了超时和 `max_tokens`，没有写思考档位；按默认值推断：

> **这张表里的分数，大概率是在最高思考档位、允许长时间推理的条件下取得的。**

拿这个分数去和别家“默认模式”的分数比，**不是同一个成本量级的比较**。同样的道理反过来也成立——如果别家的分数也是在其最高档取得的，那就扯平了。

**这正是为什么“先问 harness”是读基准的第一条规矩**：不知道测试条件，分数就是无意义的数。

## 第三方评测：已经有了

初稿写的是“没有独立第三方评测”，原因之一是权重未发布。现在情况变了，但要分清**评的是哪个版本、用什么方法**：

| 评测方 | 时间 | 对象 | 结果 |
| --- | --- | --- | --- |
| Artificial Analysis 综合指数 | 8 月 6 日 | API 版（8 月） | **56**，与 Claude Opus 4.8（max）持平，比 Kimi K3（max）低 1 分，比 3.7-Max 高 10 分 |
| Artificial Analysis 的 GDPval-AA | 8 月 6 日 | API 版（8 月） | 1739 Elo，与 Claude Fable 5（1743）、GPT-5.6 Sol（1730）相当，低于 Claude Opus 5（1852） |
| Arena 的 Code Arena：WebDev | 9 月 2 日 | 0902 快照与原版 | 0902 以 1,691 分排第 1，比 Claude Opus 5（Max）高 3 分；原版 1,669 分 |
| Artificial Analysis 综合指数 v4.3 | 9 月 19 日查阅 | 0902 快照；开放权重版本 | 45；40（指数已换版，不能和 8 月的 56 直接比） |

几点读法：

- **第三方的定位与官方大体吻合**：8 月的独立综合评分把它放在 Opus 4.8、Kimi K3 那一档，和官方表“有赢有输”的格局一致。
- **第三方看到了官方表里没有的东西。** Artificial Analysis 的事实性测试（AA-Omniscience）掉了 10 分，原因是**幻觉率从 3.7-Max 的 23% 升到了 40%**；它还提醒，τ³-Bench 银行子项 42% 的成绩“像是分布外的异常值”。
- **Arena 是众包投票的偏好排名**，比的是网页开发成品的观感与可用性，不是正确率；3 分的差距很小，帖子里也没有给置信区间。
- **Artificial Analysis 单独评了开放权重版本**，在同一版指数下比 0902 快照低 5 分。但两者之间隔着 0902 的后训练与 API 版的额外能力，差距不能全算在“开放权重”头上。

至于拿开放权重自行部署、按官方表的设置逐项复现，本专栏目前**尚未看到**。建议的做法没变：看竞技场、各基准的官方榜单和独立评测机构的数据，**尤其留意在非 Claude Code 框架下的成绩**，那能看出上面第一条折扣到底有多大。

## 0902 快照：同一个名字，换了一个模型

9 月 2 日，Qwen 发布 **Qwen3.8-Max-0902**，官方说法是“在编程与办公上继续后训练”，价格不变；9 月 5 日起，百炼的 `qwen3.8-max` 接口自动指向它。官方帖子附了一张新表，节选如下（加粗为该行最高）：

| 基准 | 0902 | 原版 | Claude Opus 5 | Fable 5 | GPT-5.6 Sol |
| --- | --- | --- | --- | --- | --- |
| TerminalBench 3.0 | 29.0 | 11.3 | **42.7** | 34.0 | 34.6 |
| DeepSWE 1.1 | 69.3 | 56.6 | **73.6** | 69.7 | 72.7 |
| ProgramBench（Almost Solved） | 28.0 | 10.5 | **41.5** | 33.0 | 23.0 |
| MLS-Bench-Lite | **50.1** | 41.0 | 49.8 | 49.9 | 46.2 |
| SWE-Atlas QnA | **66.3** | 60.3 | 63.2 | 39.0 | 46.0 |
| QwenSWEBench V2（内部） | **70.0** | 55.1 | 68.0 | 67.1 | —— |
| CoWorkBench（内部） | 76.1 | 74.8 | **79.6** | 75.9 | 71.5 |
| JobBench | 64.0 | 53.4 | **67.8** | 57.4 | 45.4 |
| WorkArena（内部人评，Elo） | 1468 | 1348 | 1437 | —— | **1482** |

这张表要这样读：

- **相对原版，编程类涨幅很大**（TerminalBench 3.0 从 11.3 到 29.0，ProgramBench 从 10.5 到 28.0）；**但对手换成了 Claude Opus 5**（8 月的表里比的是 Opus 4.8），0902 在多数编程与 agent 项上仍落后于它，领先的几项里有两项是内部基准或内部人评。
- **考卷也换了版本。** TerminalBench 3.0、Automation Bench v1.0.6 与 8 月表里的同名考卷不是一个版本，数字不能跨表比较。
- **最重要的一点：模型卡上的分数，已经不是你现在调用 `qwen3.8-max` 拿到的那个模型的分数**；而 Hugging Face 上的开放权重对应的是 8 月的原版，0902 没有开放权重。

以上仍是官方口径，待独立验证。

## 给使用者的实际建议

在证据充分之前，判断“要不要用它”可以绕开基准：

1. **拿你自己的十条真实样例去测。** 花不了多少钱，比任何榜单都准。
2. **重点测长时程场景**——这是它主打的方向，也是差异最可能体现的地方。
3. **同时测成本**——把思考档位调到最低和默认各跑一遍，看质量差多少、账单差多少。这个比值决定了它在你场景里的实际性价比；第三方测得它每个任务的花费是上一代的两倍多，别只看单价。
4. **固定版本号。** 需要可复现的结果，就调用 `qwen3.8-max-0902` 这类带日期的快照名，而不是会被自动升级的 `qwen3.8-max`。
5. **和 [V4-Flash](https://daiw.net/manual/deepseek-v4-flash) 对比一次。** 8 月时是 \$2/\$6 对 \$0.14/\$0.28，差 20 倍；DeepSeek 的 Flash 线 9 月已换成 V4.1-Flash、改为峰谷计价，按输出价算差距缩小到五到十倍，仍然足以压倒大多数基准优势——前提是 Flash 在你的任务上够用。

下一章看那个承诺是怎么兑现的。👉 [开源承诺的成色](https://daiw.net/manual/qwen3-8-max/open-weights)

## 参考文献

- [1] DataLearner 模型库 [Qwen3.8-Max](https://www.datalearner.com/ai-models/pretrained-models/qwen3-8-max) —— 来源 B 的数字（二手）。
- [2] 第三方发布报道与分析（2026-08）—— 来源 A 的数字，以及“官方图表未列具体分数”的观察（二手，待核）。
- [3] Qwen Team. “[Qwen3.8-Max：编程与办公，全面跃升](https://qwen.ai/blog?id=qwen3.8).” 2026-08-03 —— “完整性能结果”表、多模态表与脚注，跨 harness 配图。
- [4] Qwen Team. [Qwen3.8-2.4T-A95B 模型卡](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B)，2026-08 —— 官方分数表与评测脚注。
- [5] 阿里云百炼. [qwen3.8-2.4t-a95b 模型页](https://help.aliyun.com/zh/model-studio/qwen3-8-2-4t-a95b)，2026-09-19 查阅 —— 开放权重版本的“核心基准”描述。
- [6] Artificial Analysis. [Qwen3.8 Max 评测帖子](https://x.com/ArtificialAnlys/status/2085270415614828675)，2026-08-06；模型页 [Qwen3.8 Max (0902)](https://artificialanalysis.ai/models/qwen3-8-max) 与 [Qwen3.8 2.4T A95B](https://artificialanalysis.ai/models/qwen3-8-2-4t-a95b)，2026-09-19 查阅（Intelligence Index v4.3）。
- [7] Arena. [Code Arena：WebDev 榜单帖子](https://x.com/arena/status/2094974637704913198)，2026-09-02。
- [8] Qwen 官方 X 帖子. [Qwen3.8-Max-0902 发布](https://x.com/Alibaba_Qwen/status/2094968708288680276)，2026-09-02 —— 0902 分数表与脚注。
- [9] 阿里云. “[Model Studio Update Notice for Qwen3.8-Max Models](https://www.alibabacloud.com/en/notice/model_studio_update_notice_for_qwen38max_models_863).” —— 9 月 5 日起 `qwen3.8-max` 指向 0902。
