基准怎么读
发布期各来源的 Qwen3.8-Max 基准数字互相矛盾——这一章先把冲突原样摆出来,再用官方分数表定案、讲清读表时要打的折扣,最后看第三方评测与 9 月的 0902 快照。
基准怎么读
本章在权重公开后补充过两次(2026 年 9 月 13 日、19 日)。 原稿写于只有发布会图表的时候,两组二手数字互相矛盾。第一次补充用模型卡的分数表逐条核对;第二次补充找到了官方博客里的多模态分数表,订正了一处“无法核实”,并新增第三方评测与 0902 快照两节。前半部分保留原貌,因为“在冲突中怎么判断”本身就是这一章要讲的。
这一章和另外两个专栏的同名章节不一样。K3 与 V4-Flash 那边,数字来自技术报告与模型卡,可以直接引用;这里的数字(初稿写作时)来自发布会图表与二手整理,且各来源互相矛盾。
那就把矛盾原样摆出来。
两组互相冲突的数字
来源 A 给出的三项:
| 基准 | 分数 |
|---|---|
| PaperBench | 93.0 |
| IFBench | 82.8 |
| OSWorld-Verified | 86.1 |
来源 B 给出的三项:
| 基准 | 分数 |
|---|---|
| 编程类评测 | 93.0 |
| WideSearch | 81.9 |
| Agent's Last Exam | 52.4 |
两组数字对不上,但又有诡异的相似。 93.0 在两边都出现,只是一边归给 PaperBench、一边归给“编程类评测”;82.8 与 81.9 也接近但不相等。
最可能的解释是:两边都在从同一张发布会图表里读数,而那张图表的坐标轴、标签或分组被不同的人读出了不同结果。这在“只有图没有表”的发布材料里非常常见。
本专栏不替它们调和,也不选一个当真。 在官方发布可复制的基准表之前,这些数字只能当作“量级参考”——大致在 80–93 这个区间,具体归属存疑。
定案:官方分数表给出的答案
官方博客文末有一张“完整性能结果”表(与后来的模型卡一致),另有一张多模态分数表;初稿写作时依据的是二手整理,没有用到它们。拿它们逐条核对:
| 原稿中的说法 | 官方分数表 | 结论 |
|---|---|---|
| 来源 A:PaperBench 93.0 | PaperBench 93.0 | 对 |
| 来源 A:IFBench 82.8 | IFBench 82.8 | 对 |
| 来源 A:OSWorld-Verified 86.1 | 博客的多模态表:86.1 | 对(这一项要看屏幕,只适用于带视觉的 API 版) |
| 来源 B:“编程类评测”93.0 | 实为 PaperBench 93.0 | 标签错了 |
| 来源 B:WideSearch 81.9 | WideSearch 81.9 | 对 |
| 来源 B:Agent's Last Exam 52.4 | Agents' Last Exam:27.0 / 52.4(通过率 / 得分) | 对,但 52.4 是得分,不是通过率 |
原稿的解释站住了:两边读的确实是同一套数字,冲突出在标签上。“编程类评测 93.0”就是被贴错标签的 PaperBench。9 月 13 日那次补充把 OSWorld 一行记作“无法核实”,是因为只查了模型卡;它其实在博客的多模态表里——查一手资料,也要查全。
还有一处容易被忽略:这两张表的列名都是“Qwen3.8-Max”,也就是 8 月 3 日的 API 版。 模型卡没有单独给出开放权重 Qwen3.8-2.4T-A95B 的分数。API 版多了视觉、非思考模式和内置工具(见架构那一章),纯文本任务上两者应当接近,但这是推断,不是官方口径。
官方自己的页面在这件事上也不严谨:百炼上托管开放权重版本的模型页,列出的“核心基准”里有 OSWorld 86.1 和 BabyVision 82.0——两项都要看图,而这个版本只收文本。
有一致口径的部分:它不是第一
发布期两个来源在一件事上是一致的,官方表也证实了:
- Claude Fable 5 在 SWE-bench Pro(80.0 对 67.7)与 FrontierSWE(88.8 对 73.5)上领先;
- GPT-5.6 Sol 在 Terminal Bench 2.1 上领先(88.8 对 86.6);
- Qwen3.8-Max 在 PaperBench(93.0)、IFBench(82.8)、WideSearch(81.9)等项上领先。
把整张表数一遍更清楚。文本与 agent 部分共 31 行,Qwen3.8-Max 拿第一的只有 6 行——PaperBench、WideSearch、IFBench、HealthBench、PLawBench、PRBench-Finance,另有 PRBench-Legal 与人并列;五项自家的内部文本基准(QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench)一项也没拿第一。多模态表是另一幅景象:55 行里拿了 34 个第一(另有 1 个并列),但这部分只属于带视觉的 API 版。
这个“有赢有输”的格局比任何单项分数都有价值。当一份材料承认自己在某些项上落后——甚至在自家考卷上落后——它在其余项上的说法可信度会上升。
读这张官方表时要打的折扣
表格下方的脚注值得逐条读,它们本身就是一堂“怎么读基准”的课:
- 很多编程项是在 Claude Code 里跑的。 Terminal Bench 2.1、SWE-bench Pro、DeepSWE、NL2Repo-Bench、FrontierSWE 等都用了 Claude Code 作为测试框架;DeepSWE 取的是两种框架里的较高分,脚注还特意写道“Qwen3.8-Max 在 Claude Code 上表现最好”。
- 框架并不总是对齐。 WideSearch 上,对手用 Claude Code,Qwen 用自家的 Qwen-Agent;SkillsBench 上,Anthropic 的模型用 Claude Code、GPT 用 Codex、Qwen 用 OpenCode,而且全部是 Qwen 自己测的。反过来,办公类的三项做得比较规矩:博客的配图显示,CoWorkBench、WorkSpaceBench 的表内分数与对手同在 OpenClaw 上测得,JobBench 同在 OpenCode 上。
- 对手的分数不是同条件复测。 Terminal Bench 2.1 的对手分数取自各家“在所有框架里公开过的最好成绩”,FrontierSWE、MLS-Bench-Lite 等取自官方榜单——条件并不统一。
- 有的考卷改过。 SWE-bench Pro 的脚注写明“修正了存在问题的任务”,所有基线都在修正后的版本上重测;多模态表里 MathVision 与 CharXiv 的少量标准答案也做了人工修正。改得可能有道理,但这些分数就不能和别处公布的同名成绩直接比了。
- 五项是自家基准。 QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench 都是内部评测,外部无法复现。
- 部分项由其它模型打分。 PaperBench 由 Claude Opus 4.6 评判,
$OneMillion-Bench与 PLawBench 由 gemini-3.1-pro-preview 评判。 - 对手的结果有保留。 脚注写明 Fable 5 的结果“可能涉及回退”(fallbacks)。
以上全部属于官方口径,待独立验证。
一个必须打的折扣:档位
前面讲过,Qwen3.8 的思考档位默认是最高档(xhigh),API 版的默认思考预算高达 262,144 token。
评测通常在默认配置下进行。官方脚注写了超时和 max_tokens,没有写思考档位;按默认值推断:
这张表里的分数,大概率是在最高思考档位、允许长时间推理的条件下取得的。
拿这个分数去和别家“默认模式”的分数比,不是同一个成本量级的比较。同样的道理反过来也成立——如果别家的分数也是在其最高档取得的,那就扯平了。
这正是为什么“先问 harness”是读基准的第一条规矩:不知道测试条件,分数就是无意义的数。
第三方评测:已经有了
初稿写的是“没有独立第三方评测”,原因之一是权重未发布。现在情况变了,但要分清评的是哪个版本、用什么方法:
| 评测方 | 时间 | 对象 | 结果 |
|---|---|---|---|
| Artificial Analysis 综合指数 | 8 月 6 日 | API 版(8 月) | 56,与 Claude Opus 4.8(max)持平,比 Kimi K3(max)低 1 分,比 3.7-Max 高 10 分 |
| Artificial Analysis 的 GDPval-AA | 8 月 6 日 | API 版(8 月) | 1739 Elo,与 Claude Fable 5(1743)、GPT-5.6 Sol(1730)相当,低于 Claude Opus 5(1852) |
| Arena 的 Code Arena:WebDev | 9 月 2 日 | 0902 快照与原版 | 0902 以 1,691 分排第 1,比 Claude Opus 5(Max)高 3 分;原版 1,669 分 |
| Artificial Analysis 综合指数 v4.3 | 9 月 19 日查阅 | 0902 快照;开放权重版本 | 45;40(指数已换版,不能和 8 月的 56 直接比) |
几点读法:
- 第三方的定位与官方大体吻合:8 月的独立综合评分把它放在 Opus 4.8、Kimi K3 那一档,和官方表“有赢有输”的格局一致。
- 第三方看到了官方表里没有的东西。 Artificial Analysis 的事实性测试(AA-Omniscience)掉了 10 分,原因是幻觉率从 3.7-Max 的 23% 升到了 40%;它还提醒,τ³-Bench 银行子项 42% 的成绩“像是分布外的异常值”。
- Arena 是众包投票的偏好排名,比的是网页开发成品的观感与可用性,不是正确率;3 分的差距很小,帖子里也没有给置信区间。
- Artificial Analysis 单独评了开放权重版本,在同一版指数下比 0902 快照低 5 分。但两者之间隔着 0902 的后训练与 API 版的额外能力,差距不能全算在“开放权重”头上。
至于拿开放权重自行部署、按官方表的设置逐项复现,本专栏目前尚未看到。建议的做法没变:看竞技场、各基准的官方榜单和独立评测机构的数据,尤其留意在非 Claude Code 框架下的成绩,那能看出上面第一条折扣到底有多大。
0902 快照:同一个名字,换了一个模型
9 月 2 日,Qwen 发布 Qwen3.8-Max-0902,官方说法是“在编程与办公上继续后训练”,价格不变;9 月 5 日起,百炼的 qwen3.8-max 接口自动指向它。官方帖子附了一张新表,节选如下(加粗为该行最高):
| 基准 | 0902 | 原版 | Claude Opus 5 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| TerminalBench 3.0 | 29.0 | 11.3 | 42.7 | 34.0 | 34.6 |
| DeepSWE 1.1 | 69.3 | 56.6 | 73.6 | 69.7 | 72.7 |
| ProgramBench(Almost Solved) | 28.0 | 10.5 | 41.5 | 33.0 | 23.0 |
| MLS-Bench-Lite | 50.1 | 41.0 | 49.8 | 49.9 | 46.2 |
| SWE-Atlas QnA | 66.3 | 60.3 | 63.2 | 39.0 | 46.0 |
| QwenSWEBench V2(内部) | 70.0 | 55.1 | 68.0 | 67.1 | —— |
| CoWorkBench(内部) | 76.1 | 74.8 | 79.6 | 75.9 | 71.5 |
| JobBench | 64.0 | 53.4 | 67.8 | 57.4 | 45.4 |
| WorkArena(内部人评,Elo) | 1468 | 1348 | 1437 | —— | 1482 |
这张表要这样读:
- 相对原版,编程类涨幅很大(TerminalBench 3.0 从 11.3 到 29.0,ProgramBench 从 10.5 到 28.0);但对手换成了 Claude Opus 5(8 月的表里比的是 Opus 4.8),0902 在多数编程与 agent 项上仍落后于它,领先的几项里有两项是内部基准或内部人评。
- 考卷也换了版本。 TerminalBench 3.0、Automation Bench v1.0.6 与 8 月表里的同名考卷不是一个版本,数字不能跨表比较。
- 最重要的一点:模型卡上的分数,已经不是你现在调用
qwen3.8-max拿到的那个模型的分数;而 Hugging Face 上的开放权重对应的是 8 月的原版,0902 没有开放权重。
以上仍是官方口径,待独立验证。
给使用者的实际建议
在证据充分之前,判断“要不要用它”可以绕开基准:
- 拿你自己的十条真实样例去测。 花不了多少钱,比任何榜单都准。
- 重点测长时程场景——这是它主打的方向,也是差异最可能体现的地方。
- 同时测成本——把思考档位调到最低和默认各跑一遍,看质量差多少、账单差多少。这个比值决定了它在你场景里的实际性价比;第三方测得它每个任务的花费是上一代的两倍多,别只看单价。
- 固定版本号。 需要可复现的结果,就调用
qwen3.8-max-0902这类带日期的快照名,而不是会被自动升级的qwen3.8-max。 - 和 V4-Flash 对比一次。 8 月时是 $2/$6 对 $0.14/$0.28,差 20 倍;DeepSeek 的 Flash 线 9 月已换成 V4.1-Flash、改为峰谷计价,按输出价算差距缩小到五到十倍,仍然足以压倒大多数基准优势——前提是 Flash 在你的任务上够用。
下一章看那个承诺是怎么兑现的。👉 开源承诺的成色
参考文献
- [1] DataLearner 模型库 Qwen3.8-Max —— 来源 B 的数字(二手)。
- [2] 第三方发布报道与分析(2026-08)—— 来源 A 的数字,以及“官方图表未列具体分数”的观察(二手,待核)。
- [3] Qwen Team. “Qwen3.8-Max:编程与办公,全面跃升.” 2026-08-03 —— “完整性能结果”表、多模态表与脚注,跨 harness 配图。
- [4] Qwen Team. Qwen3.8-2.4T-A95B 模型卡,2026-08 —— 官方分数表与评测脚注。
- [5] 阿里云百炼. qwen3.8-2.4t-a95b 模型页,2026-09-19 查阅 —— 开放权重版本的“核心基准”描述。
- [6] Artificial Analysis. Qwen3.8 Max 评测帖子,2026-08-06;模型页 Qwen3.8 Max (0902) 与 Qwen3.8 2.4T A95B,2026-09-19 查阅(Intelligence Index v4.3)。
- [7] Arena. Code Arena:WebDev 榜单帖子,2026-09-02。
- [8] Qwen 官方 X 帖子. Qwen3.8-Max-0902 发布,2026-09-02 —— 0902 分数表与脚注。
- [9] 阿里云. “Model Studio Update Notice for Qwen3.8-Max Models.” —— 9 月 5 日起
qwen3.8-max指向 0902。