基准怎么读

发布期各来源的 Qwen3.8-Max 基准数字互相矛盾——这一章先把冲突原样摆出来,再用官方分数表定案、讲清读表时要打的折扣,最后看第三方评测与 9 月的 0902 快照。

作者 David更新于 8 篇(共 11 篇)

基准怎么读

本章在权重公开后补充过两次(2026 年 9 月 13 日、19 日)。 原稿写于只有发布会图表的时候,两组二手数字互相矛盾。第一次补充用模型卡的分数表逐条核对;第二次补充找到了官方博客里的多模态分数表,订正了一处“无法核实”,并新增第三方评测与 0902 快照两节。前半部分保留原貌,因为“在冲突中怎么判断”本身就是这一章要讲的。

这一章和另外两个专栏的同名章节不一样。K3 与 V4-Flash 那边,数字来自技术报告与模型卡,可以直接引用;这里的数字(初稿写作时)来自发布会图表与二手整理,且各来源互相矛盾。

那就把矛盾原样摆出来。

两组互相冲突的数字

来源 A 给出的三项:

基准分数
PaperBench93.0
IFBench82.8
OSWorld-Verified86.1

来源 B 给出的三项:

基准分数
编程类评测93.0
WideSearch81.9
Agent's Last Exam52.4

两组数字对不上,但又有诡异的相似。 93.0 在两边都出现,只是一边归给 PaperBench、一边归给“编程类评测”;82.8 与 81.9 也接近但不相等。

最可能的解释是:两边都在从同一张发布会图表里读数,而那张图表的坐标轴、标签或分组被不同的人读出了不同结果。这在“只有图没有表”的发布材料里非常常见。

本专栏不替它们调和,也不选一个当真。 在官方发布可复制的基准表之前,这些数字只能当作“量级参考”——大致在 80–93 这个区间,具体归属存疑。

定案:官方分数表给出的答案

官方博客文末有一张“完整性能结果”表(与后来的模型卡一致),另有一张多模态分数表;初稿写作时依据的是二手整理,没有用到它们。拿它们逐条核对:

原稿中的说法官方分数表结论
来源 A:PaperBench 93.0PaperBench 93.0
来源 A:IFBench 82.8IFBench 82.8
来源 A:OSWorld-Verified 86.1博客的多模态表:86.1对(这一项要看屏幕,只适用于带视觉的 API 版)
来源 B:“编程类评测”93.0实为 PaperBench 93.0标签错了
来源 B:WideSearch 81.9WideSearch 81.9
来源 B:Agent's Last Exam 52.4Agents' Last Exam:27.0 / 52.4(通过率 / 得分)对,但 52.4 是得分,不是通过率

原稿的解释站住了:两边读的确实是同一套数字,冲突出在标签上。“编程类评测 93.0”就是被贴错标签的 PaperBench。9 月 13 日那次补充把 OSWorld 一行记作“无法核实”,是因为只查了模型卡;它其实在博客的多模态表里——查一手资料,也要查全。

还有一处容易被忽略:这两张表的列名都是“Qwen3.8-Max”,也就是 8 月 3 日的 API 版。 模型卡没有单独给出开放权重 Qwen3.8-2.4T-A95B 的分数。API 版多了视觉、非思考模式和内置工具(见架构那一章),纯文本任务上两者应当接近,但这是推断,不是官方口径

官方自己的页面在这件事上也不严谨:百炼上托管开放权重版本的模型页,列出的“核心基准”里有 OSWorld 86.1 和 BabyVision 82.0——两项都要看图,而这个版本只收文本。

有一致口径的部分:它不是第一

发布期两个来源在一件事上是一致的,官方表也证实了:

  • Claude Fable 5 在 SWE-bench Pro(80.0 对 67.7)与 FrontierSWE(88.8 对 73.5)上领先
  • GPT-5.6 Sol 在 Terminal Bench 2.1 上领先(88.8 对 86.6);
  • Qwen3.8-Max 在 PaperBench(93.0)、IFBench(82.8)、WideSearch(81.9)等项上领先。

把整张表数一遍更清楚。文本与 agent 部分共 31 行,Qwen3.8-Max 拿第一的只有 6 行——PaperBench、WideSearch、IFBench、HealthBench、PLawBench、PRBench-Finance,另有 PRBench-Legal 与人并列;五项自家的内部文本基准(QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench)一项也没拿第一。多模态表是另一幅景象:55 行里拿了 34 个第一(另有 1 个并列),但这部分只属于带视觉的 API 版。

这个“有赢有输”的格局比任何单项分数都有价值。当一份材料承认自己在某些项上落后——甚至在自家考卷上落后——它在其余项上的说法可信度会上升。

读这张官方表时要打的折扣

表格下方的脚注值得逐条读,它们本身就是一堂“怎么读基准”的课:

  • 很多编程项是在 Claude Code 里跑的。 Terminal Bench 2.1、SWE-bench Pro、DeepSWE、NL2Repo-Bench、FrontierSWE 等都用了 Claude Code 作为测试框架;DeepSWE 取的是两种框架里的较高分,脚注还特意写道“Qwen3.8-Max 在 Claude Code 上表现最好”。
  • 框架并不总是对齐。 WideSearch 上,对手用 Claude Code,Qwen 用自家的 Qwen-Agent;SkillsBench 上,Anthropic 的模型用 Claude Code、GPT 用 Codex、Qwen 用 OpenCode,而且全部是 Qwen 自己测的。反过来,办公类的三项做得比较规矩:博客的配图显示,CoWorkBench、WorkSpaceBench 的表内分数与对手同在 OpenClaw 上测得,JobBench 同在 OpenCode 上。
  • 对手的分数不是同条件复测。 Terminal Bench 2.1 的对手分数取自各家“在所有框架里公开过的最好成绩”,FrontierSWE、MLS-Bench-Lite 等取自官方榜单——条件并不统一。
  • 有的考卷改过。 SWE-bench Pro 的脚注写明“修正了存在问题的任务”,所有基线都在修正后的版本上重测;多模态表里 MathVision 与 CharXiv 的少量标准答案也做了人工修正。改得可能有道理,但这些分数就不能和别处公布的同名成绩直接比了。
  • 五项是自家基准。 QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench 都是内部评测,外部无法复现。
  • 部分项由其它模型打分。 PaperBench 由 Claude Opus 4.6 评判,$OneMillion-Bench 与 PLawBench 由 gemini-3.1-pro-preview 评判。
  • 对手的结果有保留。 脚注写明 Fable 5 的结果“可能涉及回退”(fallbacks)。

以上全部属于官方口径,待独立验证。

一个必须打的折扣:档位

前面讲过,Qwen3.8 的思考档位默认是最高档xhigh),API 版的默认思考预算高达 262,144 token。

评测通常在默认配置下进行。官方脚注写了超时和 max_tokens,没有写思考档位;按默认值推断:

这张表里的分数,大概率是在最高思考档位、允许长时间推理的条件下取得的。

拿这个分数去和别家“默认模式”的分数比,不是同一个成本量级的比较。同样的道理反过来也成立——如果别家的分数也是在其最高档取得的,那就扯平了。

这正是为什么“先问 harness”是读基准的第一条规矩:不知道测试条件,分数就是无意义的数。

第三方评测:已经有了

初稿写的是“没有独立第三方评测”,原因之一是权重未发布。现在情况变了,但要分清评的是哪个版本、用什么方法

评测方时间对象结果
Artificial Analysis 综合指数8 月 6 日API 版(8 月)56,与 Claude Opus 4.8(max)持平,比 Kimi K3(max)低 1 分,比 3.7-Max 高 10 分
Artificial Analysis 的 GDPval-AA8 月 6 日API 版(8 月)1739 Elo,与 Claude Fable 5(1743)、GPT-5.6 Sol(1730)相当,低于 Claude Opus 5(1852)
Arena 的 Code Arena:WebDev9 月 2 日0902 快照与原版0902 以 1,691 分排第 1,比 Claude Opus 5(Max)高 3 分;原版 1,669 分
Artificial Analysis 综合指数 v4.39 月 19 日查阅0902 快照;开放权重版本45;40(指数已换版,不能和 8 月的 56 直接比)

几点读法:

  • 第三方的定位与官方大体吻合:8 月的独立综合评分把它放在 Opus 4.8、Kimi K3 那一档,和官方表“有赢有输”的格局一致。
  • 第三方看到了官方表里没有的东西。 Artificial Analysis 的事实性测试(AA-Omniscience)掉了 10 分,原因是幻觉率从 3.7-Max 的 23% 升到了 40%;它还提醒,τ³-Bench 银行子项 42% 的成绩“像是分布外的异常值”。
  • Arena 是众包投票的偏好排名,比的是网页开发成品的观感与可用性,不是正确率;3 分的差距很小,帖子里也没有给置信区间。
  • Artificial Analysis 单独评了开放权重版本,在同一版指数下比 0902 快照低 5 分。但两者之间隔着 0902 的后训练与 API 版的额外能力,差距不能全算在“开放权重”头上。

至于拿开放权重自行部署、按官方表的设置逐项复现,本专栏目前尚未看到。建议的做法没变:看竞技场、各基准的官方榜单和独立评测机构的数据,尤其留意在非 Claude Code 框架下的成绩,那能看出上面第一条折扣到底有多大。

0902 快照:同一个名字,换了一个模型

9 月 2 日,Qwen 发布 Qwen3.8-Max-0902,官方说法是“在编程与办公上继续后训练”,价格不变;9 月 5 日起,百炼的 qwen3.8-max 接口自动指向它。官方帖子附了一张新表,节选如下(加粗为该行最高):

基准0902原版Claude Opus 5Fable 5GPT-5.6 Sol
TerminalBench 3.029.011.342.734.034.6
DeepSWE 1.169.356.673.669.772.7
ProgramBench(Almost Solved)28.010.541.533.023.0
MLS-Bench-Lite50.141.049.849.946.2
SWE-Atlas QnA66.360.363.239.046.0
QwenSWEBench V2(内部)70.055.168.067.1——
CoWorkBench(内部)76.174.879.675.971.5
JobBench64.053.467.857.445.4
WorkArena(内部人评,Elo)146813481437——1482

这张表要这样读:

  • 相对原版,编程类涨幅很大(TerminalBench 3.0 从 11.3 到 29.0,ProgramBench 从 10.5 到 28.0);但对手换成了 Claude Opus 5(8 月的表里比的是 Opus 4.8),0902 在多数编程与 agent 项上仍落后于它,领先的几项里有两项是内部基准或内部人评。
  • 考卷也换了版本。 TerminalBench 3.0、Automation Bench v1.0.6 与 8 月表里的同名考卷不是一个版本,数字不能跨表比较。
  • 最重要的一点:模型卡上的分数,已经不是你现在调用 qwen3.8-max 拿到的那个模型的分数;而 Hugging Face 上的开放权重对应的是 8 月的原版,0902 没有开放权重。

以上仍是官方口径,待独立验证。

给使用者的实际建议

在证据充分之前,判断“要不要用它”可以绕开基准:

  1. 拿你自己的十条真实样例去测。 花不了多少钱,比任何榜单都准。
  2. 重点测长时程场景——这是它主打的方向,也是差异最可能体现的地方。
  3. 同时测成本——把思考档位调到最低和默认各跑一遍,看质量差多少、账单差多少。这个比值决定了它在你场景里的实际性价比;第三方测得它每个任务的花费是上一代的两倍多,别只看单价。
  4. 固定版本号。 需要可复现的结果,就调用 qwen3.8-max-0902 这类带日期的快照名,而不是会被自动升级的 qwen3.8-max
  5. V4-Flash 对比一次。 8 月时是 $2/$6 对 $0.14/$0.28,差 20 倍;DeepSeek 的 Flash 线 9 月已换成 V4.1-Flash、改为峰谷计价,按输出价算差距缩小到五到十倍,仍然足以压倒大多数基准优势——前提是 Flash 在你的任务上够用。

下一章看那个承诺是怎么兑现的。👉 开源承诺的成色

参考文献

本页目录