回顾:在证据不足时怎么判断一个模型

把 Qwen3.8-Max 的已知、可推断、未知三层收成一张表,对照权重公开前后、9 月核对前后的变化,并给出一套读厂商发布材料的通用方法。

作者 David更新于 11 篇(共 11 篇)

回顾:在证据不足时怎么判断一个模型

这个专栏写作时和另外两个不同——它没能把模型拆开,因为可拆的材料还不存在。权重公开后,模型卡与配置文件补上了架构的空白;9 月回到一手出处逐条核对,又订正了几处当初沿用二手资料的说法。所以这一章收束的不只是 Qwen3.8-Max,还有“证据从无到有时,判断该怎么走”。

三层收束

已知(有公开来源,可引用)

项目内容
规格2.4T / 95B 激活;92 层、隐藏维度 8192;512 个专家选 10,外加 1 个共享专家;Gated DeltaNet 与门控注意力 3:1 混排
上下文与思考上限API 版上下文 1M、最大思维链 262,144、最大输出 131,072;开放权重原生 256K,可外推到约 1M
产品形态三档 low / medium / xhigh,默认最高;开放权重必须思考,API 版支持非思考模式
定价$2 / $6(国际),¥12 / ¥36(国内);0902 快照同价
训练侧组合式扩展 RL 环境、统一奖励(可执行校验 + rubric + agentic 检查)、在线数据均衡;一条环境数与分数的曲线,最佳检查点在 4,000 处(官方博客)
开源8 月 9 日上传、12 日公开;许可有条件商用,大体量的直接竞争者需另行授权
版本9 月 5 日起 qwen3.8-max 指向继续后训练的 0902 快照;开放权重仍是 8 月版
时间线07-19 预览 → 08-03 正式发布 → 08-12 权重公开 → 08-14 官宣(连同 27B)→ 09-02 0902 快照
第三方评测Artificial Analysis 8 月的综合指数 56(与 Opus 4.8 持平),同时测出幻觉率上升;Arena 的 WebDev 榜上 0902 排第 1

可推断(本专栏的分析,非官方)

  • 激活率约 3.9%,在同代同规模里偏保守——配置证实了这一点;但初稿由此推出的“专家更少更大”是错的,实际是 512 个小专家(见架构拆解)。
  • 按配置估算,95B 激活参数里约四成在注意力层,专家只占一半多一点。
  • 官方分数表大概率取自最高思考档位,且多项是在 Claude Code 框架里测得的,跨模型比较时要打折。
  • API 与开放权重正在分叉:先是能力(视觉、非思考、内置工具),再是版本(0902 没有开放权重)。

未知(无公开来源)

预训练 token 数与数据构成、训练精度、优化器、强化学习的规模与构成、0902 快照具体改了什么——仍然空白。Max 本身的技术报告至今没有发布;这一代唯一的技术报告属于 Flash-Next

三个专栏并排看

写完这三个专栏,同代三家的性格已经很清楚:

Kimi K3DeepSeek V4-FlashQwen3.8-Max
规模2.8T / 104B284B / 13B2.4T / 95B
押注长上下文效率(线性化)长上下文效率(压缩)+ 可部署性长时程自主任务
透明度技术报告 + 模型卡 + 权重论文 + 模型卡 + 权重模型卡 + 配置 + 权重,无技术报告
许可自订,有营收门槛MIT自订,有营收与业务门槛
输出价(8 月)$15$0.28$6
能拆到多深很深很深能拆架构,拆不了训练

Qwen 这一列在专栏写作期间变化最大:从“拆不了”变成了“能拆一半”。能拆多深,取决于厂商放不放材料,与模型本身好不好无关——而材料是会随时间补齐的。

这一点值得所有读技术内容的人记住:你能读到的深度分析,永远只覆盖那些愿意公开的模型。 这会造成一种系统性偏差——开放的模型被反复分析、被充分讨论;闭源的模型只有跑分和口碑。

不要把“分析得多”误当成“做得好”。 反过来也一样:材料少不代表模型差,只代表它(暂时)选择了不公开。

一套读发布材料的方法

把这个专栏里反复用到的判断标准整理成一份清单,下次读任何模型发布时都能用:

一、先分清三类陈述。

类型例子怎么对待
可核验事实参数量、定价、上下文长度直接采信(但注明来源)
可量化但无基线的宣称“门数从 8298 降到 678”问基线是什么
不可验证的演示“365 天模拟赚了 4 倍”只当作“做过这件事”

这张表里的两个例子,后来都有了下文:芯片设计的基线是模型自己的初版,电商模拟的环境开源了、完整排行也公布了。分类不是定论,而是告诉你该去找什么证据。

二、优先看“怎么做到的”,而不是“做到了什么”。 训练侧的方法描述比五个长时程演示更有信息量——方法比成果更难编。

三、留意它承认了什么。 一份承认自己在某些项上落后的材料,其余部分更可信。全面碾压的材料反而要小心。

四、区分“延期”和“不提了”。 承诺没兑现时,看厂商是给出新时间表,还是悄悄从材料里删掉。Qwen3.8 这次属于第三种情况:按期兑现,还多放了一个。

五、给时间。 发布后两三周,第三方评测、独立复现、社区实测会陆续出现。在那之前的所有判断都是暂定的——包括这个专栏里的。这个专栏本身就是例子:写作时空白的规格表,六天后就被配置文件填上了;第三方的独立评测,三天后就来了。

六、推断要分层,答案出来后回头对照。 把判断分成算术推论、横向定位、机制推断三层,并事先标明各自的可信度。本专栏的推断在权重公开后被逐条核对:算术和定位都对了,错的那条正好落在标为“低可信度”的机制推断里。分层的价值不是保证不犯错,而是让错误落在事先标好“不可靠”的地方。

七、回到原始出处,留意被省略的限定词。 这个专栏在 9 月的核对里栽过三次跟头,每一次都出在“转述”上:“训练跨 4,000 个 RL 环境”其实是一张图上最佳检查点的横坐标;“365 天模拟胜出、第二名 GLM 5.2”在论文里的原话是“在开放权重模型中领先”,所有模型一起排,它前面还有四个闭源模型;“OSWorld 86.1 无法核实”只是因为没翻到博客的多模态表。二手资料最常丢的不是数字,是数字旁边的那半句话。

八、API 名字是移动靶。 qwen3.8-max 在 9 月 5 日自动换成了 0902 快照:模型卡上的分数、开放权重、你今天调用到的模型,已经是三样东西。引用分数时写清版本,做产品时锁定带日期的快照名。

本专栏的更新记录

2026 年 9 月 13 日,按写作时的承诺完成了三项更新:

  1. 补写了架构拆解一章(层数、专家、注意力设计,都从配置文件读出);
  2. 填上了规格总表里那张“未公开清单”;
  3. 更新了开源那一章的许可评估。

同时修订了思考档位基准两章。

2026 年 9 月 19 日,回到一手出处逐条核对,做了第二轮更新:

  1. 订正权重的公开日期(8 月 9 日是上传,12 日才公开)、API 的上下文与默认思考预算(1,000,000 与 262,144)、Flash-Next 的发布日期(8 月 26 日);
  2. 重写了长时程RL 环境两章:oh-my-cli 的轨迹与 E-Commerce Bench 已经公开,“4,000”出自一张图;
  3. 基准一章补上多模态表、第三方评测与 0902 快照;
  4. 新增同期开放的 27B 与 Flash-Next一章。

仍待更新的是训练侧:如果官方发布 Qwen3.8-Max 的技术报告,本专栏会补上。

接着读什么

参考文献

本页目录