回顾:在证据不足时怎么判断一个模型
把 Qwen3.8-Max 的已知、可推断、未知三层收成一张表,对照权重公开前后、9 月核对前后的变化,并给出一套读厂商发布材料的通用方法。
回顾:在证据不足时怎么判断一个模型
这个专栏写作时和另外两个不同——它没能把模型拆开,因为可拆的材料还不存在。权重公开后,模型卡与配置文件补上了架构的空白;9 月回到一手出处逐条核对,又订正了几处当初沿用二手资料的说法。所以这一章收束的不只是 Qwen3.8-Max,还有“证据从无到有时,判断该怎么走”。
三层收束
已知(有公开来源,可引用)
| 项目 | 内容 |
|---|---|
| 规格 | 2.4T / 95B 激活;92 层、隐藏维度 8192;512 个专家选 10,外加 1 个共享专家;Gated DeltaNet 与门控注意力 3:1 混排 |
| 上下文与思考上限 | API 版上下文 1M、最大思维链 262,144、最大输出 131,072;开放权重原生 256K,可外推到约 1M |
| 产品形态 | 三档 low / medium / xhigh,默认最高;开放权重必须思考,API 版支持非思考模式 |
| 定价 | $2 / $6(国际),¥12 / ¥36(国内);0902 快照同价 |
| 训练侧 | 组合式扩展 RL 环境、统一奖励(可执行校验 + rubric + agentic 检查)、在线数据均衡;一条环境数与分数的曲线,最佳检查点在 4,000 处(官方博客) |
| 开源 | 8 月 9 日上传、12 日公开;许可有条件商用,大体量的直接竞争者需另行授权 |
| 版本 | 9 月 5 日起 qwen3.8-max 指向继续后训练的 0902 快照;开放权重仍是 8 月版 |
| 时间线 | 07-19 预览 → 08-03 正式发布 → 08-12 权重公开 → 08-14 官宣(连同 27B)→ 09-02 0902 快照 |
| 第三方评测 | Artificial Analysis 8 月的综合指数 56(与 Opus 4.8 持平),同时测出幻觉率上升;Arena 的 WebDev 榜上 0902 排第 1 |
可推断(本专栏的分析,非官方)
- 激活率约 3.9%,在同代同规模里偏保守——配置证实了这一点;但初稿由此推出的“专家更少更大”是错的,实际是 512 个小专家(见架构拆解)。
- 按配置估算,95B 激活参数里约四成在注意力层,专家只占一半多一点。
- 官方分数表大概率取自最高思考档位,且多项是在 Claude Code 框架里测得的,跨模型比较时要打折。
- API 与开放权重正在分叉:先是能力(视觉、非思考、内置工具),再是版本(0902 没有开放权重)。
未知(无公开来源)
预训练 token 数与数据构成、训练精度、优化器、强化学习的规模与构成、0902 快照具体改了什么——仍然空白。Max 本身的技术报告至今没有发布;这一代唯一的技术报告属于 Flash-Next。
三个专栏并排看
写完这三个专栏,同代三家的性格已经很清楚:
| Kimi K3 | DeepSeek V4-Flash | Qwen3.8-Max | |
|---|---|---|---|
| 规模 | 2.8T / 104B | 284B / 13B | 2.4T / 95B |
| 押注 | 长上下文效率(线性化) | 长上下文效率(压缩)+ 可部署性 | 长时程自主任务 |
| 透明度 | 技术报告 + 模型卡 + 权重 | 论文 + 模型卡 + 权重 | 模型卡 + 配置 + 权重,无技术报告 |
| 许可 | 自订,有营收门槛 | MIT | 自订,有营收与业务门槛 |
| 输出价(8 月) | $15 | $0.28 | $6 |
| 能拆到多深 | 很深 | 很深 | 能拆架构,拆不了训练 |
Qwen 这一列在专栏写作期间变化最大:从“拆不了”变成了“能拆一半”。能拆多深,取决于厂商放不放材料,与模型本身好不好无关——而材料是会随时间补齐的。
这一点值得所有读技术内容的人记住:你能读到的深度分析,永远只覆盖那些愿意公开的模型。 这会造成一种系统性偏差——开放的模型被反复分析、被充分讨论;闭源的模型只有跑分和口碑。
不要把“分析得多”误当成“做得好”。 反过来也一样:材料少不代表模型差,只代表它(暂时)选择了不公开。
一套读发布材料的方法
把这个专栏里反复用到的判断标准整理成一份清单,下次读任何模型发布时都能用:
一、先分清三类陈述。
| 类型 | 例子 | 怎么对待 |
|---|---|---|
| 可核验事实 | 参数量、定价、上下文长度 | 直接采信(但注明来源) |
| 可量化但无基线的宣称 | “门数从 8298 降到 678” | 问基线是什么 |
| 不可验证的演示 | “365 天模拟赚了 4 倍” | 只当作“做过这件事” |
这张表里的两个例子,后来都有了下文:芯片设计的基线是模型自己的初版,电商模拟的环境开源了、完整排行也公布了。分类不是定论,而是告诉你该去找什么证据。
二、优先看“怎么做到的”,而不是“做到了什么”。 训练侧的方法描述比五个长时程演示更有信息量——方法比成果更难编。
三、留意它承认了什么。 一份承认自己在某些项上落后的材料,其余部分更可信。全面碾压的材料反而要小心。
四、区分“延期”和“不提了”。 承诺没兑现时,看厂商是给出新时间表,还是悄悄从材料里删掉。Qwen3.8 这次属于第三种情况:按期兑现,还多放了一个。
五、给时间。 发布后两三周,第三方评测、独立复现、社区实测会陆续出现。在那之前的所有判断都是暂定的——包括这个专栏里的。这个专栏本身就是例子:写作时空白的规格表,六天后就被配置文件填上了;第三方的独立评测,三天后就来了。
六、推断要分层,答案出来后回头对照。 把判断分成算术推论、横向定位、机制推断三层,并事先标明各自的可信度。本专栏的推断在权重公开后被逐条核对:算术和定位都对了,错的那条正好落在标为“低可信度”的机制推断里。分层的价值不是保证不犯错,而是让错误落在事先标好“不可靠”的地方。
七、回到原始出处,留意被省略的限定词。 这个专栏在 9 月的核对里栽过三次跟头,每一次都出在“转述”上:“训练跨 4,000 个 RL 环境”其实是一张图上最佳检查点的横坐标;“365 天模拟胜出、第二名 GLM 5.2”在论文里的原话是“在开放权重模型中领先”,所有模型一起排,它前面还有四个闭源模型;“OSWorld 86.1 无法核实”只是因为没翻到博客的多模态表。二手资料最常丢的不是数字,是数字旁边的那半句话。
八、API 名字是移动靶。
qwen3.8-max 在 9 月 5 日自动换成了 0902 快照:模型卡上的分数、开放权重、你今天调用到的模型,已经是三样东西。引用分数时写清版本,做产品时锁定带日期的快照名。
本专栏的更新记录
2026 年 9 月 13 日,按写作时的承诺完成了三项更新:
2026 年 9 月 19 日,回到一手出处逐条核对,做了第二轮更新:
- 订正权重的公开日期(8 月 9 日是上传,12 日才公开)、API 的上下文与默认思考预算(1,000,000 与 262,144)、Flash-Next 的发布日期(8 月 26 日);
- 重写了长时程与 RL 环境两章:oh-my-cli 的轨迹与 E-Commerce Bench 已经公开,“4,000”出自一张图;
- 基准一章补上多模态表、第三方评测与 0902 快照;
- 新增同期开放的 27B 与 Flash-Next一章。
仍待更新的是训练侧:如果官方发布 Qwen3.8-Max 的技术报告,本专栏会补上。
接着读什么
- 《Kimi K3 深度解析》 —— 材料充分时,一个模型能被拆到多细。
- 《DeepSeek V4 Flash 深度解析》 —— 另一条长上下文路线,且是三者里最能自己跑起来的一个。
- 《AI 大模型解构》 —— 上一代架构的系统梳理。
参考文献
- [1] Qwen Team. “Qwen3.8-Max:编程与办公,全面跃升.” 2026-08-03。
- [2] Qwen Team. Qwen3.8-2.4T-A95B 模型卡、
config.json与 LICENSE,2026-08;Hugging Face 上的提交与讨论记录。 - [3] 阿里云百炼. qwen3.8-max 模型页,2026-09-19 查阅;阿里云关于 0902 快照的更新公告。
- [4] Wei Fan, et al. “E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation.” 2026-08-31. arXiv:2608.30730。
- [5] Artificial Analysis. Qwen3.8 Max 评测帖子,2026-08-06;Arena. Code Arena:WebDev 榜单帖子,2026-09-02。
- [6] DataLearner 模型库 Qwen3.8-Max 与第三方报道、分析(2026-08)—— 初稿依据的二手资料(待核,多数已被一手材料取代)。