规格总表

Qwen3.8-Max 的全部规格——2.4T/95B、92 层、512 个专家、官方的上下文与思考上限、两地定价——以及那张“未公开清单”在权重公开后的填补情况。

作者 David更新于 2 篇(共 11 篇)

规格总表

本章在权重公开后更新过两次(2026 年 9 月 13 日、19 日)。 原稿的“未公开清单”大部分已由官方模型卡与 config.json 填上;第二次更新改用阿里云百炼的官方模型页核对了 API 规格与价格,订正了两个当初沿用二手资料的数字(上下文与默认思考预算)。仍然空白的项照旧标出。

这一章分两半:已知的未知的。第二半和第一半一样重要。

已公开的规格

项目数值来源
总参数2.4T(Hugging Face 记录为 2,446,182,725,504)官方博客 / HF
每 token 激活95B(约 3.9%)模型卡
架构稀疏 MoE + 混合注意力(3 层 Gated DeltaNet 配 1 层门控注意力)模型卡
层数 / 隐藏维度92 / 8192config
专家512 个路由专家,每 token 激活 10 个 + 1 个共享专家;专家中间维度 2048config
注意力头全注意力 64 个查询头 / 4 个键值头,头维度 256;线性注意力 128 个值头 / 16 个键头,头维度 128config
位置编码RoPE,只作用于 64 维(partial rotary 0.25),rope_theta 为 1000 万config
词表248,320(含填充)config
上下文长度API 版 1,000,000;开放权重原生 262,144,可外推到 1,010,000百炼模型页 / 模型卡
最大输入API 版 991,808;思考模式下 983,616百炼模型页
最大输出API 版 131,072(思考模式下相同)百炼模型页
最大思维链API 版 262,144;默认思考预算就等于它百炼模型页 / 深度思考文档
思考档位low / medium / xhigh,默认 xhigh模型卡 / 官方博客
思考模式开放权重不可关闭;API 版支持非思考模式模型卡
模态API 版:文本 + 图像 + 视频 → 文本;开放权重:仅文本百炼模型页 / 模型卡
发布日期API 2026-08-03;开放权重 8 月 9 日上传、8 月 12 日公开;0902 快照 9 月 2 日发布,9 月 5 日起成为 qwen3.8-max 的默认版本官方博客 / HF / 阿里云公告

定价

官方单价(每百万 token,2026 年 9 月 19 日查阅;0902 快照与 qwen3.8-max 同价):

区域输入输出隐式缓存命中显式缓存(创建 / 命中)
国内(百炼,北京)¥12¥36¥1.5¥15 / ¥1
国际(Qwen Cloud)$2$6$0.25$2.5 / $0.17

另外几条:国内的 Batch 调用半价(¥6 / ¥18);百炼另有一个 qwen3.8-max-prime(官方称“优速模式”),单价翻倍到 ¥24 / ¥72;百炼托管的开放权重版本 qwen3.8-2.4t-a95b 与 Max 同价。思考内容按输出计费,这一点下面会反复用到。

放进同代坐标系看(国际定价,每百万 token):

模型输入输出
DeepSeek V4-Flash(8 月初稿时的价格)$0.14$0.28
Qwen3.8-Max$2$6
Kimi K3$3$15

DeepSeek 那一行要加个注:9 月 19 日核对时,DeepSeek 官方定价页已把 deepseek-flash 换成 V4.1-Flash,改为峰谷分时计价(未命中缓存的输入 $0.15 至 $0.3,输出 $0.6 至 $1.2),旧名字 deepseek-v4-flash 的请求也由新模型承接。按输出价算,它和 Qwen3.8-Max 的差距从二十多倍缩小到五到十倍。

Qwen3.8-Max 卡在中间,且明显比 K3 便宜——输出价只有 K3 的 40%。考虑到两者规模接近(2.4T vs 2.8T),这个定价是有攻击性的。

但有一个必须注意的地方:它的默认思考档位是最高档,API 版的默认思考预算高达 262,144 token。 思考内容按输出计费,这意味着一次简单调用的实际账单可能远高于问题本身的复杂度下一部分那一章会展开。

未公开清单:公开之后的填补情况

初稿写作时,这张表几乎全是空白。现在把两个时间点并排放:

项目初稿(8 月 6 日)现在(9 月 19 日)
技术报告 / 论文Max 本身仍无(模型卡只引了发布博客);同系列的 Flash-Next 有技术报告、E-Commerce Bench 有论文,都不涉及 Max 的训练细节
模型卡已发布(8 月 11 日)
层数、隐藏维度、注意力头数未公开已填:92 层、8192,头数见上表
专家总数、激活专家数、共享专家未公开已填:512 选 10,外加 1 个共享专家
“混合注意力”混的是什么未公开已填:Gated DeltaNet 与门控全注意力,3:1
位置编码、归一化方案未公开已填:部分维度的 RoPE;RMSNorm(eps 1e-6)
预训练 token 数、数据构成未公开仍未公开
训练精度、优化器未公开仍未公开(发布的权重是 BF16,不代表训练精度)
强化学习的规模只有“4,000 个环境”的二手说法只有一张图:横轴是训练环境数,最佳检查点在 4,000 处(见 RL 那一章
权重未发布(承诺中)已公开(8 月 12 日;Hugging Face 与 ModelScope)
许可未公布已公布:Qwen3.8-Max License,有条件商用
0902 快照改了什么——只说“在编程与办公上继续后训练”,没有权重,也没有训练细节

现在可以和 K3 那张规格表并排比较了:

项目Kimi K3Qwen3.8
总参数 / 激活2.8T / 104B2.4T / 95B
层数9392
隐藏维度71688192
专家896 选 16512 选 10,外加 1 个共享
词表约 160K约 248K

初稿的做法是:与其填上看似合理的推测,不如把空白如实标出来。 回头看,“未公开”那一列后来都由官方材料直接填上,没有一格需要订正。

需要订正的反而是“已知”那一栏里从二手资料抄来的两个数:“上下文 983,616”其实是思考模式下的最大输入(上下文是 1,000,000);“默认思考预算 131,072”与官方文档对不上——文档写明默认预算等于最大思维链长度,API 版是 262,144(131,072 倒是百炼托管的开放权重版本的思维链上限)。空白的格子不会出错,填错的格子才会——这句话对“已知”那一栏同样成立。

从 2.4T / 95B 能推出什么

只有两个数字时能得出哪些结论,是下一章的内容;配置公开后的完整答案,见架构拆解。👉 MoE 与混合注意力

参考文献

本页目录