规格总表
Qwen3.8-Max 的全部规格——2.4T/95B、92 层、512 个专家、官方的上下文与思考上限、两地定价——以及那张“未公开清单”在权重公开后的填补情况。
规格总表
本章在权重公开后更新过两次(2026 年 9 月 13 日、19 日)。 原稿的“未公开清单”大部分已由官方模型卡与 config.json 填上;第二次更新改用阿里云百炼的官方模型页核对了 API 规格与价格,订正了两个当初沿用二手资料的数字(上下文与默认思考预算)。仍然空白的项照旧标出。
这一章分两半:已知的和未知的。第二半和第一半一样重要。
已公开的规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 总参数 | 2.4T(Hugging Face 记录为 2,446,182,725,504) | 官方博客 / HF |
| 每 token 激活 | 95B(约 3.9%) | 模型卡 |
| 架构 | 稀疏 MoE + 混合注意力(3 层 Gated DeltaNet 配 1 层门控注意力) | 模型卡 |
| 层数 / 隐藏维度 | 92 / 8192 | config |
| 专家 | 512 个路由专家,每 token 激活 10 个 + 1 个共享专家;专家中间维度 2048 | config |
| 注意力头 | 全注意力 64 个查询头 / 4 个键值头,头维度 256;线性注意力 128 个值头 / 16 个键头,头维度 128 | config |
| 位置编码 | RoPE,只作用于 64 维(partial rotary 0.25),rope_theta 为 1000 万 | config |
| 词表 | 248,320(含填充) | config |
| 上下文长度 | API 版 1,000,000;开放权重原生 262,144,可外推到 1,010,000 | 百炼模型页 / 模型卡 |
| 最大输入 | API 版 991,808;思考模式下 983,616 | 百炼模型页 |
| 最大输出 | API 版 131,072(思考模式下相同) | 百炼模型页 |
| 最大思维链 | API 版 262,144;默认思考预算就等于它 | 百炼模型页 / 深度思考文档 |
| 思考档位 | low / medium / xhigh,默认 xhigh | 模型卡 / 官方博客 |
| 思考模式 | 开放权重不可关闭;API 版支持非思考模式 | 模型卡 |
| 模态 | API 版:文本 + 图像 + 视频 → 文本;开放权重:仅文本 | 百炼模型页 / 模型卡 |
| 发布日期 | API 2026-08-03;开放权重 8 月 9 日上传、8 月 12 日公开;0902 快照 9 月 2 日发布,9 月 5 日起成为 qwen3.8-max 的默认版本 | 官方博客 / HF / 阿里云公告 |
定价
官方单价(每百万 token,2026 年 9 月 19 日查阅;0902 快照与 qwen3.8-max 同价):
| 区域 | 输入 | 输出 | 隐式缓存命中 | 显式缓存(创建 / 命中) |
|---|---|---|---|---|
| 国内(百炼,北京) | ¥12 | ¥36 | ¥1.5 | ¥15 / ¥1 |
| 国际(Qwen Cloud) | $2 | $6 | $0.25 | $2.5 / $0.17 |
另外几条:国内的 Batch 调用半价(¥6 / ¥18);百炼另有一个 qwen3.8-max-prime(官方称“优速模式”),单价翻倍到 ¥24 / ¥72;百炼托管的开放权重版本 qwen3.8-2.4t-a95b 与 Max 同价。思考内容按输出计费,这一点下面会反复用到。
放进同代坐标系看(国际定价,每百万 token):
| 模型 | 输入 | 输出 |
|---|---|---|
| DeepSeek V4-Flash(8 月初稿时的价格) | $0.14 | $0.28 |
| Qwen3.8-Max | $2 | $6 |
| Kimi K3 | $3 | $15 |
DeepSeek 那一行要加个注:9 月 19 日核对时,DeepSeek 官方定价页已把 deepseek-flash 换成 V4.1-Flash,改为峰谷分时计价(未命中缓存的输入 $0.15 至 $0.3,输出 $0.6 至 $1.2),旧名字 deepseek-v4-flash 的请求也由新模型承接。按输出价算,它和 Qwen3.8-Max 的差距从二十多倍缩小到五到十倍。
Qwen3.8-Max 卡在中间,且明显比 K3 便宜——输出价只有 K3 的 40%。考虑到两者规模接近(2.4T vs 2.8T),这个定价是有攻击性的。
但有一个必须注意的地方:它的默认思考档位是最高档,API 版的默认思考预算高达 262,144 token。 思考内容按输出计费,这意味着一次简单调用的实际账单可能远高于问题本身的复杂度。下一部分那一章会展开。
未公开清单:公开之后的填补情况
初稿写作时,这张表几乎全是空白。现在把两个时间点并排放:
| 项目 | 初稿(8 月 6 日) | 现在(9 月 19 日) |
|---|---|---|
| 技术报告 / 论文 | 无 | Max 本身仍无(模型卡只引了发布博客);同系列的 Flash-Next 有技术报告、E-Commerce Bench 有论文,都不涉及 Max 的训练细节 |
| 模型卡 | 无 | 已发布(8 月 11 日) |
| 层数、隐藏维度、注意力头数 | 未公开 | 已填:92 层、8192,头数见上表 |
| 专家总数、激活专家数、共享专家 | 未公开 | 已填:512 选 10,外加 1 个共享专家 |
| “混合注意力”混的是什么 | 未公开 | 已填:Gated DeltaNet 与门控全注意力,3:1 |
| 位置编码、归一化方案 | 未公开 | 已填:部分维度的 RoPE;RMSNorm(eps 1e-6) |
| 预训练 token 数、数据构成 | 未公开 | 仍未公开 |
| 训练精度、优化器 | 未公开 | 仍未公开(发布的权重是 BF16,不代表训练精度) |
| 强化学习的规模 | 只有“4,000 个环境”的二手说法 | 只有一张图:横轴是训练环境数,最佳检查点在 4,000 处(见 RL 那一章) |
| 权重 | 未发布(承诺中) | 已公开(8 月 12 日;Hugging Face 与 ModelScope) |
| 许可 | 未公布 | 已公布:Qwen3.8-Max License,有条件商用 |
| 0902 快照改了什么 | —— | 只说“在编程与办公上继续后训练”,没有权重,也没有训练细节 |
现在可以和 K3 那张规格表并排比较了:
| 项目 | Kimi K3 | Qwen3.8 |
|---|---|---|
| 总参数 / 激活 | 2.8T / 104B | 2.4T / 95B |
| 层数 | 93 | 92 |
| 隐藏维度 | 7168 | 8192 |
| 专家 | 896 选 16 | 512 选 10,外加 1 个共享 |
| 词表 | 约 160K | 约 248K |
初稿的做法是:与其填上看似合理的推测,不如把空白如实标出来。 回头看,“未公开”那一列后来都由官方材料直接填上,没有一格需要订正。
需要订正的反而是“已知”那一栏里从二手资料抄来的两个数:“上下文 983,616”其实是思考模式下的最大输入(上下文是 1,000,000);“默认思考预算 131,072”与官方文档对不上——文档写明默认预算等于最大思维链长度,API 版是 262,144(131,072 倒是百炼托管的开放权重版本的思维链上限)。空白的格子不会出错,填错的格子才会——这句话对“已知”那一栏同样成立。
从 2.4T / 95B 能推出什么
只有两个数字时能得出哪些结论,是下一章的内容;配置公开后的完整答案,见架构拆解。👉 MoE 与混合注意力
参考文献
- [1] Qwen Team. Qwen3.8-2.4T-A95B 模型卡 与同仓库 config.json,2026-08 —— 架构参数、上下文、思考档位与模式。
- [2] 阿里云百炼. qwen3.8-max 模型页、qwen3.8-2.4t-a95b 模型页与模型调用价格,2026-09-19 查阅 —— 上下文、最大输入输出、最大思维链、国内与国际单价、
qwen3.8-max-prime。 - [3] 阿里云百炼. 深度思考 —— “
thinking_budget默认值为模型的最大思维链长度”。 - [4] Qwen Cloud. Qwen3.8-Max 与 Qwen3.8-Max-0902 模型页 —— 国际单价与缓存价。
- [5] Qwen Team. “Qwen3.8-Max:编程与办公,全面跃升.” 2026-08-03。
- [6] DeepSeek. Models & Pricing,2026-09-19 查阅;Moonshot AI. Kimi 模型定价。
- [7] DataLearner 模型库 Qwen3.8-Max —— 初稿依据的二手整理(上下文、思考预算两项已被官方文档订正)。