# 规格总表

> Qwen3.8-Max 的全部规格——2.4T/95B、92 层、512 个专家、官方的上下文与思考上限、两地定价——以及那张“未公开清单”在权重公开后的填补情况。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.net/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max/spec-sheet
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 规格总表

<Callout type="info">
  **本章在权重公开后更新过两次（2026 年 9 月 13 日、19 日）。** 原稿的“未公开清单”大部分已由官方模型卡与 `config.json` 填上；第二次更新改用阿里云百炼的官方模型页核对了 API 规格与价格，订正了两个当初沿用二手资料的数字（上下文与默认思考预算）。仍然空白的项照旧标出。
</Callout>

这一章分两半：**已知的**和**未知的**。第二半和第一半一样重要。

## 已公开的规格

| 项目 | 数值 | 来源 |
| --- | --- | --- |
| 总参数 | **2.4T**（Hugging Face 记录为 2,446,182,725,504） | 官方博客 / HF |
| 每 token 激活 | **95B**（约 3.9%） | 模型卡 |
| 架构 | 稀疏 MoE + 混合注意力（3 层 Gated DeltaNet 配 1 层门控注意力） | 模型卡 |
| 层数 / 隐藏维度 | 92 / 8192 | config |
| 专家 | 512 个路由专家，每 token 激活 10 个 + 1 个共享专家；专家中间维度 2048 | config |
| 注意力头 | 全注意力 64 个查询头 / 4 个键值头，头维度 256；线性注意力 128 个值头 / 16 个键头，头维度 128 | config |
| 位置编码 | RoPE，只作用于 64 维（partial rotary 0.25），`rope_theta` 为 1000 万 | config |
| 词表 | 248,320（含填充） | config |
| 上下文长度 | API 版 **1,000,000**；开放权重原生 262,144，可外推到 1,010,000 | 百炼模型页 / 模型卡 |
| 最大输入 | API 版 991,808；思考模式下 983,616 | 百炼模型页 |
| 最大输出 | API 版 **131,072**（思考模式下相同） | 百炼模型页 |
| 最大思维链 | API 版 **262,144**；默认思考预算就等于它 | 百炼模型页 / 深度思考文档 |
| 思考档位 | `low` / `medium` / `xhigh`，默认 `xhigh` | 模型卡 / 官方博客 |
| 思考模式 | 开放权重**不可关闭**；API 版支持非思考模式 | 模型卡 |
| 模态 | API 版：文本 + 图像 + 视频 → 文本；开放权重：仅文本 | 百炼模型页 / 模型卡 |
| 发布日期 | API 2026-08-03；开放权重 8 月 9 日上传、8 月 12 日公开；0902 快照 9 月 2 日发布，9 月 5 日起成为 `qwen3.8-max` 的默认版本 | 官方博客 / HF / 阿里云公告 |

## 定价

官方单价（每百万 token，2026 年 9 月 19 日查阅；0902 快照与 `qwen3.8-max` 同价）：

| 区域 | 输入 | 输出 | 隐式缓存命中 | 显式缓存（创建 / 命中） |
| --- | --- | --- | --- | --- |
| 国内（百炼，北京） | ￥12 | ￥36 | ￥1.5 | ￥15 / ￥1 |
| 国际（Qwen Cloud） | \$2 | \$6 | \$0.25 | \$2.5 / \$0.17 |

另外几条：国内的 Batch 调用半价（￥6 / ￥18）；百炼另有一个 `qwen3.8-max-prime`（官方称“优速模式”），单价翻倍到 ￥24 / ￥72；百炼托管的开放权重版本 `qwen3.8-2.4t-a95b` 与 Max 同价。**思考内容按输出计费**，这一点下面会反复用到。

放进同代坐标系看（国际定价，每百万 token）：

| 模型 | 输入 | 输出 |
| --- | --- | --- |
| DeepSeek V4-Flash（8 月初稿时的价格） | \$0.14 | \$0.28 |
| **Qwen3.8-Max** | **\$2** | **\$6** |
| Kimi K3 | \$3 | \$15 |

DeepSeek 那一行要加个注：9 月 19 日核对时，DeepSeek 官方定价页已把 `deepseek-flash` 换成 V4.1-Flash，改为峰谷分时计价（未命中缓存的输入 \$0.15 至 \$0.3，输出 \$0.6 至 \$1.2），旧名字 `deepseek-v4-flash` 的请求也由新模型承接。按输出价算，它和 Qwen3.8-Max 的差距从二十多倍缩小到五到十倍。

**Qwen3.8-Max 卡在中间，且明显比 K3 便宜**——输出价只有 K3 的 40%。考虑到两者规模接近（2.4T vs 2.8T），这个定价是有攻击性的。

但有一个必须注意的地方：**它的默认思考档位是最高档，API 版的默认思考预算高达 262,144 token。** 思考内容按输出计费，这意味着**一次简单调用的实际账单可能远高于问题本身的复杂度**。[下一部分那一章](https://daiw.net/manual/qwen3-8-max/thinking-effort)会展开。

## 未公开清单：公开之后的填补情况

初稿写作时，这张表几乎全是空白。现在把两个时间点并排放：

| 项目 | 初稿（8 月 6 日） | 现在（9 月 19 日） |
| --- | --- | --- |
| 技术报告 / 论文 | 无 | **Max 本身仍无**（模型卡只引了发布博客）；同系列的 Flash-Next 有技术报告、E-Commerce Bench 有论文，都不涉及 Max 的训练细节 |
| 模型卡 | 无 | **已发布**（8 月 11 日） |
| 层数、隐藏维度、注意力头数 | 未公开 | **已填**：92 层、8192，头数见上表 |
| 专家总数、激活专家数、共享专家 | 未公开 | **已填**：512 选 10，外加 1 个共享专家 |
| “混合注意力”混的是什么 | 未公开 | **已填**：Gated DeltaNet 与门控全注意力，3:1 |
| 位置编码、归一化方案 | 未公开 | **已填**：部分维度的 RoPE；RMSNorm（eps 1e-6） |
| 预训练 token 数、数据构成 | 未公开 | **仍未公开** |
| 训练精度、优化器 | 未公开 | **仍未公开**（发布的权重是 BF16，不代表训练精度） |
| 强化学习的规模 | 只有“4,000 个环境”的二手说法 | **只有一张图**：横轴是训练环境数，最佳检查点在 4,000 处（见 [RL 那一章](https://daiw.net/manual/qwen3-8-max/rl-environments)） |
| 权重 | 未发布（承诺中） | **已公开**（8 月 12 日；Hugging Face 与 ModelScope） |
| 许可 | 未公布 | **已公布**：Qwen3.8-Max License，有条件商用 |
| 0902 快照改了什么 | —— | **只说“在编程与办公上继续后训练”**，没有权重，也没有训练细节 |

现在可以和 [K3 那张规格表](https://daiw.net/manual/kimi-k3/spec-sheet)并排比较了：

| 项目 | Kimi K3 | Qwen3.8 |
| --- | --- | --- |
| 总参数 / 激活 | 2.8T / 104B | 2.4T / 95B |
| 层数 | 93 | 92 |
| 隐藏维度 | 7168 | 8192 |
| 专家 | 896 选 16 | 512 选 10，外加 1 个共享 |
| 词表 | 约 160K | 约 248K |

<Callout type="info">
  **初稿的做法是：与其填上看似合理的推测，不如把空白如实标出来。** 回头看，“未公开”那一列后来都由官方材料直接填上，没有一格需要订正。

  需要订正的反而是“已知”那一栏里从二手资料抄来的两个数：“上下文 983,616”其实是思考模式下的最大输入（上下文是 1,000,000）；“默认思考预算 131,072”与官方文档对不上——文档写明默认预算等于最大思维链长度，API 版是 262,144（131,072 倒是百炼托管的开放权重版本的思维链上限）。**空白的格子不会出错，填错的格子才会**——这句话对“已知”那一栏同样成立。
</Callout>

## 从 2.4T / 95B 能推出什么

只有两个数字时能得出哪些结论，是下一章的内容；配置公开后的完整答案，见[架构拆解](https://daiw.net/manual/qwen3-8-max/architecture)。👉 [MoE 与混合注意力](https://daiw.net/manual/qwen3-8-max/moe-and-attention)

## 参考文献

- [1] Qwen Team. [Qwen3.8-2.4T-A95B 模型卡](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B) 与同仓库 [config.json](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/blob/main/config.json)，2026-08 —— 架构参数、上下文、思考档位与模式。
- [2] 阿里云百炼. [qwen3.8-max 模型页](https://help.aliyun.com/zh/model-studio/qwen3-8-max)、[qwen3.8-2.4t-a95b 模型页](https://help.aliyun.com/zh/model-studio/qwen3-8-2-4t-a95b)与[模型调用价格](https://help.aliyun.com/zh/model-studio/model-pricing)，2026-09-19 查阅 —— 上下文、最大输入输出、最大思维链、国内与国际单价、`qwen3.8-max-prime`。
- [3] 阿里云百炼. [深度思考](https://help.aliyun.com/zh/model-studio/deep-thinking) —— “`thinking_budget` 默认值为模型的最大思维链长度”。
- [4] Qwen Cloud. [Qwen3.8-Max](https://www.qwencloud.com/models/qwen3.8-max) 与 [Qwen3.8-Max-0902](https://www.qwencloud.com/models/qwen3.8-max-0902) 模型页 —— 国际单价与缓存价。
- [5] Qwen Team. “[Qwen3.8-Max：编程与办公，全面跃升](https://qwen.ai/blog?id=qwen3.8).” 2026-08-03。
- [6] DeepSeek. [Models & Pricing](https://api-docs.deepseek.com/quick_start/pricing)，2026-09-19 查阅；Moonshot AI. [Kimi 模型定价](https://platform.kimi.ai/docs/pricing/chat)。
- [7] DataLearner 模型库 [Qwen3.8-Max](https://www.datalearner.com/ai-models/pretrained-models/qwen3-8-max) —— 初稿依据的二手整理（上下文、思考预算两项已被官方文档订正）。
