# 思考档位与思考模式

> 官方定名的三档 reasoning_effort（low / medium / xhigh，默认 xhigh）、开放权重必须开启思考而 API 版支持非思考模式，以及 26 万 token 的默认思考预算对账单的影响。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.net/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max/thinking-effort
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 思考档位与思考模式

<Callout type="info">
  **本章在权重公开后修订过两次（2026 年 9 月 13 日、19 日）。** 原稿依据发布期的二手资料：档位名称有两种说法，写着“思考模式不可关闭”，默认思考预算写作 131,072。官方材料给出了定论——档位是 `low` / `medium` / `xhigh`；“不可关闭”只对开放权重成立，API 版支持非思考模式；API 版的默认思考预算是 262,144。下文按新资料改写。
</Callout>

规格表里有三行看似平常、合起来却很有分量：

- 思考档位**三档**：`low` / `medium` / `xhigh`，默认 `xhigh`（官方博客、模型卡）；
- API 版默认思考预算 **262,144 token**（百炼文档：`thinking_budget` 的默认值是模型的最大思维链长度，Qwen3.8-Max 为 262,144）；
- 开放权重**必须开启思考**（官方模型卡）。

## “必须思考”只对开放权重成立

模型卡写得很明确：`Qwen3.8-2.4T-A95B` 在所有交互中都要求思考模式，**无法关闭**，每个回复都以 `<think>` 包裹的推理开头。随附的对话模板也是这么实现的：传入“关闭思考”会直接报错。

但同一份模型卡也写明，API 上的 **Qwen3.8-Max 支持非思考模式**。所以原稿“思考模式不可关闭”的说法要拆开看：

| 版本 | 能否关闭思考 |
| --- | --- |
| 开放权重 Qwen3.8-2.4T-A95B（含百炼托管的 `qwen3.8-2.4t-a95b`） | **不能**，最低也是 `low` 档 |
| API 版 Qwen3.8-Max（含 0902 快照） | **能**，支持非思考模式，默认开启思考 |
| 同系列的 27B 与 Flash-Next 开放权重 | **能**，默认开启思考 |

开放权重不给“零思考”这个选项，背后是一个明确的产品判断：

> **这个模型被设计成“用来解决问题”，而不是“用来聊天”。**

如果你的场景是快速问答、文案改写、简单分类，自己部署开放权重会让你难受——**你为不需要的思考付出算力，还要等更久**。这类场景可以走 API 的非思考模式，或者换更轻的模型。但如果你的场景是长时程 agent 任务（正是[它主打的方向](https://daiw.net/manual/qwen3-8-max/long-horizon)），思考就不是可选项，而是必需品。

模型卡还提到一个默认开启的开关 `preserve_thinking`：**历史消息里的推理内容会被保留下来**，供后续轮次参考。这对多轮 agent 任务有利，代价是上下文消耗得更快。

## 26 万 token 的默认预算意味着什么

这个数字要和定价放在一起才有实感。

思考内容**按输出计费**。国际定价 \$6 / 百万输出 token，那么用满默认预算的一次调用：

$$
262144 \times \frac{6}{1000000} \approx 1.57
$$

**约 1.57 美元——而且这还只是思考部分，没算最终答案。**

当然，实际调用很少用满预算——模型想完就停。但这个上限说明了成本的**尾部风险**：一个难题可能让单次调用的成本比预期高一两个数量级。

第三方的实测也指向同一个方向。Artificial Analysis 在 8 月 6 日的评测里算过：跑完它的综合指数，Qwen3.8-Max 平均每个任务花费 1.14 美元，是上一代 3.7-Max（0.53 美元）的两倍多；原因之一是 agent 类评测里轮数更多，输出 token 总量涨了 45%，达到 1.45 亿（第三方口径）。**单价降了，总账单反而涨了**——3.8-Max 的 API 单价其实比 3.7-Max 低。

<Callout type="warn">
  **对做产品的人：务必显式设置思考预算上限，不要用默认值。**

  这类“默认值很大 + 按量计费”的组合，是线上成本失控最常见的来源之一。一个卡在难题上反复思考的请求，能烧掉相当于几百次正常调用的钱。**在接入任何强制思考的模型前，先把预算上限、超时、以及单请求成本告警配好。**
</Callout>

## 三档怎么选

| 档位 | 适合 |
| --- | --- |
| **`low`** | 有明确答案、路径短的任务；批量处理；对延迟敏感的交互 |
| **`medium`** | 多数日常任务的性价比点 |
| **`xhigh`（默认）** | 长时程 agent、复杂推理、一次性的重要任务 |

官方在同系列 Flash-Next 的模型卡里提醒过一句，值得一起记住：**多轮 agent 任务里，调低档位不一定缩短总耗时**——单轮是快了，但分析不足会带来更多失败和重试，总时长和 token 消耗反而可能上升。所以“调低档位省钱”要在自己的任务上实测，不能想当然。

注意**默认是最高档**。这个默认值对“跑分”有利（评测通常用默认配置），对“省钱”不利。**发布材料里的基准分数，大概率是在最高档下取得的**——[基准那一章](https://daiw.net/manual/qwen3-8-max/benchmarks)会再提这一点。

## 这是这一代的共同趋势

把三家放在一起：

| 模型 | 思考控制 |
| --- | --- |
| **Qwen3.8-Max** | `low` / `medium` / `xhigh`，默认最高；**开放权重不可关闭**，API 版可关 |
| Kimi K3 | `low` / `high` / `max`，默认 `max`；官方文档写明它总是会推理 |
| DeepSeek V4-Flash | Think High / Think Max 等模式 |

**三家都把“思考多少”做成了调用方的参数，而且默认都开在最高档。** 这是过去一年最实质的产品形态变化之一——[K3 专栏那一章](https://daiw.net/manual/kimi-k3/post-training)讲过它对训练侧的要求（模型必须在各档位下都表现良好）。

初稿说“三家里只有 Qwen 取消了不思考的选项”，核对 Kimi 的文档后要订正：K3 也是总在推理。Qwen3.8 的特别之处其实在于**同一个模型两种待遇**：2.4T 的开放权重必须思考，API 版却可以关；同系列的 27B 与 Flash-Next 也都可以关。

## 思考和回答抢不抢额度

初稿这一节的结论是“会抢”：当时手上的二手数字是思考预算 131,072、最大输出 131,072，看起来像共用一个上限。官方文档给出的是另一幅图——API 版把两者分开列：

| 上限 | 数值 |
| --- | --- |
| 上下文 | 1,000,000 |
| 最大输入（思考模式下） | 983,616 |
| 最大思维链 | 262,144（`thinking_budget` 的默认值） |
| 最大输出（思考模式下） | 131,072 |

思维链的上限比输出的上限还大，两者显然不是同一个额度：**在官方 API 上，思考有自己的上限，不会挤占回答的 131,072。** 这与模型卡给自部署的建议一致：在支持**分别设定**推理与最终回复上限的推理框架里，推理部分设到 262,144、最终回复设到 131,072（都在 1M 上下文之内）。

要留意的是两件事：一是两部分都**按输出计费**，分开设限不等于省钱；二是自部署时要看你用的框架支不支持这种拆分，不支持的话，两者还是会抢同一个额度。另外，百炼托管的开放权重版本 `qwen3.8-2.4t-a95b`，思维链上限是 131,072，只有 API 版的一半。

下一部分讲这个模型真正的卖点。👉 [那些长时程主张](https://daiw.net/manual/qwen3-8-max/long-horizon)

## 参考文献

- [1] Qwen Team. [Qwen3.8-2.4T-A95B 模型卡](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B)，2026-08 —— `reasoning_effort` 三档、强制思考、`preserve_thinking` 与输出长度建议；同仓库的对话模板。
- [2] Qwen Team. “[Qwen3.8-Max：编程与办公，全面跃升](https://qwen.ai/blog?id=qwen3.8).” 2026-08-03 —— API 的三档 `reasoning_effort`。
- [3] 阿里云百炼. [qwen3.8-max 模型页](https://help.aliyun.com/zh/model-studio/qwen3-8-max)、[qwen3.8-2.4t-a95b 模型页](https://help.aliyun.com/zh/model-studio/qwen3-8-2-4t-a95b)与[深度思考](https://help.aliyun.com/zh/model-studio/deep-thinking)文档，2026-09-19 查阅 —— 最大思维链、最大输出、`thinking_budget` 默认值、各型号的思考模式。
- [4] Qwen Team. [Qwen3.8-Flash-Next 模型卡](https://huggingface.co/Qwen/Qwen3.8-Flash-Next) —— “调低档位不一定缩短总耗时”的提示。
- [5] Artificial Analysis. [Qwen3.8 Max 评测帖子](https://x.com/ArtificialAnlys/status/2085270415614828675)，2026-08-06 —— 每任务成本与输出 token 用量（第三方口径）。
- [6] Moonshot AI. [Reasoning Effort](https://platform.kimi.ai/docs/guide/use-reasoning-effort) —— K3 的三档与“总是推理”。
- [7] DataLearner 模型库 [Qwen3.8-Max](https://www.datalearner.com/ai-models/pretrained-models/qwen3-8-max) 与第三方发布分析（2026-08）—— 原稿依据的二手资料（已被官方材料取代）。
