思考档位与思考模式

官方定名的三档 reasoning_effort(low / medium / xhigh,默认 xhigh)、开放权重必须开启思考而 API 版支持非思考模式,以及 26 万 token 的默认思考预算对账单的影响。

作者 David更新于 5 篇(共 11 篇)

思考档位与思考模式

本章在权重公开后修订过两次(2026 年 9 月 13 日、19 日)。 原稿依据发布期的二手资料:档位名称有两种说法,写着“思考模式不可关闭”,默认思考预算写作 131,072。官方材料给出了定论——档位是 low / medium / xhigh;“不可关闭”只对开放权重成立,API 版支持非思考模式;API 版的默认思考预算是 262,144。下文按新资料改写。

规格表里有三行看似平常、合起来却很有分量:

  • 思考档位三档low / medium / xhigh,默认 xhigh(官方博客、模型卡);
  • API 版默认思考预算 262,144 token(百炼文档:thinking_budget 的默认值是模型的最大思维链长度,Qwen3.8-Max 为 262,144);
  • 开放权重必须开启思考(官方模型卡)。

“必须思考”只对开放权重成立

模型卡写得很明确:Qwen3.8-2.4T-A95B 在所有交互中都要求思考模式,无法关闭,每个回复都以 <think> 包裹的推理开头。随附的对话模板也是这么实现的:传入“关闭思考”会直接报错。

但同一份模型卡也写明,API 上的 Qwen3.8-Max 支持非思考模式。所以原稿“思考模式不可关闭”的说法要拆开看:

版本能否关闭思考
开放权重 Qwen3.8-2.4T-A95B(含百炼托管的 qwen3.8-2.4t-a95b不能,最低也是 low
API 版 Qwen3.8-Max(含 0902 快照),支持非思考模式,默认开启思考
同系列的 27B 与 Flash-Next 开放权重,默认开启思考

开放权重不给“零思考”这个选项,背后是一个明确的产品判断:

这个模型被设计成“用来解决问题”,而不是“用来聊天”。

如果你的场景是快速问答、文案改写、简单分类,自己部署开放权重会让你难受——你为不需要的思考付出算力,还要等更久。这类场景可以走 API 的非思考模式,或者换更轻的模型。但如果你的场景是长时程 agent 任务(正是它主打的方向),思考就不是可选项,而是必需品。

模型卡还提到一个默认开启的开关 preserve_thinking历史消息里的推理内容会被保留下来,供后续轮次参考。这对多轮 agent 任务有利,代价是上下文消耗得更快。

26 万 token 的默认预算意味着什么

这个数字要和定价放在一起才有实感。

思考内容按输出计费。国际定价 $6 / 百万输出 token,那么用满默认预算的一次调用:

262144×610000001.57262144 \times \frac{6}{1000000} \approx 1.57

约 1.57 美元——而且这还只是思考部分,没算最终答案。

当然,实际调用很少用满预算——模型想完就停。但这个上限说明了成本的尾部风险:一个难题可能让单次调用的成本比预期高一两个数量级。

第三方的实测也指向同一个方向。Artificial Analysis 在 8 月 6 日的评测里算过:跑完它的综合指数,Qwen3.8-Max 平均每个任务花费 1.14 美元,是上一代 3.7-Max(0.53 美元)的两倍多;原因之一是 agent 类评测里轮数更多,输出 token 总量涨了 45%,达到 1.45 亿(第三方口径)。单价降了,总账单反而涨了——3.8-Max 的 API 单价其实比 3.7-Max 低。

对做产品的人:务必显式设置思考预算上限,不要用默认值。

这类“默认值很大 + 按量计费”的组合,是线上成本失控最常见的来源之一。一个卡在难题上反复思考的请求,能烧掉相当于几百次正常调用的钱。在接入任何强制思考的模型前,先把预算上限、超时、以及单请求成本告警配好。

三档怎么选

档位适合
low有明确答案、路径短的任务;批量处理;对延迟敏感的交互
medium多数日常任务的性价比点
xhigh(默认)长时程 agent、复杂推理、一次性的重要任务

官方在同系列 Flash-Next 的模型卡里提醒过一句,值得一起记住:多轮 agent 任务里,调低档位不一定缩短总耗时——单轮是快了,但分析不足会带来更多失败和重试,总时长和 token 消耗反而可能上升。所以“调低档位省钱”要在自己的任务上实测,不能想当然。

注意默认是最高档。这个默认值对“跑分”有利(评测通常用默认配置),对“省钱”不利。发布材料里的基准分数,大概率是在最高档下取得的——基准那一章会再提这一点。

这是这一代的共同趋势

把三家放在一起:

模型思考控制
Qwen3.8-Maxlow / medium / xhigh,默认最高;开放权重不可关闭,API 版可关
Kimi K3low / high / max,默认 max;官方文档写明它总是会推理
DeepSeek V4-FlashThink High / Think Max 等模式

三家都把“思考多少”做成了调用方的参数,而且默认都开在最高档。 这是过去一年最实质的产品形态变化之一——K3 专栏那一章讲过它对训练侧的要求(模型必须在各档位下都表现良好)。

初稿说“三家里只有 Qwen 取消了不思考的选项”,核对 Kimi 的文档后要订正:K3 也是总在推理。Qwen3.8 的特别之处其实在于同一个模型两种待遇:2.4T 的开放权重必须思考,API 版却可以关;同系列的 27B 与 Flash-Next 也都可以关。

思考和回答抢不抢额度

初稿这一节的结论是“会抢”:当时手上的二手数字是思考预算 131,072、最大输出 131,072,看起来像共用一个上限。官方文档给出的是另一幅图——API 版把两者分开列:

上限数值
上下文1,000,000
最大输入(思考模式下)983,616
最大思维链262,144(thinking_budget 的默认值)
最大输出(思考模式下)131,072

思维链的上限比输出的上限还大,两者显然不是同一个额度:在官方 API 上,思考有自己的上限,不会挤占回答的 131,072。 这与模型卡给自部署的建议一致:在支持分别设定推理与最终回复上限的推理框架里,推理部分设到 262,144、最终回复设到 131,072(都在 1M 上下文之内)。

要留意的是两件事:一是两部分都按输出计费,分开设限不等于省钱;二是自部署时要看你用的框架支不支持这种拆分,不支持的话,两者还是会抢同一个额度。另外,百炼托管的开放权重版本 qwen3.8-2.4t-a95b,思维链上限是 131,072,只有 API 版的一半。

下一部分讲这个模型真正的卖点。👉 那些长时程主张

参考文献

本页目录