# 后训练：三个域的强化学习

> K3 的 agentic 能力不是涌现的，是训出来的——通用、agentic、编码三个域上的强化学习，以及「多档思考预算」这个正在成为标配的设计。

- 作者：David（道雾轩）
- 专栏：Kimi K3 深度解析（https://daiw.net/manual/kimi-k3.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/kimi-k3/post-training
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 后训练：三个域的强化学习

技术报告对后训练的概括是一句话：在**通用、agentic、编码**三个域上做强化学习，并覆盖**多个思考努力档位（reasoning-effort levels）**。

短，但信息量不小。

## 「三个域」意味着什么

把 RL 拆成三个域来做，本身就是一个判断：**这三类能力的奖励信号性质不同，不能混着训。**

| 域 | 奖励从哪来 | 难点 |
| --- | --- | --- |
| **通用** | 偏好模型、规则、人类反馈 | 奖励主观、易被钻空子（reward hacking） |
| **编码** | **可执行验证**——跑测试、看编译、比对输出 | 奖励客观但稀疏，长程任务里信号极晚才到 |
| **agentic** | 环境交互的结果——工具调用成功、任务完成 | 需要真实或高保真的环境，工程成本最高 |

编码这一域之所以关键，是因为它有**可执行的真值**。测试跑没跑通，是个二值事实，不需要打分模型。这让编码成了目前最适合大规模 RL 的领域，也解释了为什么这一代模型在编程与 agent 任务上的进步远快于在「写得好不好」上的进步。

agentic 这一域最贵。它要求**能被反复交互的环境**——一个可以真的调用工具、真的报错、真的产生后果的沙盒。这一层基础设施的差距，往往比模型架构的差距更能解释各家 agent 能力的高低。

## 多档思考预算

「多个 reasoning-effort 档位」这件事，值得单独说。

早期的推理模型是「一个模型一种思考深度」——要么总是长篇思考（贵、慢），要么总是直答（便宜、浅）。现在的做法是**把思考深度做成一个可调参数**：简单问题少想，难题多想。

这对**训练**提出了额外要求：模型必须在不同的思考预算下都表现良好。如果只在「长思考」上训过，一旦被要求简答，它会失去章法。所以后训练要**覆盖多个档位**——这正是报告那句话的重点。

<Callout type="info">
  这个设计正在成为这一代的标配。同期的 Qwen3.8-Max 提供 low / medium / xhigh 三档（开放权重版必须开启思考，API 版另有非思考模式，见[思考档位与思考模式](https://daiw.net/manual/qwen3-8-max/thinking-effort)），DeepSeek V4-Flash 有 Think High / Think Max 等模式。**「思考多少」从模型的固有属性变成了调用方的参数**，这是过去一年最实质的一处产品形态变化。
</Callout>

## 「保留思考历史」的会话约束

模型卡里有一条容易被忽略的部署要求：K3 的思考历史保留模式**要求会话续接时提供完整的 assistant 消息**。

翻译成人话：**你不能只把模型最终的回答塞回上下文，还得把它的思考过程一并带上。** 否则模型在下一轮会「忘了自己刚才为什么这么想」，多轮一致性会下降。

这条约束的实际影响不小：

- **上下文消耗更快**——思考过程往往比答案长得多；
- **代理层不能随意裁剪**——很多 agent 框架默认丢弃 reasoning 内容以省 token，对 K3 这样做会伤能力；
- **缓存策略要跟着改**——好在 K3 的缓存命中价只有未命中的 1/10，把完整历史留在上下文里的成本比想象中低。

这是「读模型卡」和「只读跑分」的差别所在：**跑分告诉你它有多强，模型卡告诉你怎么用才能拿到那个强度。**

## 小结

- 后训练分通用 / agentic / 编码三域做 RL，三者奖励性质不同。
- 编码域有可执行真值，是当前 RL 收益最高的方向。
- 多档思考预算要求后训练覆盖各档位，已成这一代标配。
- 部署上有一条硬约束：续接会话要带完整的 assistant 消息（含思考历史）。

下一部分落到评测与部署。先看基准——以及怎么读它们。👉 [基准怎么读](https://daiw.net/manual/kimi-k3/benchmarks)

## 参考文献

- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— 三域 RL 与多档 reasoning effort。
- [2] Hugging Face 模型卡：[moonshotai/Kimi-K3](https://huggingface.co/moonshotai/Kimi-K3) —— 思考历史保留模式的会话要求。
