后训练:三个域的强化学习

K3 的 agentic 能力不是涌现的,是训出来的——通用、agentic、编码三个域上的强化学习,以及「多档思考预算」这个正在成为标配的设计。

作者 David更新于 10 篇(共 13 篇)

后训练:三个域的强化学习

技术报告对后训练的概括是一句话:在通用、agentic、编码三个域上做强化学习,并覆盖多个思考努力档位(reasoning-effort levels)

短,但信息量不小。

「三个域」意味着什么

把 RL 拆成三个域来做,本身就是一个判断:这三类能力的奖励信号性质不同,不能混着训。

奖励从哪来难点
通用偏好模型、规则、人类反馈奖励主观、易被钻空子(reward hacking)
编码可执行验证——跑测试、看编译、比对输出奖励客观但稀疏,长程任务里信号极晚才到
agentic环境交互的结果——工具调用成功、任务完成需要真实或高保真的环境,工程成本最高

编码这一域之所以关键,是因为它有可执行的真值。测试跑没跑通,是个二值事实,不需要打分模型。这让编码成了目前最适合大规模 RL 的领域,也解释了为什么这一代模型在编程与 agent 任务上的进步远快于在「写得好不好」上的进步。

agentic 这一域最贵。它要求能被反复交互的环境——一个可以真的调用工具、真的报错、真的产生后果的沙盒。这一层基础设施的差距,往往比模型架构的差距更能解释各家 agent 能力的高低。

多档思考预算

「多个 reasoning-effort 档位」这件事,值得单独说。

早期的推理模型是「一个模型一种思考深度」——要么总是长篇思考(贵、慢),要么总是直答(便宜、浅)。现在的做法是把思考深度做成一个可调参数:简单问题少想,难题多想。

这对训练提出了额外要求:模型必须在不同的思考预算下都表现良好。如果只在「长思考」上训过,一旦被要求简答,它会失去章法。所以后训练要覆盖多个档位——这正是报告那句话的重点。

这个设计正在成为这一代的标配。同期的 Qwen3.8-Max 提供 low / medium / xhigh 三档(开放权重版必须开启思考,API 版另有非思考模式,见思考档位与思考模式),DeepSeek V4-Flash 有 Think High / Think Max 等模式。「思考多少」从模型的固有属性变成了调用方的参数,这是过去一年最实质的一处产品形态变化。

「保留思考历史」的会话约束

模型卡里有一条容易被忽略的部署要求:K3 的思考历史保留模式要求会话续接时提供完整的 assistant 消息

翻译成人话:你不能只把模型最终的回答塞回上下文,还得把它的思考过程一并带上。 否则模型在下一轮会「忘了自己刚才为什么这么想」,多轮一致性会下降。

这条约束的实际影响不小:

  • 上下文消耗更快——思考过程往往比答案长得多;
  • 代理层不能随意裁剪——很多 agent 框架默认丢弃 reasoning 内容以省 token,对 K3 这样做会伤能力;
  • 缓存策略要跟着改——好在 K3 的缓存命中价只有未命中的 1/10,把完整历史留在上下文里的成本比想象中低。

这是「读模型卡」和「只读跑分」的差别所在:跑分告诉你它有多强,模型卡告诉你怎么用才能拿到那个强度。

小结

  • 后训练分通用 / agentic / 编码三域做 RL,三者奖励性质不同。
  • 编码域有可执行真值,是当前 RL 收益最高的方向。
  • 多档思考预算要求后训练覆盖各档位,已成这一代标配。
  • 部署上有一条硬约束:续接会话要带完整的 assistant 消息(含思考历史)。

下一部分落到评测与部署。先看基准——以及怎么读它们。👉 基准怎么读

参考文献

  • [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— 三域 RL 与多档 reasoning effort。
  • [2] Hugging Face 模型卡:moonshotai/Kimi-K3 —— 思考历史保留模式的会话要求。

本页目录