4000 个 RL 环境:一张图里的数字
长时程能力不是涌现的,是训出来的——但“4,000 个 RL 环境”并不是官方写下的一句话,而是一张图上最佳检查点的位置。回到原图与博客原文,看训练侧到底公开了什么。
4000 个 RL 环境:一张图里的数字
本章在 2026 年 9 月 19 日做过较大修订。 初稿引用的“训练跨 4,000 个强化学习环境,结合可执行校验、rubric 评审与 agentic 检查”出自二手整理。回到官方博客核对:正文里没有这句话,4,000 这个数来自博客里的一张图。三种奖励机制的说法是对的,但博客还讲了第三件事,而且对“环境”的描述和初稿的理解不一样。下文按原图与原文改写,保留初稿的分析框架。
在发布材料的所有信息里,本专栏初稿认为这一条最有分量,理由是:它是一条关于“怎么做到的”的信息,而不是“做到了什么”的宣称。 这个理由今天仍然成立——只是要先把信息本身读准。
原图说了什么
官方博客“办公助手”一节有一张图,标题是“RL 训练环境数与 10 余项基准的综合分数”(Score Index across 10+ Benchmarks vs. RL Training Envs)。把图上的点抄下来:
| RL 训练环境数 | 综合分数 |
|---|---|
| 0(SFT 基线) | 0.474 |
| 500 | 0.469 |
| 1,000 | 0.487 |
| 1,500 | 0.586 |
| 2,000 | 0.606 |
| 2,500 | 0.622 |
| 3,000 | 0.616 |
| 3,500 | 0.647 |
| 4,000(图中标为“最佳检查点”) | 0.725 |
| 4,500 | 0.719 |
| 5,000 | 0.689 |
二手资料里的“4,000 个环境”,其实是这张图上最好那个点的横坐标。这张图至少还说了三件转述里没有的事:
- 横轴画到了 5,000。 实验里的环境数不止 4,000,只是 4,000 处的检查点最好。
- 曲线不是单调上升的。 500 处比基线还略低,3,000 处回落了一点,4,000 之后又降到 0.689。配图文字说的是“随着 RL 训练持续扩大,性能稳步、一致地提升”,图本身并不完全是这个形状。
- 纵轴是一个综合分数,按配图文字,由“数十个内部与公开的工作类基准”汇总而来;具体是哪些基准、怎么加权,没有说明。
博客原文怎么描述这套训练
原文这一段的标题是“扩展真实世界的强化学习系统”:通过联合扩展环境数量与训练算力,让模型在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等主流 harness 上的通用工作能力持续提升。为此要解决三个相互耦合的问题:
| 做法 | 原文要点 |
|---|---|
| 组合式扩展环境 | 沿三个互相独立的维度扩展真实环境:任务(单任务 → 多任务 → 跨天任务)、工作空间(多文件 → 层级目录 → 复杂异构目录)、harness(类别、版本、技能)。环境数由此按组合方式增长,而不必逐个定制集成 |
| 统一的奖励系统 | 把真实任务里五花八门的验证方式收进一个系统:基于执行的校验、针对文本与渲染后视觉输出的 rubric 评判、agentic 检查,rubric 本身也能自动扩展 |
| 在线数据均衡器 | 重排每个 batch,使其在任务、难度、工作区、harness 上的分布高度均衡,降低 batch 之间的梯度方差,让 RL 算力能稳定地持续加上去 |
第一行要特别留意,它改变了初稿的一个关键判断。初稿写道:“每一个这样的环境都要人去建……4,000 个环境代表的是一笔实打实的工程投入。”但按官方的说法,这里的“环境”是几个维度组合出来的——同一个任务放进不同的工作区、换一个 harness,就可能算作不同的环境。所以 4,000 这个数不能直接换算成“4,000 个手工搭建的沙盒”,它背后的工程量取决于“一个环境”怎么定义,而这一点博客没有交代。
配套的第二张图给了“跨 harness”的证据:同一个模型在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 五种框架下跑 CoWorkBench,分数在 73.2 到 75.8 之间;WorkspaceBench 在 67.0 到 71.2 之间;JobBench 加上 OpenCode 共六种框架,在 53.4 到 59.8 之间(厂商口径)。换框架不怎么掉分,正是按 harness 维度扩展环境想要的效果。
为什么环境仍然是硬功夫
即便如此,初稿讲的那个一般道理没有变:要训出长时程 agent 能力,你需要让模型反复尝试真实的任务并从结果中学习,这就要有能被反复运行的环境——模型发出动作 → 环境执行 → 返回结果与奖励 → 模型调整。
一个能跑通的编码环境需要沙盒、依赖、测试套件、评分脚本;一个浏览器环境需要网页快照、动作接口、成功判据。组合式扩展能摊薄成本,但每个维度本身(任务库、工作区、harness 适配)仍然要有人去建。能把环境数稳定地扩到几千,并让分数随之上升,本身就说明了投入的存在。
这条信息的价值在于它解释了能力从哪来。上一章那些长时程演示之所以能跑通,不是因为 2.4T 参数带来了什么涌现,而是因为模型在大量环境里被反复训练过“怎么在长任务里不跑偏”。按图上的口径,SFT 基线是 0.474,最佳检查点是 0.725——这段提升来自 RL 阶段。
能力是训出来的,不是长出来的。 这也是 DeepSeek V4-Flash 那次纯后训练更新给出的同一个教训;9 月 2 日的 0902 快照同样只说“继续后训练”。
三种奖励机制
统一奖励系统里的三种验证方式,各有擅长和短板:
| 机制 | 怎么给奖励 | 适合什么 | 弱点 |
|---|---|---|---|
| 可执行校验 | 跑测试、看编译、比对输出 | 编码、数学、有确定答案的任务 | 覆盖面窄——大量任务没有可执行的对错 |
| rubric 评判 | 按评分标准打分,官方说同时评文本与渲染后的视觉结果 | 写作、分析、网页与文档这类开放式产出 | 依赖 rubric 质量,易被表面特征欺骗 |
| agentic 检查 | 用另一个 agent 去检验结果 | 复杂、多步骤的任务 | 检查者本身会错,可能被共同的盲点骗过 |
三者互补,也互相制衡。
- 只有可执行校验 → 模型只学会做有标准答案的题;
- 只有 rubric → 模型学会写出“看起来符合评分标准”的东西(典型的 reward hacking);
- 只有 agentic 检查 → 检查者和被检查者可能陷入同一个错误模式。
官方强调的是“统一”:与其给每类任务各维护一个专用的验证器,不如用一个系统给所有环境提供一致的奖励信号。组合使用是当前最务实的做法,这套思路在各家的配方里越来越像标配——K3 的三域 RL 是同一个思路的另一种切分方式。
这条信息的边界
读准之后,它没告诉我们的东西反而更清楚了:
- “一个环境”怎么算——组合出来的环境里,有多少是真正不同的任务?
- 环境的构成——多少是编码、多少是办公、多少是浏览器或模拟器?分布决定了能力的偏向。
- 纵轴是哪些基准——“数十个内部与公开基准”具体是什么,内部基准占多少。
- 曲线为什么在 4,000 之后回落——是环境太多稀释了质量,还是训练更久带来的过拟合?图上看不出来。
- 训练量——在这些环境里跑了多少步、用了多少算力?这才是真正的投入。
所以这条信息的正确读法是:它证明了投入的存在与量级,也给出了一条厂商自己画的收益曲线;它不证明这条曲线能被外部复现。
一个行业层面的观察
把这一章和前面几章串起来,这一代模型的竞争格局其实很清楚:
| 竞争维度 | 状态 |
|---|---|
| 架构 | 趋同——混合注意力、稀疏 MoE、低精度训练,各家大同小异 |
| 规模 | 撞天花板——算力、电力、数据都在见底 |
| 后训练与 RL 环境 | 主战场 |
架构创新的边际收益在下降,RL 基础设施的边际收益在上升。 这就是为什么环境数的那条曲线比 2.4T 那个数字更值得关注——参数量各家都堆得起,能稳定扩到几千个、还能让分数跟着涨的环境体系不是。 只是下次再看到“N 个环境”这类说法,先问两句:数字从哪来,“一个环境”怎么算。
下一部分看证据。👉 基准怎么读
参考文献
- [1] Qwen Team. “Qwen3.8-Max:编程与办公,全面跃升.” 2026-08-03 —— “扩展真实世界的强化学习系统”一节的三项做法,以及图 1(环境数与综合分数)、图 2(跨 harness 表现)。
- [2] 第三方发布分析(2026-08):Qwen3.8-Max 官方指南整理 —— 初稿引用的“4,000 个 RL 环境”表述来源(二手,已按原图订正)。
- [3] 本站《Kimi K3 深度解析》后训练。