4000 个 RL 环境:一张图里的数字

长时程能力不是涌现的,是训出来的——但“4,000 个 RL 环境”并不是官方写下的一句话,而是一张图上最佳检查点的位置。回到原图与博客原文,看训练侧到底公开了什么。

作者 David更新于 7 篇(共 11 篇)

4000 个 RL 环境:一张图里的数字

本章在 2026 年 9 月 19 日做过较大修订。 初稿引用的“训练跨 4,000 个强化学习环境,结合可执行校验、rubric 评审与 agentic 检查”出自二手整理。回到官方博客核对:正文里没有这句话,4,000 这个数来自博客里的一张图。三种奖励机制的说法是对的,但博客还讲了第三件事,而且对“环境”的描述和初稿的理解不一样。下文按原图与原文改写,保留初稿的分析框架。

在发布材料的所有信息里,本专栏初稿认为这一条最有分量,理由是:它是一条关于“怎么做到的”的信息,而不是“做到了什么”的宣称。 这个理由今天仍然成立——只是要先把信息本身读准。

原图说了什么

官方博客“办公助手”一节有一张图,标题是“RL 训练环境数与 10 余项基准的综合分数”(Score Index across 10+ Benchmarks vs. RL Training Envs)。把图上的点抄下来:

RL 训练环境数综合分数
0(SFT 基线)0.474
5000.469
1,0000.487
1,5000.586
2,0000.606
2,5000.622
3,0000.616
3,5000.647
4,000(图中标为“最佳检查点”)0.725
4,5000.719
5,0000.689

二手资料里的“4,000 个环境”,其实是这张图上最好那个点的横坐标。这张图至少还说了三件转述里没有的事:

  • 横轴画到了 5,000。 实验里的环境数不止 4,000,只是 4,000 处的检查点最好。
  • 曲线不是单调上升的。 500 处比基线还略低,3,000 处回落了一点,4,000 之后又降到 0.689。配图文字说的是“随着 RL 训练持续扩大,性能稳步、一致地提升”,图本身并不完全是这个形状。
  • 纵轴是一个综合分数,按配图文字,由“数十个内部与公开的工作类基准”汇总而来;具体是哪些基准、怎么加权,没有说明。

博客原文怎么描述这套训练

原文这一段的标题是“扩展真实世界的强化学习系统”:通过联合扩展环境数量与训练算力,让模型在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等主流 harness 上的通用工作能力持续提升。为此要解决三个相互耦合的问题:

做法原文要点
组合式扩展环境沿三个互相独立的维度扩展真实环境:任务(单任务 → 多任务 → 跨天任务)、工作空间(多文件 → 层级目录 → 复杂异构目录)、harness(类别、版本、技能)。环境数由此按组合方式增长,而不必逐个定制集成
统一的奖励系统把真实任务里五花八门的验证方式收进一个系统:基于执行的校验、针对文本与渲染后视觉输出的 rubric 评判、agentic 检查,rubric 本身也能自动扩展
在线数据均衡器重排每个 batch,使其在任务、难度、工作区、harness 上的分布高度均衡,降低 batch 之间的梯度方差,让 RL 算力能稳定地持续加上去

第一行要特别留意,它改变了初稿的一个关键判断。初稿写道:“每一个这样的环境都要人去建……4,000 个环境代表的是一笔实打实的工程投入。”但按官方的说法,这里的“环境”是几个维度组合出来的——同一个任务放进不同的工作区、换一个 harness,就可能算作不同的环境。所以 4,000 这个数不能直接换算成“4,000 个手工搭建的沙盒”,它背后的工程量取决于“一个环境”怎么定义,而这一点博客没有交代。

配套的第二张图给了“跨 harness”的证据:同一个模型在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 五种框架下跑 CoWorkBench,分数在 73.2 到 75.8 之间;WorkspaceBench 在 67.0 到 71.2 之间;JobBench 加上 OpenCode 共六种框架,在 53.4 到 59.8 之间(厂商口径)。换框架不怎么掉分,正是按 harness 维度扩展环境想要的效果。

为什么环境仍然是硬功夫

即便如此,初稿讲的那个一般道理没有变:要训出长时程 agent 能力,你需要让模型反复尝试真实的任务并从结果中学习,这就要有能被反复运行的环境——模型发出动作 → 环境执行 → 返回结果与奖励 → 模型调整。

一个能跑通的编码环境需要沙盒、依赖、测试套件、评分脚本;一个浏览器环境需要网页快照、动作接口、成功判据。组合式扩展能摊薄成本,但每个维度本身(任务库、工作区、harness 适配)仍然要有人去建。能把环境数稳定地扩到几千,并让分数随之上升,本身就说明了投入的存在。

这条信息的价值在于它解释了能力从哪来上一章那些长时程演示之所以能跑通,不是因为 2.4T 参数带来了什么涌现,而是因为模型在大量环境里被反复训练过“怎么在长任务里不跑偏”。按图上的口径,SFT 基线是 0.474,最佳检查点是 0.725——这段提升来自 RL 阶段

能力是训出来的,不是长出来的。 这也是 DeepSeek V4-Flash 那次纯后训练更新给出的同一个教训;9 月 2 日的 0902 快照同样只说“继续后训练”。

三种奖励机制

统一奖励系统里的三种验证方式,各有擅长和短板:

机制怎么给奖励适合什么弱点
可执行校验跑测试、看编译、比对输出编码、数学、有确定答案的任务覆盖面窄——大量任务没有可执行的对错
rubric 评判按评分标准打分,官方说同时评文本与渲染后的视觉结果写作、分析、网页与文档这类开放式产出依赖 rubric 质量,易被表面特征欺骗
agentic 检查用另一个 agent 去检验结果复杂、多步骤的任务检查者本身会错,可能被共同的盲点骗过

三者互补,也互相制衡。

  • 只有可执行校验 → 模型只学会做有标准答案的题;
  • 只有 rubric → 模型学会写出“看起来符合评分标准”的东西(典型的 reward hacking);
  • 只有 agentic 检查 → 检查者和被检查者可能陷入同一个错误模式。

官方强调的是“统一”:与其给每类任务各维护一个专用的验证器,不如用一个系统给所有环境提供一致的奖励信号。组合使用是当前最务实的做法,这套思路在各家的配方里越来越像标配——K3 的三域 RL 是同一个思路的另一种切分方式。

这条信息的边界

读准之后,它没告诉我们的东西反而更清楚了:

  • “一个环境”怎么算——组合出来的环境里,有多少是真正不同的任务?
  • 环境的构成——多少是编码、多少是办公、多少是浏览器或模拟器?分布决定了能力的偏向。
  • 纵轴是哪些基准——“数十个内部与公开基准”具体是什么,内部基准占多少。
  • 曲线为什么在 4,000 之后回落——是环境太多稀释了质量,还是训练更久带来的过拟合?图上看不出来。
  • 训练量——在这些环境里跑了多少步、用了多少算力?这才是真正的投入。

所以这条信息的正确读法是:它证明了投入的存在与量级,也给出了一条厂商自己画的收益曲线;它不证明这条曲线能被外部复现。

一个行业层面的观察

把这一章和前面几章串起来,这一代模型的竞争格局其实很清楚:

竞争维度状态
架构趋同——混合注意力、稀疏 MoE、低精度训练,各家大同小异
规模撞天花板——算力、电力、数据都在见底
后训练与 RL 环境主战场

架构创新的边际收益在下降,RL 基础设施的边际收益在上升。 这就是为什么环境数的那条曲线比 2.4T 那个数字更值得关注——参数量各家都堆得起,能稳定扩到几千个、还能让分数跟着涨的环境体系不是。 只是下次再看到“N 个环境”这类说法,先问两句:数字从哪来,“一个环境”怎么算。

下一部分看证据。👉 基准怎么读

参考文献

本页目录