# 4000 个 RL 环境：一张图里的数字

> 长时程能力不是涌现的，是训出来的——但“4,000 个 RL 环境”并不是官方写下的一句话，而是一张图上最佳检查点的位置。回到原图与博客原文，看训练侧到底公开了什么。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.net/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max/rl-environments
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 4000 个 RL 环境：一张图里的数字

<Callout type="info">
  **本章在 2026 年 9 月 19 日做过较大修订。** 初稿引用的“训练跨 4,000 个强化学习环境，结合可执行校验、rubric 评审与 agentic 检查”出自二手整理。回到官方博客核对：正文里**没有这句话**，4,000 这个数来自博客里的一张图。三种奖励机制的说法是对的，但博客还讲了第三件事，而且对“环境”的描述和初稿的理解不一样。下文按原图与原文改写，保留初稿的分析框架。
</Callout>

在发布材料的所有信息里，本专栏初稿认为**这一条最有分量**，理由是：**它是一条关于“怎么做到的”的信息，而不是“做到了什么”的宣称。** 这个理由今天仍然成立——只是要先把信息本身读准。

## 原图说了什么

官方博客“办公助手”一节有一张图，标题是“RL 训练环境数与 10 余项基准的综合分数”（Score Index across 10+ Benchmarks vs. RL Training Envs）。把图上的点抄下来：

| RL 训练环境数 | 综合分数 |
| --- | --- |
| 0（SFT 基线） | 0.474 |
| 500 | 0.469 |
| 1,000 | 0.487 |
| 1,500 | 0.586 |
| 2,000 | 0.606 |
| 2,500 | 0.622 |
| 3,000 | 0.616 |
| 3,500 | 0.647 |
| **4,000（图中标为“最佳检查点”）** | **0.725** |
| 4,500 | 0.719 |
| 5,000 | 0.689 |

二手资料里的“4,000 个环境”，其实是这张图上最好那个点的横坐标。这张图至少还说了三件转述里没有的事：

- **横轴画到了 5,000。** 实验里的环境数不止 4,000，只是 4,000 处的检查点最好。
- **曲线不是单调上升的。** 500 处比基线还略低，3,000 处回落了一点，4,000 之后又降到 0.689。配图文字说的是“随着 RL 训练持续扩大，性能稳步、一致地提升”，图本身并不完全是这个形状。
- **纵轴是一个综合分数**，按配图文字，由“数十个内部与公开的工作类基准”汇总而来；具体是哪些基准、怎么加权，没有说明。

## 博客原文怎么描述这套训练

原文这一段的标题是“扩展真实世界的强化学习系统”：通过**联合扩展环境数量与训练算力**，让模型在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等主流 harness 上的通用工作能力持续提升。为此要解决三个相互耦合的问题：

| 做法 | 原文要点 |
| --- | --- |
| **组合式扩展环境** | 沿三个互相独立的维度扩展真实环境：任务（单任务 → 多任务 → 跨天任务）、工作空间（多文件 → 层级目录 → 复杂异构目录）、harness（类别、版本、技能）。**环境数由此按组合方式增长，而不必逐个定制集成** |
| **统一的奖励系统** | 把真实任务里五花八门的验证方式收进一个系统：基于执行的校验、针对文本与渲染后视觉输出的 rubric 评判、agentic 检查，rubric 本身也能自动扩展 |
| **在线数据均衡器** | 重排每个 batch，使其在任务、难度、工作区、harness 上的分布高度均衡，降低 batch 之间的梯度方差，让 RL 算力能稳定地持续加上去 |

第一行要特别留意，它改变了初稿的一个关键判断。初稿写道：“每一个这样的环境都要人去建……4,000 个环境代表的是一笔实打实的工程投入。”但按官方的说法，**这里的“环境”是几个维度组合出来的**——同一个任务放进不同的工作区、换一个 harness，就可能算作不同的环境。所以 4,000 这个数**不能直接换算成“4,000 个手工搭建的沙盒”**，它背后的工程量取决于“一个环境”怎么定义，而这一点博客没有交代。

配套的第二张图给了“跨 harness”的证据：同一个模型在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 五种框架下跑 CoWorkBench，分数在 73.2 到 75.8 之间；WorkspaceBench 在 67.0 到 71.2 之间；JobBench 加上 OpenCode 共六种框架，在 53.4 到 59.8 之间（厂商口径）。换框架不怎么掉分，正是按 harness 维度扩展环境想要的效果。

## 为什么环境仍然是硬功夫

即便如此，初稿讲的那个一般道理没有变：要训出长时程 agent 能力，你需要让模型**反复尝试真实的任务并从结果中学习**，这就要有能被反复运行的环境——模型发出动作 → 环境执行 → 返回结果与奖励 → 模型调整。

一个能跑通的编码环境需要沙盒、依赖、测试套件、评分脚本；一个浏览器环境需要网页快照、动作接口、成功判据。组合式扩展能摊薄成本，但**每个维度本身（任务库、工作区、harness 适配）仍然要有人去建**。能把环境数稳定地扩到几千，并让分数随之上升，本身就说明了投入的存在。

<Callout type="info">
  这条信息的价值在于它**解释了能力从哪来**。[上一章那些长时程演示](https://daiw.net/manual/qwen3-8-max/long-horizon)之所以能跑通，不是因为 2.4T 参数带来了什么涌现，而是因为模型在大量环境里被反复训练过“怎么在长任务里不跑偏”。按图上的口径，SFT 基线是 0.474，最佳检查点是 0.725——**这段提升来自 RL 阶段**。

  **能力是训出来的，不是长出来的。** 这也是 [DeepSeek V4-Flash 那次纯后训练更新](https://daiw.net/manual/deepseek-v4-flash/post-training-0731)给出的同一个教训；9 月 2 日的 [0902 快照](https://daiw.net/manual/qwen3-8-max/benchmarks)同样只说“继续后训练”。
</Callout>

## 三种奖励机制

统一奖励系统里的三种验证方式，各有擅长和短板：

| 机制 | 怎么给奖励 | 适合什么 | 弱点 |
| --- | --- | --- | --- |
| **可执行校验** | 跑测试、看编译、比对输出 | 编码、数学、有确定答案的任务 | 覆盖面窄——大量任务没有可执行的对错 |
| **rubric 评判** | 按评分标准打分，官方说同时评文本与渲染后的视觉结果 | 写作、分析、网页与文档这类开放式产出 | 依赖 rubric 质量，易被表面特征欺骗 |
| **agentic 检查** | 用另一个 agent 去检验结果 | 复杂、多步骤的任务 | 检查者本身会错，可能被共同的盲点骗过 |

**三者互补，也互相制衡。**

- 只有可执行校验 → 模型只学会做有标准答案的题；
- 只有 rubric → 模型学会写出“看起来符合评分标准”的东西（典型的 reward hacking）；
- 只有 agentic 检查 → 检查者和被检查者可能陷入同一个错误模式。

官方强调的是“统一”：与其给每类任务各维护一个专用的验证器，不如用一个系统给所有环境提供一致的奖励信号。组合使用是当前最务实的做法，**这套思路在各家的配方里越来越像标配**——[K3 的三域 RL](https://daiw.net/manual/kimi-k3/post-training) 是同一个思路的另一种切分方式。

## 这条信息的边界

读准之后，它没告诉我们的东西反而更清楚了：

- **“一个环境”怎么算**——组合出来的环境里，有多少是真正不同的任务？
- **环境的构成**——多少是编码、多少是办公、多少是浏览器或模拟器？分布决定了能力的偏向。
- **纵轴是哪些基准**——“数十个内部与公开基准”具体是什么，内部基准占多少。
- **曲线为什么在 4,000 之后回落**——是环境太多稀释了质量，还是训练更久带来的过拟合？图上看不出来。
- **训练量**——在这些环境里跑了多少步、用了多少算力？这才是真正的投入。

所以这条信息的正确读法是：**它证明了投入的存在与量级，也给出了一条厂商自己画的收益曲线；它不证明这条曲线能被外部复现。**

## 一个行业层面的观察

把这一章和前面几章串起来，这一代模型的竞争格局其实很清楚：

| 竞争维度 | 状态 |
| --- | --- |
| **架构** | 趋同——混合注意力、稀疏 MoE、低精度训练，各家大同小异 |
| **规模** | 撞天花板——算力、电力、数据都在见底 |
| **后训练与 RL 环境** | **主战场** |

**架构创新的边际收益在下降，RL 基础设施的边际收益在上升。** 这就是为什么环境数的那条曲线比 2.4T 那个数字更值得关注——**参数量各家都堆得起，能稳定扩到几千个、还能让分数跟着涨的环境体系不是。** 只是下次再看到“N 个环境”这类说法，先问两句：数字从哪来，“一个环境”怎么算。

下一部分看证据。👉 [基准怎么读](https://daiw.net/manual/qwen3-8-max/benchmarks)

## 参考文献

- [1] Qwen Team. “[Qwen3.8-Max：编程与办公，全面跃升](https://qwen.ai/blog?id=qwen3.8).” 2026-08-03 —— “扩展真实世界的强化学习系统”一节的三项做法，以及图 1（[环境数与综合分数](https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3.8/work_showcases/training-score-vs-envs-scale.png)）、图 2（[跨 harness 表现](https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3.8/work_showcases/harness-generalization-3.8.png)）。
- [2] 第三方发布分析（2026-08）：Qwen3.8-Max 官方指南整理 —— 初稿引用的“4,000 个 RL 环境”表述来源（二手，已按原图订正）。
- [3] 本站《Kimi K3 深度解析》[后训练](https://daiw.net/manual/kimi-k3/post-training)。
