# 那些长时程主张

> 16 天自主开发一个项目、365 天电商模拟、500 轮芯片优化——逐条拆开阿里的长时程演示；其中两项的轨迹与环境后来公开了，核对之后，有的数字站得住，有的换了一副面孔。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.net/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/qwen3-8-max/long-horizon
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 那些长时程主张

<Callout type="info">
  **本章在 2026 年 9 月 19 日做过较大修订。** 初稿依据二手整理，把五个演示都当作“外界无法核对”。回到官方博客原文、再加上之后公开的材料，情况变了：oh-my-cli 的完整轨迹就在 GitHub 上，电商模拟的环境、数据与论文也都开源了；芯片设计与论文复现两项的“基线”，博客里也有交代。下文保留初稿的评估框架，逐条换上新证据。
</Callout>

Qwen3.8-Max 发布材料的重心不在基准表，而在五个**长时程自主任务**的演示。这是它区别于同代模型的地方，值得逐条看。

<Callout type="warn">
  **以下数字均出自官方博客，属于厂商口径。** 其中两项现在可以自己核对或重跑，另外三项仍然只能看厂商怎么说。读它们的正确姿势不是“信 / 不信”，而是**分辨哪些数字带有真实信息、哪些只是规模的展示**。
</Callout>

## 五个演示

| 演示 | 声称的成果 | 外界能否核对 |
| --- | --- | --- |
| **`oh-my-cli` 自主开发** | 约 **16 天**（截至 7 月 30 日），**265 次提交、127 个 PR、151 个 issue** | **能**：完整轨迹公开在 GitHub |
| **论文复现** | 约 **5 天**（约 125 小时），约 **7,600 行代码**、**1,100 多步操作**、**33 轮 GPU 训练**；AIME24 从 49.58% 提到 52.29% | 否 |
| **多模态竞赛** | **24 小时**、**45 次提交**，准确率从 0.60 爬到 **0.853**，超过 526 支队伍中的 **458 支** | 否，只有厂商报告的名次 |
| **芯片设计优化** | 约 **500 轮**交互、71 次评估，门数 **8,298 → 678**，版图 **106×106 → 46×46 微米** | 否 |
| **电商模拟** | **365 天**，起始 **10 万元** → 年末 **416,252 元** | **能**：环境、数据与论文已开源 |

## 逐条评估

### 现在可以自己核对的：oh-my-cli

初稿对这一条的判断是：“16 天、265 提交、127 PR”测的是**产出量**，不是**产出质量**，而且外界无从核对。后一半已经不成立了——博客写明项目的完整轨迹公开在 GitHub 仓库 `qwen-code-dev-bot/oh-my-cli`，本专栏按仓库记录数了一遍：

| 截至 2026-07-30 | 仓库记录 | 博客说法 |
| --- | --- | --- |
| 默认分支上的提交 | 265 | 265 |
| PR | 127（其中 119 个已合并） | 127 |
| issue | 151 | 151 |

数字对得上。仓库 7 月 13 日建立并在当天首次提交，到 7 月 30 日前后十六七天；之后它又继续跑到 8 月 12 日，截至 9 月 19 日累计 841 次提交、405 个 PR、475 个 issue。

“完全由 AI 自主运行”这一说法要加个注：截至 7 月 30 日的 265 次提交里，257 次出自机器人账号 `qwen-code-dev-bot`，另外 8 次出自一个个人账号——其中 6 次是 7 月 13 日第一天搭建“自治规则与治理”的初始设置，2 次是 7 月 23 日调整治理节奏；这个账号还开了 4 个 PR、3 个 issue，其中一个 issue 的标题就以“User feedback”开头。这和博客说的“把用户反馈纳入工程循环”并不矛盾，但说明**人设定了规则、中途调过一次参数、也提过需求，代码主要是模型写的**。

至于质量：代码就在那里，任何人都可以去读。本专栏没有做代码审阅。**“能在无人干预下连续运转很多天而不崩溃、不跑偏”这个耐久性结论，现在有了可查的证据**；“写得好不好”，仍需要读代码的人自己判断。顺带一提，仓库说明写的是“用 Qwen Code 构建”——这个演示跑在 Qwen Code 上，而不是初稿以为的 Qoder。

### 现在可以自己重跑的：365 天电商模拟

初稿说这一条“看起来最惊人，实际上信息量最低”，因为结果完全取决于模拟环境的设定，并列了两个成为证据的前提：**基线**（同一环境里别的做法能做到多少）和**环境的公开性**（外界能不能自己跑）。8 月底，两样都有了：Qwen 团队把这个 E-Commerce Bench 的代码与数据以 Apache 2.0 开源，并在 arXiv 上发表了论文（2608.30730）。

论文与仓库交代的设定：智能体手握 10 万元，最多同时经营 4 家店，跑满 365 个模拟日；商品与供应商数据来自真实电商平台的脱敏数据（6,886 种商品、60 个类目、576 家供应商，其中 152 家是骗子）；**需求与供应商报价都是确定性的**——供应商的让步由一个固定的谈判内核决定，大模型只负责把决定说成人话，口才再好也压不破底价。每个模型跑 5 局，报均值。

放到完整的排行里，这个数字换了一副面孔：

| 模型 | 年末资产均值（5 局） |
| --- | --- |
| GPT-5.6 Sol（max） | 143.1 万元 |
| Fable5（max） | 80.5 万元 |
| GPT-5.5 | 70.2 万元（5 局中 2 局破产） |
| Claude Opus 4.8（max） | 49.8 万元 |
| **Qwen3.8-Max**（论文发表后补测） | **47.2 万元** |
| **Qwen3.8-Max-Preview** | **41.6 万元** |
| GLM-5.3（max，发表后补测） | 39.1 万元 |
| GLM 5.2（high） | 30.1 万元 |
| Qwen3.7-Max | 16.5 万元 |
| Qwen3.5-Plus | 0.1 万元（5 局中 4 局破产） |

（节选自仓库 README 的 21 行排行表。）

博客里“以 416,252 元胜出，超过第二名 GLM 5.2 达 38%，比 Qwen3.7-Max 提升 152%”这三个数字都对得上——但论文摘要的原话是“**在开放权重模型中**，Qwen3.8-Max-Preview 以 416,252 领先”，所有模型一起排，第一是 GPT-5.6 Sol 的 1,431,425。博客发布时这些闭源模型有没有跑完，我们不知道；但按论文的完整排行，**“胜出”只在开放权重组里成立**，省掉的正是最关键的那半句话。

这张表也回答了初稿的另一个疑问——“一个宽松的模拟器可以让任何策略赚钱”。事实并非如此：Qwen3.5-Plus 五局里破产四次，连它在内共有三个模型一年下来亏了本。环境是有区分度的。

论文还提醒了单看年末资产的局限：赚得最多的 GPT-5.6 Sol，把 18.5% 的采购款付给了骗子供应商，在“防骗”一项上 18 个模型里排第 16。按论文的七个维度，Qwen3.8-Max-Preview 最突出的是“学习”一项——在重复采购里一轮轮把价格压下去，这与博客说的“持续学习”一致。

<Callout type="info">
  要注意这仍然不是独立评测：基准、论文与排行都出自 Qwen 团队自己。不同之处在于**它开源了**，任何人都可以拿同一套环境去复跑，去检查它有没有偏向自家模型。这比一个只报结果的演示高了一个档次。
</Callout>

### 有外部参照系的：多模态竞赛

这一条对照的是真实的人类参赛者：WWW2025 多模态对话意图识别挑战赛，托管在阿里云天池，526 支队伍。任务是读懂电商客服对话（文字加截图），判断顾客想要什么。0.853 是个可对照的绝对数字，“超过 458 支”约等于排在前 13%——**很强，但不是夺冠**，这个诚实的定位反而增加了它的可信度。

博客原文补了两个初稿没有的细节。一是模型的做法：它没有直接去答题，而是像一个算法工程师那样**训练了一套小模型**——微调 BERT、MacBERT、RoBERTa 处理文字，微调 Qwen2.5-VL-7B 处理截图，再用加权投票把它们融合起来。二是时间：从名字看这是 2025 年那届会议的配套赛事，Qwen3.8-Max 在 2026 年才参加，所以“击败 458 支队伍”应理解为拿成绩对照当年的排名，而非同期同台（这是本专栏的推断，博客没有说明提交方式）。

### 基线有了交代的：芯片设计优化

初稿在这一条上问了一个关键问题：**起点 8,298 门的设计是谁做的？** 博客原文给了答案：任务从一个“没有内部逻辑的 RTL 接口骨架”开始，**8,298 门是模型自己第一个跑通功能验证的设计**，之后它在约 500 轮交互、71 次评估里把门数压到 678。

所以初稿的担心成立了一半：12 倍的压缩是相对**它自己的初版**，而初版本身就是一个朴素实现——光“把 16 位的硬件取模除法器换成迭代移位减法”这一步就砍掉了 6,288 门，占全部缩减的八成以上。真正带有比较意义的是另一句话：678 门“在所有参评模型中表现最优”，但博客正文没有给出其他模型的数字（厂商口径，待独立验证）。

值得肯定的是指标本身：门数、面积、布线长度、时序都是硬指标。版图面积从 106×106 微米缩到 46×46 微米（缩小约 81%），总布线长度从 33,369 微米降到 4,187 微米，时序从严重违例（-4.46 ns）变成在 500 MHz 下收敛（+0.66 ns）；每一版都要通过 cocotb 的随机功能验证。**有明确优化目标、可量化的工程指标，是五个演示里最不“主观”的一个。**

### 有基线、但幅度很小的：论文复现

“7,600 行、1,100 步、33 轮训练”测的仍然是产出量。不过博客原文也给了质量指标：模型先花约 37 小时从零搭起论文的训练与评测流水线，复现了论文的六项主要结论（论文方法在 AIME24 上比随机挑选数据高 7.7%）；再用约 88 小时跑了四轮、试了 18 个改进想法，最好的一个把 AIME24 从 49.58% 提到 52.29%，提升 2.71 个百分点。

有基线、有过程，这比只报代码量强得多。但要注意两点：一是幅度——AIME24 只有 30 道题，2.7 个百分点在没有方差、没有重复实验的情况下，很难判断是真实的改进还是运气；二是选题——被复现的那篇论文 2026 年 5 月才上 arXiv，作者里有 Qwen 团队的成员，模型的训练数据里有没有它，博客没有说明。**这是一个“做通了”的证据，不是“做好了”的证据。**

## 一个共同的问题：只报成功

五个演示里，四个是单次运行的成功案例：**没有失败率、没有跑了多少次取最好的一次、没有中途人工干预的记录**（oh-my-cli 算半个例外，人的参与在提交历史里看得见）。唯一报了重复实验的是电商模拟——每个模型 5 局，连破产次数都列了出来。

对长时程任务来说，这些信息恰恰是最关键的：

- 一个模型 10 次里成功 1 次，和 10 次里成功 9 次，是完全不同的两个产品；
- 长时程任务的失败模式（陷入循环、偏离目标、破坏已有成果）往往比成功路径更值得了解。

**这不是针对阿里——所有厂商的演示材料都是这么做的。** 但读的时候要把这一层折扣算进去。

## 那么，该怎么看待这些演示

初稿的结论是：

> **这些演示证明了“长时程自主运行”是这个模型认真投入的方向，也证明了它至少能跑通这类任务。它们不能证明这个方向上它比同代模型更强——因为没有可比的对照。**

核对之后，前一半更站得住了：oh-my-cli 的轨迹可查，电商模拟的环境可以复跑。后一半有了一个答案，而且不是博客想让你读到的那个：**在唯一一个公开了完整对照的演示里，它是开放权重模型中最好的，但排在四个闭源模型之后。**

值得肯定的仍然是**方向**。长时程自主是当前 agent 最大的短板之一，把产品重心押在这里、并且把其中两个演示的环境与轨迹公开出来，比再刷几个基准分更有价值。

下一章讲支撑这个方向的训练侧投入——那里有一个在转述中走了样的数字。👉 [4000 个 RL 环境：一张图里的数字](https://daiw.net/manual/qwen3-8-max/rl-environments)

## 参考文献

- [1] Qwen Team. “[Qwen3.8-Max：编程与办公，全面跃升](https://qwen.ai/blog?id=qwen3.8).” 2026-08-03 —— 五个长时程演示的原文与数字。
- [2] [qwen-code-dev-bot/oh-my-cli](https://github.com/qwen-code-dev-bot/oh-my-cli)，GitHub —— 提交、PR 与 issue 记录（本专栏 2026-09-19 统计）。
- [3] Wei Fan, et al. “E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation.” 2026-08-31. [arXiv:2608.30730](https://arxiv.org/abs/2608.30730)；代码与数据：[QwenLM/E-CommerceBench](https://github.com/QwenLM/E-CommerceBench) —— 环境设定、5 局均值与完整排行。
- [4] Xiaoyuan Li, et al. “Unified Data Selection for LLM Reasoning.” 2026-05. [arXiv:2605.22389](https://arxiv.org/abs/2605.22389) —— 论文复现演示所用的论文。
- [5] 第三方发布分析（2026-08）：Qwen3.8-Max 官方指南整理 —— 初稿引用的二手数字来源（已按官方博客核对）。
