那些长时程主张

16 天自主开发一个项目、365 天电商模拟、500 轮芯片优化——逐条拆开阿里的长时程演示;其中两项的轨迹与环境后来公开了,核对之后,有的数字站得住,有的换了一副面孔。

作者 David更新于 6 篇(共 11 篇)

那些长时程主张

本章在 2026 年 9 月 19 日做过较大修订。 初稿依据二手整理,把五个演示都当作“外界无法核对”。回到官方博客原文、再加上之后公开的材料,情况变了:oh-my-cli 的完整轨迹就在 GitHub 上,电商模拟的环境、数据与论文也都开源了;芯片设计与论文复现两项的“基线”,博客里也有交代。下文保留初稿的评估框架,逐条换上新证据。

Qwen3.8-Max 发布材料的重心不在基准表,而在五个长时程自主任务的演示。这是它区别于同代模型的地方,值得逐条看。

以下数字均出自官方博客,属于厂商口径。 其中两项现在可以自己核对或重跑,另外三项仍然只能看厂商怎么说。读它们的正确姿势不是“信 / 不信”,而是分辨哪些数字带有真实信息、哪些只是规模的展示

五个演示

演示声称的成果外界能否核对
oh-my-cli 自主开发16 天(截至 7 月 30 日),265 次提交、127 个 PR、151 个 issue:完整轨迹公开在 GitHub
论文复现5 天(约 125 小时),约 7,600 行代码1,100 多步操作33 轮 GPU 训练;AIME24 从 49.58% 提到 52.29%
多模态竞赛24 小时45 次提交,准确率从 0.60 爬到 0.853,超过 526 支队伍中的 458 支否,只有厂商报告的名次
芯片设计优化500 轮交互、71 次评估,门数 8,298 → 678,版图 106×106 → 46×46 微米
电商模拟365 天,起始 10 万元 → 年末 416,252 元:环境、数据与论文已开源

逐条评估

现在可以自己核对的:oh-my-cli

初稿对这一条的判断是:“16 天、265 提交、127 PR”测的是产出量,不是产出质量,而且外界无从核对。后一半已经不成立了——博客写明项目的完整轨迹公开在 GitHub 仓库 qwen-code-dev-bot/oh-my-cli,本专栏按仓库记录数了一遍:

截至 2026-07-30仓库记录博客说法
默认分支上的提交265265
PR127(其中 119 个已合并)127
issue151151

数字对得上。仓库 7 月 13 日建立并在当天首次提交,到 7 月 30 日前后十六七天;之后它又继续跑到 8 月 12 日,截至 9 月 19 日累计 841 次提交、405 个 PR、475 个 issue。

“完全由 AI 自主运行”这一说法要加个注:截至 7 月 30 日的 265 次提交里,257 次出自机器人账号 qwen-code-dev-bot,另外 8 次出自一个个人账号——其中 6 次是 7 月 13 日第一天搭建“自治规则与治理”的初始设置,2 次是 7 月 23 日调整治理节奏;这个账号还开了 4 个 PR、3 个 issue,其中一个 issue 的标题就以“User feedback”开头。这和博客说的“把用户反馈纳入工程循环”并不矛盾,但说明人设定了规则、中途调过一次参数、也提过需求,代码主要是模型写的

至于质量:代码就在那里,任何人都可以去读。本专栏没有做代码审阅。“能在无人干预下连续运转很多天而不崩溃、不跑偏”这个耐久性结论,现在有了可查的证据;“写得好不好”,仍需要读代码的人自己判断。顺带一提,仓库说明写的是“用 Qwen Code 构建”——这个演示跑在 Qwen Code 上,而不是初稿以为的 Qoder。

现在可以自己重跑的:365 天电商模拟

初稿说这一条“看起来最惊人,实际上信息量最低”,因为结果完全取决于模拟环境的设定,并列了两个成为证据的前提:基线(同一环境里别的做法能做到多少)和环境的公开性(外界能不能自己跑)。8 月底,两样都有了:Qwen 团队把这个 E-Commerce Bench 的代码与数据以 Apache 2.0 开源,并在 arXiv 上发表了论文(2608.30730)。

论文与仓库交代的设定:智能体手握 10 万元,最多同时经营 4 家店,跑满 365 个模拟日;商品与供应商数据来自真实电商平台的脱敏数据(6,886 种商品、60 个类目、576 家供应商,其中 152 家是骗子);需求与供应商报价都是确定性的——供应商的让步由一个固定的谈判内核决定,大模型只负责把决定说成人话,口才再好也压不破底价。每个模型跑 5 局,报均值。

放到完整的排行里,这个数字换了一副面孔:

模型年末资产均值(5 局)
GPT-5.6 Sol(max)143.1 万元
Fable5(max)80.5 万元
GPT-5.570.2 万元(5 局中 2 局破产)
Claude Opus 4.8(max)49.8 万元
Qwen3.8-Max(论文发表后补测)47.2 万元
Qwen3.8-Max-Preview41.6 万元
GLM-5.3(max,发表后补测)39.1 万元
GLM 5.2(high)30.1 万元
Qwen3.7-Max16.5 万元
Qwen3.5-Plus0.1 万元(5 局中 4 局破产)

(节选自仓库 README 的 21 行排行表。)

博客里“以 416,252 元胜出,超过第二名 GLM 5.2 达 38%,比 Qwen3.7-Max 提升 152%”这三个数字都对得上——但论文摘要的原话是“在开放权重模型中,Qwen3.8-Max-Preview 以 416,252 领先”,所有模型一起排,第一是 GPT-5.6 Sol 的 1,431,425。博客发布时这些闭源模型有没有跑完,我们不知道;但按论文的完整排行,“胜出”只在开放权重组里成立,省掉的正是最关键的那半句话。

这张表也回答了初稿的另一个疑问——“一个宽松的模拟器可以让任何策略赚钱”。事实并非如此:Qwen3.5-Plus 五局里破产四次,连它在内共有三个模型一年下来亏了本。环境是有区分度的。

论文还提醒了单看年末资产的局限:赚得最多的 GPT-5.6 Sol,把 18.5% 的采购款付给了骗子供应商,在“防骗”一项上 18 个模型里排第 16。按论文的七个维度,Qwen3.8-Max-Preview 最突出的是“学习”一项——在重复采购里一轮轮把价格压下去,这与博客说的“持续学习”一致。

要注意这仍然不是独立评测:基准、论文与排行都出自 Qwen 团队自己。不同之处在于它开源了,任何人都可以拿同一套环境去复跑,去检查它有没有偏向自家模型。这比一个只报结果的演示高了一个档次。

有外部参照系的:多模态竞赛

这一条对照的是真实的人类参赛者:WWW2025 多模态对话意图识别挑战赛,托管在阿里云天池,526 支队伍。任务是读懂电商客服对话(文字加截图),判断顾客想要什么。0.853 是个可对照的绝对数字,“超过 458 支”约等于排在前 13%——很强,但不是夺冠,这个诚实的定位反而增加了它的可信度。

博客原文补了两个初稿没有的细节。一是模型的做法:它没有直接去答题,而是像一个算法工程师那样训练了一套小模型——微调 BERT、MacBERT、RoBERTa 处理文字,微调 Qwen2.5-VL-7B 处理截图,再用加权投票把它们融合起来。二是时间:从名字看这是 2025 年那届会议的配套赛事,Qwen3.8-Max 在 2026 年才参加,所以“击败 458 支队伍”应理解为拿成绩对照当年的排名,而非同期同台(这是本专栏的推断,博客没有说明提交方式)。

基线有了交代的:芯片设计优化

初稿在这一条上问了一个关键问题:起点 8,298 门的设计是谁做的? 博客原文给了答案:任务从一个“没有内部逻辑的 RTL 接口骨架”开始,8,298 门是模型自己第一个跑通功能验证的设计,之后它在约 500 轮交互、71 次评估里把门数压到 678。

所以初稿的担心成立了一半:12 倍的压缩是相对它自己的初版,而初版本身就是一个朴素实现——光“把 16 位的硬件取模除法器换成迭代移位减法”这一步就砍掉了 6,288 门,占全部缩减的八成以上。真正带有比较意义的是另一句话:678 门“在所有参评模型中表现最优”,但博客正文没有给出其他模型的数字(厂商口径,待独立验证)。

值得肯定的是指标本身:门数、面积、布线长度、时序都是硬指标。版图面积从 106×106 微米缩到 46×46 微米(缩小约 81%),总布线长度从 33,369 微米降到 4,187 微米,时序从严重违例(-4.46 ns)变成在 500 MHz 下收敛(+0.66 ns);每一版都要通过 cocotb 的随机功能验证。有明确优化目标、可量化的工程指标,是五个演示里最不“主观”的一个。

有基线、但幅度很小的:论文复现

“7,600 行、1,100 步、33 轮训练”测的仍然是产出量。不过博客原文也给了质量指标:模型先花约 37 小时从零搭起论文的训练与评测流水线,复现了论文的六项主要结论(论文方法在 AIME24 上比随机挑选数据高 7.7%);再用约 88 小时跑了四轮、试了 18 个改进想法,最好的一个把 AIME24 从 49.58% 提到 52.29%,提升 2.71 个百分点。

有基线、有过程,这比只报代码量强得多。但要注意两点:一是幅度——AIME24 只有 30 道题,2.7 个百分点在没有方差、没有重复实验的情况下,很难判断是真实的改进还是运气;二是选题——被复现的那篇论文 2026 年 5 月才上 arXiv,作者里有 Qwen 团队的成员,模型的训练数据里有没有它,博客没有说明。这是一个“做通了”的证据,不是“做好了”的证据。

一个共同的问题:只报成功

五个演示里,四个是单次运行的成功案例:没有失败率、没有跑了多少次取最好的一次、没有中途人工干预的记录(oh-my-cli 算半个例外,人的参与在提交历史里看得见)。唯一报了重复实验的是电商模拟——每个模型 5 局,连破产次数都列了出来。

对长时程任务来说,这些信息恰恰是最关键的:

  • 一个模型 10 次里成功 1 次,和 10 次里成功 9 次,是完全不同的两个产品;
  • 长时程任务的失败模式(陷入循环、偏离目标、破坏已有成果)往往比成功路径更值得了解。

这不是针对阿里——所有厂商的演示材料都是这么做的。 但读的时候要把这一层折扣算进去。

那么,该怎么看待这些演示

初稿的结论是:

这些演示证明了“长时程自主运行”是这个模型认真投入的方向,也证明了它至少能跑通这类任务。它们不能证明这个方向上它比同代模型更强——因为没有可比的对照。

核对之后,前一半更站得住了:oh-my-cli 的轨迹可查,电商模拟的环境可以复跑。后一半有了一个答案,而且不是博客想让你读到的那个:在唯一一个公开了完整对照的演示里,它是开放权重模型中最好的,但排在四个闭源模型之后。

值得肯定的仍然是方向。长时程自主是当前 agent 最大的短板之一,把产品重心押在这里、并且把其中两个演示的环境与轨迹公开出来,比再刷几个基准分更有价值。

下一章讲支撑这个方向的训练侧投入——那里有一个在转述中走了样的数字。👉 4000 个 RL 环境:一张图里的数字

参考文献

  • [1] Qwen Team. “Qwen3.8-Max:编程与办公,全面跃升.” 2026-08-03 —— 五个长时程演示的原文与数字。
  • [2] qwen-code-dev-bot/oh-my-cli,GitHub —— 提交、PR 与 issue 记录(本专栏 2026-09-19 统计)。
  • [3] Wei Fan, et al. “E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation.” 2026-08-31. arXiv:2608.30730;代码与数据:QwenLM/E-CommerceBench —— 环境设定、5 局均值与完整排行。
  • [4] Xiaoyuan Li, et al. “Unified Data Selection for LLM Reasoning.” 2026-05. arXiv:2605.22389 —— 论文复现演示所用的论文。
  • [5] 第三方发布分析(2026-08):Qwen3.8-Max 官方指南整理 —— 初稿引用的二手数字来源(已按官方博客核对)。

本页目录