前代 · 0731:V4-Flash 正式版
7 月 31 日的 V4-Flash-0731 主干结构没动,DeepSWE 从 7.3 涨到 54.4。拆开这次更新,看清“模型能力”里有多大一块其实是“工具使用与格式对齐”——这条教训在 V4.1 的报告里被说得更直白。
本篇描述的是前代 V4-Flash-0731。 它已于 2026 年 9 月 10 日随 V4-Flash 一起从 API 下线,旧模型名路由到 V4.1-Flash;Hugging Face 上的权重仍可下载。
更正:初版依据一篇二手报道,把这次更新概括为“架构与尺寸完全不变,只重新做了后训练”,并引了一句“重新做后训练,不是新设计”。官方模型卡的说法是:0731 是 V4-Flash 的正式版,取代预览版,Agent 能力大幅增强;它与 V4-Flash-DSpark 结构相同,即多挂了一个投机解码模块 [1]。对比 config.json,主干部分与预览版完全一致,差别只在新增的 DSpark 相关字段 [2]。所以“主干没动”成立,“结构一点没变”不准确。数字也改为直接引用官方模型卡。
分数怎么变的
官方模型卡的对比(均为 DeepSeek 自测;代码 Agent 类任务用 DeepSeek Harness 的 minimal 模式、max 推理强度、temperature = 1.0、top_p = 0.95)[1]:
| 基准 | V4-Flash(预览版) | V4-Flash-0731 | V4-Pro(预览版) |
|---|---|---|---|
| Terminal-Bench 2.1 | 61.8 | 82.7 | 72.1 |
| NL2Repo | 39.4 | 54.2 | 38.5 |
| Cybergym | 38.7 | 76.7 | 52.7 |
| DeepSWE | 7.3 | 54.4 | 12.8 |
| Toolathlon-Verified | 49.7 | 70.3 | 55.9 |
| Agents' Last Exam | 15.8 | 25.2 | 16.5 |
| AutomationBench(Public) | 10.8 | 25.1 | 12.8 |
每一行,0731 都超过了 1.6T 的 V4-Pro 预览版。这就是本专栏初版开篇那句“小模型跑赢了自家旗舰”的来历。
几个提升不是一回事
以下是本专栏的解读,不是官方的说法。
DeepSWE:7.3 → 54.4。 起点 7.3 对一个前沿模型来说异常低:同一个 V4-Flash 在 High 模式下 LiveCodeBench 有 88.4 [3],不太可能只有 7.3 分的软件工程能力。更说明问题的是,1.6T 的 V4-Pro 预览版在这一项也只有 12.8。更合理的解释是:预览版没有被训练成能正确参与这类评测流程——不会按规范调用编辑工具、输出没法被评测框架解析,或者在多轮工具调用里跑偏。这四十多分里,很大一块买的是协议对齐,不是推理能力。
Cybergym:38.7 → 76.7。 翻倍。起点不算离谱,说明基础能力在,但发挥受限。
Terminal-Bench 2.1:61.8 → 82.7。 起点已经不低,还能涨二十分。这一档含金量最高——在模型已经会用工具的前提下,把长程终端操作的成功率往上推,靠的是实打实的策略改进。
读基准提升时,先看起点。 从 5 分涨到 50 分和从 60 分涨到 80 分,是两件不同的事:前者通常是“打通了某个环节”,后者才是“变强了”。发布材料往往更强调前者,因为数字更好看。
这件事说明什么
架构决定上限,后训练决定你实际能拿到多少。 同一个主干、同一套注意力、同一批专家,换一轮后训练,Agent 表现天差地别。这解释了几个常见的困惑:
- 为什么有些开放权重模型“跑分很高但用起来不行”:基础能力测出来了,但工具使用、指令遵循、格式稳定性这些“用起来”的部分没训到位。
- 为什么小模型能赢大模型:0731 压过 V4-Pro 预览版,靠的不是更聪明,而是被针对性地训过。
- 为什么微调有时收益巨大:模型在你的场景里表现差,很可能不是能力不足,而是没对齐到你的接口与格式。
一个半月后,V4.1 的技术报告把同一条教训写成了明文:后训练“没有算法创新”,收益几乎全部来自合成数据与环境的规模、多样性和可验证性 [4]。
对使用开放权重的人意味着什么
下载权重时要认准版本号。 V4-Flash 与 V4-Flash-0731 的主干一样、加载方式一样,但在 Agent 场景下差着几十分。初版说两者“文件大小一样”,这也不对:0731 多了投机解码模块,官方仓库约 167 GB、48 个分片,预览版约 160 GB、46 个分片 [5]。从镜像站或旧教程里拿到预览版,你会得到一个“看起来对、用起来怪”的模型,而且很难排查。
这类“同名不同版”的坑在开放权重生态里越来越常见。部署前核对模型仓库的提交与更新日期,别只看仓库名。 社区量化版(GGUF、AWQ 等)尤其要看它基于哪个版本转换——社区版的更新往往滞后于官方。这条建议对 V4.1 同样适用:它的编码器在发布当天就改过一次推理强度的映射(见推理强度那一章)。
一个开放问题
官方没有公开 0731 这轮后训练具体做了什么——是扩充了 Agent 强化学习的环境、改了奖励设计,还是补了工具使用的监督数据。当时这一层信息几乎没有厂商会公开。
到了 V4.1,DeepSeek 多讲了一些:任务怎么合成、环境怎么由多个 Agent 协作搭建、百万级沙箱怎么管(见后训练那一章)。但“有多少”——多少任务、多少环境、多少算力——仍然没有数字。这是这一代“开放权重”的真实边界:你能拿到结果和流程的轮廓,拿不到配方本身。
前代档案到此结束。最后一章收束整个专栏。👉 回顾:压缩路线走到哪了
参考文献
- [1] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash-0731 —— “V4-Flash 的正式版,取代预览版”、与 V4-Flash-DSpark 结构相同、各项分数与评测设置。
- [2] Hugging Face:DeepSeek-V4-Flash 与 DeepSeek-V4-Flash-0731 的
config.json—— 两者主干字段一致,0731 多出dspark_*字段。 - [3] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash —— 预览版在 High 模式下的 LiveCodeBench 88.4。
- [4] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 第 5.1 节:后训练没有算法创新、收益归于数据与环境。
- [5] Hugging Face 上两个仓库的文件列表 —— 权重体积与分片数。