# 前代 · 0731：V4-Flash 正式版

> 7 月 31 日的 V4-Flash-0731 主干结构没动，DeepSWE 从 7.3 涨到 54.4。拆开这次更新，看清“模型能力”里有多大一块其实是“工具使用与格式对齐”——这条教训在 V4.1 的报告里被说得更直白。

- 作者：David（道雾轩）
- 专栏：DeepSeek V4.1 Flash 深度解析（https://daiw.net/manual/deepseek-v4-flash.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash/post-training-0731
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

<Callout type="info">
  **本篇描述的是前代 V4-Flash-0731。** 它已于 2026 年 9 月 10 日随 V4-Flash 一起从 API 下线，旧模型名路由到 V4.1-Flash；Hugging Face 上的权重仍可下载。

  **更正**：初版依据一篇二手报道，把这次更新概括为“架构与尺寸完全不变，只重新做了后训练”，并引了一句“重新做后训练，不是新设计”。官方模型卡的说法是：0731 是 **V4-Flash 的正式版，取代预览版**，Agent 能力大幅增强；它与 V4-Flash-DSpark **结构相同，即多挂了一个投机解码模块** [1]。对比 `config.json`，主干部分与预览版完全一致，差别只在新增的 DSpark 相关字段 [2]。所以“主干没动”成立，“结构一点没变”不准确。数字也改为直接引用官方模型卡。
</Callout>

## 分数怎么变的

官方模型卡的对比（均为 DeepSeek 自测；代码 Agent 类任务用 DeepSeek Harness 的 minimal 模式、`max` 推理强度、`temperature = 1.0`、`top_p = 0.95`）[1]：

| 基准 | V4-Flash（预览版） | **V4-Flash-0731** | V4-Pro（预览版） |
| --- | --- | --- | --- |
| Terminal-Bench 2.1 | 61.8 | **82.7** | 72.1 |
| NL2Repo | 39.4 | **54.2** | 38.5 |
| Cybergym | 38.7 | **76.7** | 52.7 |
| DeepSWE | 7.3 | **54.4** | 12.8 |
| Toolathlon-Verified | 49.7 | **70.3** | 55.9 |
| Agents' Last Exam | 15.8 | **25.2** | 16.5 |
| AutomationBench（Public） | 10.8 | **25.1** | 12.8 |

每一行，0731 都超过了 1.6T 的 V4-Pro 预览版。这就是本专栏初版开篇那句“小模型跑赢了自家旗舰”的来历。

## 几个提升不是一回事

以下是本专栏的解读，不是官方的说法。

**DeepSWE：7.3 → 54.4。** 起点 7.3 对一个前沿模型来说**异常低**：同一个 V4-Flash 在 High 模式下 LiveCodeBench 有 88.4 [3]，不太可能只有 7.3 分的软件工程能力。更说明问题的是，**1.6T 的 V4-Pro 预览版在这一项也只有 12.8**。更合理的解释是：预览版没有被训练成能正确参与这类评测流程——不会按规范调用编辑工具、输出没法被评测框架解析，或者在多轮工具调用里跑偏。这四十多分里，很大一块买的是**协议对齐**，不是推理能力。

**Cybergym：38.7 → 76.7。** 翻倍。起点不算离谱，说明基础能力在，但发挥受限。

**Terminal-Bench 2.1：61.8 → 82.7。** 起点已经不低，还能涨二十分。**这一档含金量最高**——在模型已经会用工具的前提下，把长程终端操作的成功率往上推，靠的是实打实的策略改进。

<Callout type="info">
  **读基准提升时，先看起点。** 从 5 分涨到 50 分和从 60 分涨到 80 分，是两件不同的事：前者通常是“打通了某个环节”，后者才是“变强了”。发布材料往往更强调前者，因为数字更好看。
</Callout>

## 这件事说明什么

**架构决定上限，后训练决定你实际能拿到多少。** 同一个主干、同一套注意力、同一批专家，换一轮后训练，Agent 表现天差地别。这解释了几个常见的困惑：

- **为什么有些开放权重模型“跑分很高但用起来不行”**：基础能力测出来了，但工具使用、指令遵循、格式稳定性这些“用起来”的部分没训到位。
- **为什么小模型能赢大模型**：0731 压过 V4-Pro 预览版，靠的不是更聪明，而是被针对性地训过。
- **为什么微调有时收益巨大**：模型在你的场景里表现差，很可能不是能力不足，而是没对齐到你的接口与格式。

一个半月后，V4.1 的技术报告把同一条教训写成了明文：后训练“没有算法创新”，收益几乎全部来自合成数据与环境的规模、多样性和可验证性 [4]。

## 对使用开放权重的人意味着什么

**下载权重时要认准版本号。** V4-Flash 与 V4-Flash-0731 的主干一样、加载方式一样，但在 Agent 场景下差着几十分。初版说两者“文件大小一样”，这也不对：0731 多了投机解码模块，官方仓库约 167 GB、48 个分片，预览版约 160 GB、46 个分片 [5]。从镜像站或旧教程里拿到预览版，你会得到一个“看起来对、用起来怪”的模型，而且很难排查。

<Callout type="warn">
  这类“同名不同版”的坑在开放权重生态里越来越常见。**部署前核对模型仓库的提交与更新日期，别只看仓库名。** 社区量化版（GGUF、AWQ 等）尤其要看它基于哪个版本转换——社区版的更新往往滞后于官方。这条建议对 V4.1 同样适用：它的编码器在发布当天就改过一次推理强度的映射（见[推理强度那一章](https://daiw.net/manual/deepseek-v4-flash/reasoning-effort)）。
</Callout>

## 一个开放问题

官方没有公开 0731 这轮后训练具体做了什么——是扩充了 Agent 强化学习的环境、改了奖励设计，还是补了工具使用的监督数据。当时这一层信息几乎没有厂商会公开。

到了 V4.1，DeepSeek 多讲了一些：任务怎么合成、环境怎么由多个 Agent 协作搭建、百万级沙箱怎么管（见[后训练那一章](https://daiw.net/manual/deepseek-v4-flash/post-training)）。但“有多少”——多少任务、多少环境、多少算力——仍然没有数字。**这是这一代“开放权重”的真实边界：你能拿到结果和流程的轮廓，拿不到配方本身。**

前代档案到此结束。最后一章收束整个专栏。👉 [回顾：压缩路线走到哪了](https://daiw.net/manual/deepseek-v4-flash/recap)

## 参考文献

- [1] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) —— “V4-Flash 的正式版，取代预览版”、与 V4-Flash-DSpark 结构相同、各项分数与评测设置。
- [2] Hugging Face：[DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash/blob/main/config.json) 与 [DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/config.json) 的 `config.json` —— 两者主干字段一致，0731 多出 `dspark_*` 字段。
- [3] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) —— 预览版在 High 模式下的 LiveCodeBench 88.4。
- [4] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969) —— 第 5.1 节：后训练没有算法创新、收益归于数据与环境。
- [5] Hugging Face 上两个仓库的文件列表 —— 权重体积与分片数。
