前代 · 0731:V4-Flash 正式版

7 月 31 日的 V4-Flash-0731 主干结构没动,DeepSWE 从 7.3 涨到 54.4。拆开这次更新,看清“模型能力”里有多大一块其实是“工具使用与格式对齐”——这条教训在 V4.1 的报告里被说得更直白。

作者 David更新于 20 篇(共 21 篇)

本篇描述的是前代 V4-Flash-0731。 它已于 2026 年 9 月 10 日随 V4-Flash 一起从 API 下线,旧模型名路由到 V4.1-Flash;Hugging Face 上的权重仍可下载。

更正:初版依据一篇二手报道,把这次更新概括为“架构与尺寸完全不变,只重新做了后训练”,并引了一句“重新做后训练,不是新设计”。官方模型卡的说法是:0731 是 V4-Flash 的正式版,取代预览版,Agent 能力大幅增强;它与 V4-Flash-DSpark 结构相同,即多挂了一个投机解码模块 [1]。对比 config.json,主干部分与预览版完全一致,差别只在新增的 DSpark 相关字段 [2]。所以“主干没动”成立,“结构一点没变”不准确。数字也改为直接引用官方模型卡。

分数怎么变的

官方模型卡的对比(均为 DeepSeek 自测;代码 Agent 类任务用 DeepSeek Harness 的 minimal 模式、max 推理强度、temperature = 1.0top_p = 0.95)[1]:

基准V4-Flash(预览版)V4-Flash-0731V4-Pro(预览版)
Terminal-Bench 2.161.882.772.1
NL2Repo39.454.238.5
Cybergym38.776.752.7
DeepSWE7.354.412.8
Toolathlon-Verified49.770.355.9
Agents' Last Exam15.825.216.5
AutomationBench(Public)10.825.112.8

每一行,0731 都超过了 1.6T 的 V4-Pro 预览版。这就是本专栏初版开篇那句“小模型跑赢了自家旗舰”的来历。

几个提升不是一回事

以下是本专栏的解读,不是官方的说法。

DeepSWE:7.3 → 54.4。 起点 7.3 对一个前沿模型来说异常低:同一个 V4-Flash 在 High 模式下 LiveCodeBench 有 88.4 [3],不太可能只有 7.3 分的软件工程能力。更说明问题的是,1.6T 的 V4-Pro 预览版在这一项也只有 12.8。更合理的解释是:预览版没有被训练成能正确参与这类评测流程——不会按规范调用编辑工具、输出没法被评测框架解析,或者在多轮工具调用里跑偏。这四十多分里,很大一块买的是协议对齐,不是推理能力。

Cybergym:38.7 → 76.7。 翻倍。起点不算离谱,说明基础能力在,但发挥受限。

Terminal-Bench 2.1:61.8 → 82.7。 起点已经不低,还能涨二十分。这一档含金量最高——在模型已经会用工具的前提下,把长程终端操作的成功率往上推,靠的是实打实的策略改进。

读基准提升时,先看起点。 从 5 分涨到 50 分和从 60 分涨到 80 分,是两件不同的事:前者通常是“打通了某个环节”,后者才是“变强了”。发布材料往往更强调前者,因为数字更好看。

这件事说明什么

架构决定上限,后训练决定你实际能拿到多少。 同一个主干、同一套注意力、同一批专家,换一轮后训练,Agent 表现天差地别。这解释了几个常见的困惑:

  • 为什么有些开放权重模型“跑分很高但用起来不行”:基础能力测出来了,但工具使用、指令遵循、格式稳定性这些“用起来”的部分没训到位。
  • 为什么小模型能赢大模型:0731 压过 V4-Pro 预览版,靠的不是更聪明,而是被针对性地训过。
  • 为什么微调有时收益巨大:模型在你的场景里表现差,很可能不是能力不足,而是没对齐到你的接口与格式。

一个半月后,V4.1 的技术报告把同一条教训写成了明文:后训练“没有算法创新”,收益几乎全部来自合成数据与环境的规模、多样性和可验证性 [4]。

对使用开放权重的人意味着什么

下载权重时要认准版本号。 V4-Flash 与 V4-Flash-0731 的主干一样、加载方式一样,但在 Agent 场景下差着几十分。初版说两者“文件大小一样”,这也不对:0731 多了投机解码模块,官方仓库约 167 GB、48 个分片,预览版约 160 GB、46 个分片 [5]。从镜像站或旧教程里拿到预览版,你会得到一个“看起来对、用起来怪”的模型,而且很难排查。

这类“同名不同版”的坑在开放权重生态里越来越常见。部署前核对模型仓库的提交与更新日期,别只看仓库名。 社区量化版(GGUF、AWQ 等)尤其要看它基于哪个版本转换——社区版的更新往往滞后于官方。这条建议对 V4.1 同样适用:它的编码器在发布当天就改过一次推理强度的映射(见推理强度那一章)。

一个开放问题

官方没有公开 0731 这轮后训练具体做了什么——是扩充了 Agent 强化学习的环境、改了奖励设计,还是补了工具使用的监督数据。当时这一层信息几乎没有厂商会公开。

到了 V4.1,DeepSeek 多讲了一些:任务怎么合成、环境怎么由多个 Agent 协作搭建、百万级沙箱怎么管(见后训练那一章)。但“有多少”——多少任务、多少环境、多少算力——仍然没有数字。这是这一代“开放权重”的真实边界:你能拿到结果和流程的轮廓,拿不到配方本身。

前代档案到此结束。最后一章收束整个专栏。👉 回顾:压缩路线走到哪了

参考文献

  • [1] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash-0731 —— “V4-Flash 的正式版,取代预览版”、与 V4-Flash-DSpark 结构相同、各项分数与评测设置。
  • [2] Hugging Face:DeepSeek-V4-FlashDeepSeek-V4-Flash-0731config.json —— 两者主干字段一致,0731 多出 dspark_* 字段。
  • [3] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash —— 预览版在 High 模式下的 LiveCodeBench 88.4。
  • [4] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 第 5.1 节:后训练没有算法创新、收益归于数据与环境。
  • [5] Hugging Face 上两个仓库的文件列表 —— 权重体积与分片数。

本页目录