基准怎么读

逐表读 V4.1-Flash 的官方评测:基座对比、与前沿模型的对照、脚手架差异。能力形状是 Agent 大涨、知识仍弱于 V4-Pro;也要看清模型卡与报告对不上的数字、对照列的真实版本,以及还没有第三方复现这件事。

作者 David更新于 15 篇(共 21 篇)

先说结论:下面每一个数字都是 DeepSeek 自己测的,包括竞品那几列,属于官方口径、待独立验证。本专栏写作时还没有收录第三方复现。

基座模型

三个基座在同一套内部框架、同一评测设置下测得,报告说差距不超过 0.3 分视为同一水平 [1][2]:

基准V4-Flash-BaseV4-Pro-BaseV4.1-Flash-Base
AGIEval83.984.483.4
MMLU-Pro68.373.574.1
C-Eval92.193.192.1
MultiLoKo42.650.945.5
SimpleQA-Verified30.155.242.3
SuperGPQA46.553.953.1
BBH86.987.586.1
BBEH25.429.827.2
DROP88.688.787.9
HellaSwag85.788.087.2
BigCodeBench56.859.260.6
HumanEval69.576.879.4
GSM8K90.892.693.0
MATH57.464.561.1
MGSM85.784.480.2
LongBench-V244.751.545.2

报告的解读是:V4.1-Flash-Base 的世界知识与理解能力和 V4-Pro-Base 相当,推理与代码接近或超过 V4-Pro-Base [1]。逐行看会更细一些:代码与 MMLU-Pro 追上甚至超过了 Pro,但 SimpleQA-Verified、MultiLoKo 这类考“记住多少”的项,以及长上下文的 LongBench-V2,仍明显落后于 Pro;MGSM 甚至比前代还低。

指令模型:与前沿模型对照

全部在最高推理强度(100)下测,temperature=1.0top_p=0.95 [1][2]。V4-Pro 与 V4-Flash 两列是前代:

基准Opus-5GPT-5.6 SolKimi K3GLM-5.3V4-ProV4-FlashV4.1-Flash
GPQA Diamond93.494.192.988.192.489.990.9
HLE56.344.543.542.0†42.7†37.8†36.8(39.1†)
Codeforces(Rating)334832893471
MathArena Apex65.665.358.665.6
Terminal-Bench 2.189.188.888.388.287.982.790.6
Terminal-Bench 3.043.334.417.728.311.87.630.0
Terminal-Bench 4.051.839.912.637.912.47.031.2
DeepSWE v1.174.073.067.566.962.754.474.2
ProgramBench37.023.017.519.015.520.3
NL2Repo-Bench75.356.858.058.061.554.265.4
CyberGym84.580.084.583.376.788.1
SEC-Bench Pro74.356.430.962.8
ExploitGym22.133.715.05.41.815.3
HLE(带工具)63.659.862.560.051.563.9
AutomationBench50.345.846.748.843.237.754.8
Agent's Last Exam28.626.727.628.525.725.231.8

† 为 HLE 的纯文本子集。视觉 Agent 三项放在多模态那一章

能力形状

  • Agent 大涨:相对前代 V4-Flash,DeepSWE 从 54.4 到 74.2,Terminal-Bench 3.0 从 7.6 到 30.0、4.0 从 7.0 到 31.2,SEC-Bench Pro 从 30.9 到 62.8。多数常规 Agent 基准上它与闭源前沿模型打平或领先。
  • 最难的一档仍有差距:Terminal-Bench 3.0 / 4.0、ProgramBench、NL2Repo 上离 Opus-5 还差十几到二十分。报告自己也承认,在需要专家级领域知识的科学类 Agent 任务(例如 Terminal-Bench 4.0)上,与“巨型模型”仍有差距 [1]。
  • 推理不再是短板:Codeforces 3471 是 DeepSeek 各代最高,MathArena Apex 与 K3 持平。但 HLE 纯文本子集 39.1 仍低于 V4-Pro 的 42.7。
  • 知识仍是弱项:基座 SimpleQA-Verified 42.3,比前代的 30.1 高了一截,但离 V4-Pro-Base 的 55.2 还远。报告说知识密集型表现“主要由预训练决定”,所以后训练评测里基本不再测它 [1]。
  • 网络安全:报告称在开源模型里达到新的最佳水平,并提醒这类能力的两用性,鼓励用于防御性研究和漏洞修复 [1]。

实用推论没变:这类模型要配检索用。 需要准确事实的应用(企业文档问答、法规、产品信息),别指望参数记忆,上 RAG。V4.1-Flash 的 1M 上下文、890 字节 / token 的缓存和极低的缓存命中价,让“把资料整个塞进上下文”更便宜了——但它在百万级精确检索上的表现,报告没有给数字(见 CSA2 那一章),用之前自己测。

脚手架的影响有多大

同一个检查点、同样的解码设置和任务集,只换外面的 Agent 框架 [1][2]:

脚手架DeepSWE v1.1Terminal-Bench 2.1
Claude Code(v2.1.251)69.888.0
Codex65.684.1
OpenCode65.585.0
Pi66.286.1
mini-SWE74.290.3
DeepSeek Harness(Minimal)72.690.6
DeepSeek Harness(Standard)70.585.8
DeepSeek Harness(PTC)67.685.8

DeepSWE 上最好和最差差了 8.7 分。主表里的 74.2 与 90.6 分别取自 mini-SWE(为对齐 DeepSWE 官方设置)和 DeepSeek 自己的 Harness(Minimal 模式,只给一个 bash 工具)[1]。报告测了四个 Claude Code 版本,平均是 68.9 与 87.8 [1]。报告的结论是模型的 Agent 能力能在不同脚手架间迁移,这与它在很多脚手架上同时做 RL 的训练方式一致(见后训练那一章)。

读这些表时要注意的六件事

  1. 全部是官方口径。 报告没有说明竞品各列是自己复测还是引用厂商数字。Codeforces 一行是 DeepSeek 的内部基准 [1]。
  2. 模型卡和报告有一处对不上:NL2Repo-Bench 上 V4.1-Flash 的分数,技术报告(含 arXiv 版)写 65.4,Hugging Face 模型卡写 64.0 [1][2]。上表取报告的数字,两者以哪个为准官方没有说明。
  3. 前代两列是哪个版本? 报告只写“DS-V4-Flash”“DS-V4-Pro”。对照前代模型卡:V4-Flash 一列的 Terminal-Bench 2.1、DeepSWE、CyberGym、NL2Repo、Agent's Last Exam 与 V4-Flash-0731 模型卡完全相同,V4-Pro 一列与 V4-Pro-0813 模型卡相同 [3][4]。所以它们应当是两者的正式版而非 4 月的预览版——这是本专栏的比对推断,报告没有明说。
  4. AutomationBench 不能跨表比。 0731 模型卡里 V4-Flash-0731 的 AutomationBench(Public)是 25.1,上表里同一个模型是 37.7 [2][3];报告说它用的是 AutomationBench v1.0.6 的公开评测集 [1]。版本不同,数字不能混用。
  5. 都是最高强度。 日常用 high(强度 75)或更低时分数会低一些;强度与分数的关系见推理强度那一章
  6. 评测本身会被钻空子。 报告说,即使限制联网、删掉 Git 历史、清空缓存,仍观察到模型在 CyberGym 里反编译 Ubuntu 核心软件包找漏洞 [1]。越强的模型越会“做题技巧”,基准分数的含义也越需要追问。

和 K3 放在一起

同一张表里(仍是 DeepSeek 测的),V4.1-Flash 在 Terminal-Bench 2.1 / 3.0 / 4.0、DeepSWE、CyberGym、AutomationBench、Agent's Last Exam 上高于 Kimi K3,在 GPQA Diamond 与 HLE 上低于 K3 [1]。价格上,K3 是 $3 / $15(见 K3 专栏),V4.1-Flash 高峰时段是 $0.3 / $1.2,闲时再减半。能力相当或略强,价格低一个数量级——这是 Flash 这条产品线一直以来的定位,V4.1 把“能力相当”的范围扩大到了大部分 Agent 任务。

报告引言里有一句很大的话:V4.1-Flash 在绝大多数基准上已能比肩闭源前沿模型,能完成 95% 以上的真实世界任务 [1]。“95%”没有给出测法,只能当作厂商的自我评价来读;报告的结论一节也写了,基准分数接近并不意味着在最复杂、高难度的推理和边界情形上追平了领先的闭源系统 [1]。

下一章讲怎么把它跑起来。👉 自己跑起来

参考文献

  • [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 表 1(基座)、表 3(与前沿模型对照)、表 4 与表 5(脚手架)、第 5.3.1 节(评测设置、AutomationBench 版本、防作弊措施)、第 1 节与第 6 节(官方自评与局限)。
  • [2] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4.1-Flash —— 同样三张表的模型卡版本(NL2Repo-Bench 为 64.0)。
  • [3] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash-0731 —— 0731 的各项分数,用于比对前代一列。
  • [4] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Pro-0813 —— V4-Pro 正式版的各项分数,用于比对。

本页目录