# 基准怎么读

> 逐表读 V4.1-Flash 的官方评测：基座对比、与前沿模型的对照、脚手架差异。能力形状是 Agent 大涨、知识仍弱于 V4-Pro；也要看清模型卡与报告对不上的数字、对照列的真实版本，以及还没有第三方复现这件事。

- 作者：David（道雾轩）
- 专栏：DeepSeek V4.1 Flash 深度解析（https://daiw.net/manual/deepseek-v4-flash.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash/benchmarks
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

先说结论：**下面每一个数字都是 DeepSeek 自己测的**，包括竞品那几列，属于官方口径、待独立验证。本专栏写作时还没有收录第三方复现。

## 基座模型

三个基座在同一套内部框架、同一评测设置下测得，报告说差距不超过 0.3 分视为同一水平 [1][2]：

| 基准 | V4-Flash-Base | V4-Pro-Base | **V4.1-Flash-Base** |
| --- | --- | --- | --- |
| AGIEval | 83.9 | 84.4 | 83.4 |
| MMLU-Pro | 68.3 | 73.5 | **74.1** |
| C-Eval | 92.1 | 93.1 | 92.1 |
| MultiLoKo | 42.6 | 50.9 | 45.5 |
| SimpleQA-Verified | 30.1 | 55.2 | 42.3 |
| SuperGPQA | 46.5 | 53.9 | 53.1 |
| BBH | 86.9 | 87.5 | 86.1 |
| BBEH | 25.4 | 29.8 | 27.2 |
| DROP | 88.6 | 88.7 | 87.9 |
| HellaSwag | 85.7 | 88.0 | 87.2 |
| BigCodeBench | 56.8 | 59.2 | **60.6** |
| HumanEval | 69.5 | 76.8 | **79.4** |
| GSM8K | 90.8 | 92.6 | **93.0** |
| MATH | 57.4 | 64.5 | 61.1 |
| MGSM | 85.7 | 84.4 | 80.2 |
| LongBench-V2 | 44.7 | 51.5 | 45.2 |

报告的解读是：V4.1-Flash-Base 的世界知识与理解能力和 V4-Pro-Base 相当，推理与代码接近或超过 V4-Pro-Base [1]。逐行看会更细一些：**代码与 MMLU-Pro 追上甚至超过了 Pro，但 SimpleQA-Verified、MultiLoKo 这类考“记住多少”的项，以及长上下文的 LongBench-V2，仍明显落后于 Pro**；MGSM 甚至比前代还低。

## 指令模型：与前沿模型对照

全部在最高推理强度（100）下测，`temperature=1.0`、`top_p=0.95` [1][2]。V4-Pro 与 V4-Flash 两列是前代：

| 基准 | Opus-5 | GPT-5.6 Sol | Kimi K3 | GLM-5.3 | V4-Pro | V4-Flash | **V4.1-Flash** |
| --- | --- | --- | --- | --- | --- | --- | --- |
| GPQA Diamond | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 89.9 | 90.9 |
| HLE | 56.3 | 44.5 | 43.5 | 42.0† | 42.7† | 37.8† | 36.8（39.1†） |
| Codeforces（Rating） | — | — | — | — | 3348 | 3289 | **3471** |
| MathArena Apex | — | — | 65.6 | — | 65.3 | 58.6 | **65.6** |
| Terminal-Bench 2.1 | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 82.7 | **90.6** |
| Terminal-Bench 3.0 | **43.3** | 34.4 | 17.7 | 28.3 | 11.8 | 7.6 | 30.0 |
| Terminal-Bench 4.0 | **51.8** | 39.9 | 12.6 | 37.9 | 12.4 | 7.0 | 31.2 |
| DeepSWE v1.1 | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 54.4 | **74.2** |
| ProgramBench | **37.0** | 23.0 | 17.5 | 19.0 | 15.5 | — | 20.3 |
| NL2Repo-Bench | **75.3** | 56.8 | 58.0 | 58.0 | 61.5 | 54.2 | 65.4 |
| CyberGym | — | 84.5 | 80.0 | 84.5 | 83.3 | 76.7 | **88.1** |
| SEC-Bench Pro | — | **74.3** | — | — | 56.4 | 30.9 | 62.8 |
| ExploitGym | 22.1 | **33.7** | — | 15.0 | 5.4 | 1.8 | 15.3 |
| HLE（带工具） | 63.6 | — | 59.8 | 62.5 | 60.0 | 51.5 | **63.9** |
| AutomationBench | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 37.7 | **54.8** |
| Agent's Last Exam | 28.6 | 26.7 | 27.6 | 28.5 | 25.7 | 25.2 | **31.8** |

† 为 HLE 的纯文本子集。视觉 Agent 三项放在[多模态那一章](https://daiw.net/manual/deepseek-v4-flash/multimodal)。

## 能力形状

- **Agent 大涨**：相对前代 V4-Flash，DeepSWE 从 54.4 到 74.2，Terminal-Bench 3.0 从 7.6 到 30.0、4.0 从 7.0 到 31.2，SEC-Bench Pro 从 30.9 到 62.8。多数常规 Agent 基准上它与闭源前沿模型打平或领先。
- **最难的一档仍有差距**：Terminal-Bench 3.0 / 4.0、ProgramBench、NL2Repo 上离 Opus-5 还差十几到二十分。报告自己也承认，在需要专家级领域知识的科学类 Agent 任务（例如 Terminal-Bench 4.0）上，与“巨型模型”仍有差距 [1]。
- **推理不再是短板**：Codeforces 3471 是 DeepSeek 各代最高，MathArena Apex 与 K3 持平。但 HLE 纯文本子集 39.1 仍低于 V4-Pro 的 42.7。
- **知识仍是弱项**：基座 SimpleQA-Verified 42.3，比前代的 30.1 高了一截，但离 V4-Pro-Base 的 55.2 还远。报告说知识密集型表现“主要由预训练决定”，所以后训练评测里基本不再测它 [1]。
- **网络安全**：报告称在开源模型里达到新的最佳水平，并提醒这类能力的两用性，鼓励用于防御性研究和漏洞修复 [1]。

<Callout type="info">
  **实用推论没变：这类模型要配检索用。** 需要准确事实的应用（企业文档问答、法规、产品信息），别指望参数记忆，上 RAG。V4.1-Flash 的 1M 上下文、890 字节 / token 的缓存和极低的缓存命中价，让“把资料整个塞进上下文”更便宜了——但它在百万级精确检索上的表现，报告没有给数字（见 [CSA2 那一章](https://daiw.net/manual/deepseek-v4-flash/csa2)），用之前自己测。
</Callout>

## 脚手架的影响有多大

同一个检查点、同样的解码设置和任务集，只换外面的 Agent 框架 [1][2]：

| 脚手架 | DeepSWE v1.1 | Terminal-Bench 2.1 |
| --- | --- | --- |
| Claude Code（v2.1.251） | 69.8 | 88.0 |
| Codex | 65.6 | 84.1 |
| OpenCode | 65.5 | 85.0 |
| Pi | 66.2 | 86.1 |
| mini-SWE | **74.2** | 90.3 |
| DeepSeek Harness（Minimal） | 72.6 | **90.6** |
| DeepSeek Harness（Standard） | 70.5 | 85.8 |
| DeepSeek Harness（PTC） | 67.6 | 85.8 |

DeepSWE 上最好和最差差了 8.7 分。主表里的 74.2 与 90.6 分别取自 mini-SWE（为对齐 DeepSWE 官方设置）和 DeepSeek 自己的 Harness（Minimal 模式，只给一个 bash 工具）[1]。报告测了四个 Claude Code 版本，平均是 68.9 与 87.8 [1]。报告的结论是模型的 Agent 能力能在不同脚手架间迁移，这与它在很多脚手架上同时做 RL 的训练方式一致（见[后训练那一章](https://daiw.net/manual/deepseek-v4-flash/post-training)）。

## 读这些表时要注意的六件事

1. **全部是官方口径。** 报告没有说明竞品各列是自己复测还是引用厂商数字。Codeforces 一行是 DeepSeek 的**内部基准** [1]。
2. **模型卡和报告有一处对不上**：NL2Repo-Bench 上 V4.1-Flash 的分数，技术报告（含 arXiv 版）写 65.4，Hugging Face 模型卡写 64.0 [1][2]。上表取报告的数字，两者以哪个为准官方没有说明。
3. **前代两列是哪个版本？** 报告只写“DS-V4-Flash”“DS-V4-Pro”。对照前代模型卡：V4-Flash 一列的 Terminal-Bench 2.1、DeepSWE、CyberGym、NL2Repo、Agent's Last Exam 与 [V4-Flash-0731](https://daiw.net/manual/deepseek-v4-flash/post-training-0731) 模型卡完全相同，V4-Pro 一列与 V4-Pro-0813 模型卡相同 [3][4]。所以它们应当是两者的正式版而非 4 月的预览版——这是本专栏的比对推断，报告没有明说。
4. **AutomationBench 不能跨表比。** 0731 模型卡里 V4-Flash-0731 的 AutomationBench（Public）是 25.1，上表里同一个模型是 37.7 [2][3]；报告说它用的是 AutomationBench v1.0.6 的公开评测集 [1]。版本不同，数字不能混用。
5. **都是最高强度。** 日常用 high（强度 75）或更低时分数会低一些；强度与分数的关系见[推理强度那一章](https://daiw.net/manual/deepseek-v4-flash/reasoning-effort)。
6. **评测本身会被钻空子。** 报告说，即使限制联网、删掉 Git 历史、清空缓存，仍观察到模型在 CyberGym 里反编译 Ubuntu 核心软件包找漏洞 [1]。越强的模型越会“做题技巧”，基准分数的含义也越需要追问。

## 和 K3 放在一起

同一张表里（仍是 DeepSeek 测的），V4.1-Flash 在 Terminal-Bench 2.1 / 3.0 / 4.0、DeepSWE、CyberGym、AutomationBench、Agent's Last Exam 上高于 Kimi K3，在 GPQA Diamond 与 HLE 上低于 K3 [1]。价格上，K3 是 \$3 / \$15（见 [K3 专栏](https://daiw.net/manual/kimi-k3/spec-sheet)），V4.1-Flash 高峰时段是 \$0.3 / \$1.2，闲时再减半。**能力相当或略强，价格低一个数量级**——这是 Flash 这条产品线一直以来的定位，V4.1 把“能力相当”的范围扩大到了大部分 Agent 任务。

报告引言里有一句很大的话：V4.1-Flash 在绝大多数基准上已能比肩闭源前沿模型，能完成 95% 以上的真实世界任务 [1]。“95%”没有给出测法，只能当作厂商的自我评价来读；报告的结论一节也写了，基准分数接近并不意味着在最复杂、高难度的推理和边界情形上追平了领先的闭源系统 [1]。

下一章讲怎么把它跑起来。👉 [自己跑起来](https://daiw.net/manual/deepseek-v4-flash/self-host)

## 参考文献

- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969) —— 表 1（基座）、表 3（与前沿模型对照）、表 4 与表 5（脚手架）、第 5.3.1 节（评测设置、AutomationBench 版本、防作弊措施）、第 1 节与第 6 节（官方自评与局限）。
- [2] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4.1-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) —— 同样三张表的模型卡版本（NL2Repo-Bench 为 64.0）。
- [3] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) —— 0731 的各项分数，用于比对前代一列。
- [4] Hugging Face 模型卡：[deepseek-ai/DeepSeek-V4-Pro-0813](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813) —— V4-Pro 正式版的各项分数，用于比对。
