基准怎么读
逐表读 V4.1-Flash 的官方评测:基座对比、与前沿模型的对照、脚手架差异。能力形状是 Agent 大涨、知识仍弱于 V4-Pro;也要看清模型卡与报告对不上的数字、对照列的真实版本,以及还没有第三方复现这件事。
先说结论:下面每一个数字都是 DeepSeek 自己测的,包括竞品那几列,属于官方口径、待独立验证。本专栏写作时还没有收录第三方复现。
基座模型
三个基座在同一套内部框架、同一评测设置下测得,报告说差距不超过 0.3 分视为同一水平 [1][2]:
| 基准 | V4-Flash-Base | V4-Pro-Base | V4.1-Flash-Base |
|---|---|---|---|
| AGIEval | 83.9 | 84.4 | 83.4 |
| MMLU-Pro | 68.3 | 73.5 | 74.1 |
| C-Eval | 92.1 | 93.1 | 92.1 |
| MultiLoKo | 42.6 | 50.9 | 45.5 |
| SimpleQA-Verified | 30.1 | 55.2 | 42.3 |
| SuperGPQA | 46.5 | 53.9 | 53.1 |
| BBH | 86.9 | 87.5 | 86.1 |
| BBEH | 25.4 | 29.8 | 27.2 |
| DROP | 88.6 | 88.7 | 87.9 |
| HellaSwag | 85.7 | 88.0 | 87.2 |
| BigCodeBench | 56.8 | 59.2 | 60.6 |
| HumanEval | 69.5 | 76.8 | 79.4 |
| GSM8K | 90.8 | 92.6 | 93.0 |
| MATH | 57.4 | 64.5 | 61.1 |
| MGSM | 85.7 | 84.4 | 80.2 |
| LongBench-V2 | 44.7 | 51.5 | 45.2 |
报告的解读是:V4.1-Flash-Base 的世界知识与理解能力和 V4-Pro-Base 相当,推理与代码接近或超过 V4-Pro-Base [1]。逐行看会更细一些:代码与 MMLU-Pro 追上甚至超过了 Pro,但 SimpleQA-Verified、MultiLoKo 这类考“记住多少”的项,以及长上下文的 LongBench-V2,仍明显落后于 Pro;MGSM 甚至比前代还低。
指令模型:与前沿模型对照
全部在最高推理强度(100)下测,temperature=1.0、top_p=0.95 [1][2]。V4-Pro 与 V4-Flash 两列是前代:
| 基准 | Opus-5 | GPT-5.6 Sol | Kimi K3 | GLM-5.3 | V4-Pro | V4-Flash | V4.1-Flash |
|---|---|---|---|---|---|---|---|
| GPQA Diamond | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 89.9 | 90.9 |
| HLE | 56.3 | 44.5 | 43.5 | 42.0† | 42.7† | 37.8† | 36.8(39.1†) |
| Codeforces(Rating) | — | — | — | — | 3348 | 3289 | 3471 |
| MathArena Apex | — | — | 65.6 | — | 65.3 | 58.6 | 65.6 |
| Terminal-Bench 2.1 | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 82.7 | 90.6 |
| Terminal-Bench 3.0 | 43.3 | 34.4 | 17.7 | 28.3 | 11.8 | 7.6 | 30.0 |
| Terminal-Bench 4.0 | 51.8 | 39.9 | 12.6 | 37.9 | 12.4 | 7.0 | 31.2 |
| DeepSWE v1.1 | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 54.4 | 74.2 |
| ProgramBench | 37.0 | 23.0 | 17.5 | 19.0 | 15.5 | — | 20.3 |
| NL2Repo-Bench | 75.3 | 56.8 | 58.0 | 58.0 | 61.5 | 54.2 | 65.4 |
| CyberGym | — | 84.5 | 80.0 | 84.5 | 83.3 | 76.7 | 88.1 |
| SEC-Bench Pro | — | 74.3 | — | — | 56.4 | 30.9 | 62.8 |
| ExploitGym | 22.1 | 33.7 | — | 15.0 | 5.4 | 1.8 | 15.3 |
| HLE(带工具) | 63.6 | — | 59.8 | 62.5 | 60.0 | 51.5 | 63.9 |
| AutomationBench | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 37.7 | 54.8 |
| Agent's Last Exam | 28.6 | 26.7 | 27.6 | 28.5 | 25.7 | 25.2 | 31.8 |
† 为 HLE 的纯文本子集。视觉 Agent 三项放在多模态那一章。
能力形状
- Agent 大涨:相对前代 V4-Flash,DeepSWE 从 54.4 到 74.2,Terminal-Bench 3.0 从 7.6 到 30.0、4.0 从 7.0 到 31.2,SEC-Bench Pro 从 30.9 到 62.8。多数常规 Agent 基准上它与闭源前沿模型打平或领先。
- 最难的一档仍有差距:Terminal-Bench 3.0 / 4.0、ProgramBench、NL2Repo 上离 Opus-5 还差十几到二十分。报告自己也承认,在需要专家级领域知识的科学类 Agent 任务(例如 Terminal-Bench 4.0)上,与“巨型模型”仍有差距 [1]。
- 推理不再是短板:Codeforces 3471 是 DeepSeek 各代最高,MathArena Apex 与 K3 持平。但 HLE 纯文本子集 39.1 仍低于 V4-Pro 的 42.7。
- 知识仍是弱项:基座 SimpleQA-Verified 42.3,比前代的 30.1 高了一截,但离 V4-Pro-Base 的 55.2 还远。报告说知识密集型表现“主要由预训练决定”,所以后训练评测里基本不再测它 [1]。
- 网络安全:报告称在开源模型里达到新的最佳水平,并提醒这类能力的两用性,鼓励用于防御性研究和漏洞修复 [1]。
实用推论没变:这类模型要配检索用。 需要准确事实的应用(企业文档问答、法规、产品信息),别指望参数记忆,上 RAG。V4.1-Flash 的 1M 上下文、890 字节 / token 的缓存和极低的缓存命中价,让“把资料整个塞进上下文”更便宜了——但它在百万级精确检索上的表现,报告没有给数字(见 CSA2 那一章),用之前自己测。
脚手架的影响有多大
同一个检查点、同样的解码设置和任务集,只换外面的 Agent 框架 [1][2]:
| 脚手架 | DeepSWE v1.1 | Terminal-Bench 2.1 |
|---|---|---|
| Claude Code(v2.1.251) | 69.8 | 88.0 |
| Codex | 65.6 | 84.1 |
| OpenCode | 65.5 | 85.0 |
| Pi | 66.2 | 86.1 |
| mini-SWE | 74.2 | 90.3 |
| DeepSeek Harness(Minimal) | 72.6 | 90.6 |
| DeepSeek Harness(Standard) | 70.5 | 85.8 |
| DeepSeek Harness(PTC) | 67.6 | 85.8 |
DeepSWE 上最好和最差差了 8.7 分。主表里的 74.2 与 90.6 分别取自 mini-SWE(为对齐 DeepSWE 官方设置)和 DeepSeek 自己的 Harness(Minimal 模式,只给一个 bash 工具)[1]。报告测了四个 Claude Code 版本,平均是 68.9 与 87.8 [1]。报告的结论是模型的 Agent 能力能在不同脚手架间迁移,这与它在很多脚手架上同时做 RL 的训练方式一致(见后训练那一章)。
读这些表时要注意的六件事
- 全部是官方口径。 报告没有说明竞品各列是自己复测还是引用厂商数字。Codeforces 一行是 DeepSeek 的内部基准 [1]。
- 模型卡和报告有一处对不上:NL2Repo-Bench 上 V4.1-Flash 的分数,技术报告(含 arXiv 版)写 65.4,Hugging Face 模型卡写 64.0 [1][2]。上表取报告的数字,两者以哪个为准官方没有说明。
- 前代两列是哪个版本? 报告只写“DS-V4-Flash”“DS-V4-Pro”。对照前代模型卡:V4-Flash 一列的 Terminal-Bench 2.1、DeepSWE、CyberGym、NL2Repo、Agent's Last Exam 与 V4-Flash-0731 模型卡完全相同,V4-Pro 一列与 V4-Pro-0813 模型卡相同 [3][4]。所以它们应当是两者的正式版而非 4 月的预览版——这是本专栏的比对推断,报告没有明说。
- AutomationBench 不能跨表比。 0731 模型卡里 V4-Flash-0731 的 AutomationBench(Public)是 25.1,上表里同一个模型是 37.7 [2][3];报告说它用的是 AutomationBench v1.0.6 的公开评测集 [1]。版本不同,数字不能混用。
- 都是最高强度。 日常用 high(强度 75)或更低时分数会低一些;强度与分数的关系见推理强度那一章。
- 评测本身会被钻空子。 报告说,即使限制联网、删掉 Git 历史、清空缓存,仍观察到模型在 CyberGym 里反编译 Ubuntu 核心软件包找漏洞 [1]。越强的模型越会“做题技巧”,基准分数的含义也越需要追问。
和 K3 放在一起
同一张表里(仍是 DeepSeek 测的),V4.1-Flash 在 Terminal-Bench 2.1 / 3.0 / 4.0、DeepSWE、CyberGym、AutomationBench、Agent's Last Exam 上高于 Kimi K3,在 GPQA Diamond 与 HLE 上低于 K3 [1]。价格上,K3 是 $3 / $15(见 K3 专栏),V4.1-Flash 高峰时段是 $0.3 / $1.2,闲时再减半。能力相当或略强,价格低一个数量级——这是 Flash 这条产品线一直以来的定位,V4.1 把“能力相当”的范围扩大到了大部分 Agent 任务。
报告引言里有一句很大的话:V4.1-Flash 在绝大多数基准上已能比肩闭源前沿模型,能完成 95% 以上的真实世界任务 [1]。“95%”没有给出测法,只能当作厂商的自我评价来读;报告的结论一节也写了,基准分数接近并不意味着在最复杂、高难度的推理和边界情形上追平了领先的闭源系统 [1]。
下一章讲怎么把它跑起来。👉 自己跑起来
参考文献
- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 表 1(基座)、表 3(与前沿模型对照)、表 4 与表 5(脚手架)、第 5.3.1 节(评测设置、AutomationBench 版本、防作弊措施)、第 1 节与第 6 节(官方自评与局限)。
- [2] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4.1-Flash —— 同样三张表的模型卡版本(NL2Repo-Bench 为 64.0)。
- [3] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Flash-0731 —— 0731 的各项分数,用于比对前代一列。
- [4] Hugging Face 模型卡:deepseek-ai/DeepSeek-V4-Pro-0813 —— V4-Pro 正式版的各项分数,用于比对。