# 基准怎么读

> 逐条对照 K3 的公开基准分数，分清哪些是官方口径、哪些有第三方榜单支撑，以及为什么「agentic 类基准领先、硬推理类仍落后」这个组合本身就是信息。

- 作者：David（道雾轩）
- 专栏：Kimi K3 深度解析（https://daiw.net/manual/kimi-k3.md）
- 最后更新：2026-08-06
- 原文：https://daiw.net/manual/kimi-k3/benchmarks
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 基准怎么读

这一章列数字，但更重要的是列**读法**。这一代模型的基准生态已经复杂到「同一个 benchmark 名字下可能是完全不同的测法」，不带口径地引用分数是在传谣。

## 公开分数

以下取自第三方模型库对 K3 的整理（排名为该库在其收录范围内给出的位次）：

| 基准 | 分数 | 该库内位次 | 测什么 |
| --- | --- | --- | --- |
| **BrowseComp** | 91.2 | 1 / 53 | 开放网页检索与信息聚合 |
| **MCPMark-Verified** | 94.5 | 1 / 1 | MCP 工具调用 |
| **GPQA Diamond** | 93.5 | 8 / 187 | 研究生级科学问答 |
| **Terminal-Bench 2.1** | 88.3 | 2 / 28 | 终端环境下的长程操作 |
| **OSWorld-Verified** | 84.8 | 2 / 24 | 图形界面操作（计算机使用） |
| **DeepSWE** | 67.5 | 5 / 20 | 真实软件工程任务 |

模型卡侧的评测对照组是 **Claude Opus 4.8、GPT-5.5、GLM-5.2**。而技术报告本身明确写道：K3 的表现**仍不及 Claude Fable 5 与 GPT-5.6 Sol**。

<Callout type="warn">
  注意上面这两句的落差：**模型卡挑的对照组，比技术报告承认自己落后的那两个模型低一档。** 这不是造假，是所有厂商都在做的常规操作——对照组的选择本身就是叙事的一部分。读任何模型卡的评测表，第一件事是看**它选了谁来比**，第二件才是看分数。
</Callout>

## 这组分数的形状说明了什么

把六个数字排开看，形状很清楚：**agentic / 工具使用 / 长程操作类基准全面靠前，硬推理与真实软工程相对靠后。**

- BrowseComp、MCPMark、Terminal-Bench、OSWorld —— 都在前二；
- GPQA Diamond 排到第 8，DeepSWE 排到第 5。

这个形状和[后训练那一章](https://daiw.net/manual/kimi-k3/post-training)完全对得上：K3 的 RL 重投在 agentic 与编码域，收益就长在这些地方。**基准形状是训练配方的影子**——当你看到某个模型在一类任务上突出、另一类平平，通常不是「架构更适合」，而是「后训练往那边使劲了」。

## 三条读基准的规矩

**一、先问 harness，再看分数。**
同一个 Terminal-Bench，不同的执行框架、超时设置、可用工具集，分数能差十几分。跨模型比较时，除非出自同一份评测流水线，否则**分数不可加减**。

**二、区分「官方自测」与「第三方复现」。**
上表来自第三方模型库的整理，但其数据源仍主要是各家官方报告。真正独立的复现（LMSYS、SWE-bench 官方榜、各类竞技场）覆盖的基准要少得多。**「有第三方榜单」是个高门槛，大多数基准过不了。**

**三、警惕「饱和基准」。**
GPQA Diamond 到了 93.5 这个位置，前几名之间的差距已经进入噪声区间。**一个基准一旦逼近满分，它就不再有区分度**——此时排名第 1 和第 8 的实质差别，可能远小于分数差暗示的那样。

## 一个更有用的替代指标

如果你的目的是「决定用不用它」，比基准更有信息量的是这三件事：

1. **单位成本的能力**——K3 是 \$3 / \$15，缓存命中 \$0.30。同档能力的闭源模型价格是多少？
2. **能不能自己部署**——权重在手意味着数据不出境、可微调、不受 API 政策变动影响。这一条对很多场景是决定性的，且基准完全测不出来。
3. **在你自己任务上的表现**——十条真实样例的手工评测，胜过任何公开榜单。

下一章讲第二条：自己跑起来到底需要什么。👉 [自己跑得起来吗](https://daiw.net/manual/kimi-k3/deploy)

## 参考文献

- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— 「仍落后 Claude Fable 5 与 GPT-5.6 Sol」的自陈。
- [2] Hugging Face 模型卡：[moonshotai/Kimi-K3](https://huggingface.co/moonshotai/Kimi-K3) —— 评测对照组。
- [3] DataLearner 模型库 Kimi K3 条目 —— 上表分数与位次的来源。
