基准怎么读
逐条对照 K3 的公开基准分数,分清哪些是官方口径、哪些有第三方榜单支撑,以及为什么「agentic 类基准领先、硬推理类仍落后」这个组合本身就是信息。
基准怎么读
这一章列数字,但更重要的是列读法。这一代模型的基准生态已经复杂到「同一个 benchmark 名字下可能是完全不同的测法」,不带口径地引用分数是在传谣。
公开分数
以下取自第三方模型库对 K3 的整理(排名为该库在其收录范围内给出的位次):
| 基准 | 分数 | 该库内位次 | 测什么 |
|---|---|---|---|
| BrowseComp | 91.2 | 1 / 53 | 开放网页检索与信息聚合 |
| MCPMark-Verified | 94.5 | 1 / 1 | MCP 工具调用 |
| GPQA Diamond | 93.5 | 8 / 187 | 研究生级科学问答 |
| Terminal-Bench 2.1 | 88.3 | 2 / 28 | 终端环境下的长程操作 |
| OSWorld-Verified | 84.8 | 2 / 24 | 图形界面操作(计算机使用) |
| DeepSWE | 67.5 | 5 / 20 | 真实软件工程任务 |
模型卡侧的评测对照组是 Claude Opus 4.8、GPT-5.5、GLM-5.2。而技术报告本身明确写道:K3 的表现仍不及 Claude Fable 5 与 GPT-5.6 Sol。
注意上面这两句的落差:模型卡挑的对照组,比技术报告承认自己落后的那两个模型低一档。 这不是造假,是所有厂商都在做的常规操作——对照组的选择本身就是叙事的一部分。读任何模型卡的评测表,第一件事是看它选了谁来比,第二件才是看分数。
这组分数的形状说明了什么
把六个数字排开看,形状很清楚:agentic / 工具使用 / 长程操作类基准全面靠前,硬推理与真实软工程相对靠后。
- BrowseComp、MCPMark、Terminal-Bench、OSWorld —— 都在前二;
- GPQA Diamond 排到第 8,DeepSWE 排到第 5。
这个形状和后训练那一章完全对得上:K3 的 RL 重投在 agentic 与编码域,收益就长在这些地方。基准形状是训练配方的影子——当你看到某个模型在一类任务上突出、另一类平平,通常不是「架构更适合」,而是「后训练往那边使劲了」。
三条读基准的规矩
一、先问 harness,再看分数。 同一个 Terminal-Bench,不同的执行框架、超时设置、可用工具集,分数能差十几分。跨模型比较时,除非出自同一份评测流水线,否则分数不可加减。
二、区分「官方自测」与「第三方复现」。 上表来自第三方模型库的整理,但其数据源仍主要是各家官方报告。真正独立的复现(LMSYS、SWE-bench 官方榜、各类竞技场)覆盖的基准要少得多。「有第三方榜单」是个高门槛,大多数基准过不了。
三、警惕「饱和基准」。 GPQA Diamond 到了 93.5 这个位置,前几名之间的差距已经进入噪声区间。一个基准一旦逼近满分,它就不再有区分度——此时排名第 1 和第 8 的实质差别,可能远小于分数差暗示的那样。
一个更有用的替代指标
如果你的目的是「决定用不用它」,比基准更有信息量的是这三件事:
- 单位成本的能力——K3 是 $3 / $15,缓存命中 $0.30。同档能力的闭源模型价格是多少?
- 能不能自己部署——权重在手意味着数据不出境、可微调、不受 API 政策变动影响。这一条对很多场景是决定性的,且基准完全测不出来。
- 在你自己任务上的表现——十条真实样例的手工评测,胜过任何公开榜单。
下一章讲第二条:自己跑起来到底需要什么。👉 自己跑得起来吗
参考文献
- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— 「仍落后 Claude Fable 5 与 GPT-5.6 Sol」的自陈。
- [2] Hugging Face 模型卡:moonshotai/Kimi-K3 —— 评测对照组。
- [3] DataLearner 模型库 Kimi K3 条目 —— 上表分数与位次的来源。