# 规模效率提升 2.5 倍

> 技术报告最值钱的一句话不是「2.8T 参数」，而是「相对 K2 规模效率提升约 2.5 倍」——拆开这个口径在说什么，以及为什么它比参数量更该被关心。

- 作者：David（道雾轩）
- 专栏：Kimi K3 深度解析（https://daiw.net/manual/kimi-k3.md）
- 最后更新：2026-08-06
- 原文：https://daiw.net/manual/kimi-k3/pretrain-scaling
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 规模效率提升 2.5 倍

技术报告摘要里有一句容易被参数量盖过去的话：相对 Kimi K2，**整体规模效率（scaling efficiency）提升约 2.5 倍**。

这一章解释为什么这句话比「2.8T」更值得琢磨。

## 参数量是个越来越差的指标

2023 年前后，「多少 B 参数」还能大致代表能力。MoE 普及之后，这个指标基本废了：

- DeepSeek-V3 是 671B，但每 token 只算 37B；
- K3 是 2.8T，每 token 只算 104B；
- 两者的**存储需求**差 4 倍，**单步计算量**差不到 3 倍，**实际能力**差多少？参数量完全答不了。

再加上训练数据量、数据质量、训练轮次、后训练强度这些变量，**「参数量 → 能力」的映射早就不是单调的了**。

所以厂商开始换口径。「规模效率」问的是另一个问题：**投入同样的资源，你能换到多少能力？**

## 「2.5 倍」可能在说什么

需要说明：技术报告摘要给的是结论，**没有公开这个口径的完整定义**。以下是这类表述通常的三种含义，按可能性排列——本专栏把它标成解读，不是转述。

**解读一：同等能力所需的训练算力降到约 1/2.5。**
最常见的一种口径。含义是训练曲线整体左移：达到 K2 的水平，K3 的架构只要花 40% 的算力。

**解读二：同等算力下的能力提升相当于「参数量翻 2.5 倍」。**
把效率换算成等效参数的说法，营销上更好看。

**解读三：推理侧的效率——同等吞吐下能力更强，或同等能力下更便宜。**
考虑到 K3 的架构改动（KDA、MXFP4）大量集中在推理效率上，这一层收益是实打实的，但它通常不叫 scaling efficiency。

<Callout type="warn">
  **没有定义的效率倍数，不能拿来横向比较。** 不同厂商的「效率提升 N 倍」口径各不相同，把 A 家的 2.5× 和 B 家的 3× 并排放是没有意义的。这类数字的正确用法是**纵向**的：同一家、同一口径、上一代与这一代之间的相对进步。
</Callout>

## 为什么这个方向是对的

抛开具体口径，「把效率而非规模当成主要指标」本身是一个健康的转向，理由有三：

1. **算力是有限的。** 前沿实验室的规模竞赛已经撞到电力、芯片供应与资本开支的天花板。继续堆参数的边际收益在下降，提高效率的边际收益在上升。
2. **效率决定谁用得起。** 一个 2.8T 的模型如果推理成本降不下来，它的开放权重就只是象征意义。K3 的 MXFP4 把权重压到 1.42 TiB、KDA 把长上下文缓存压掉大半——这些才是「开放」能落地的前提。
3. **效率改进会累积，规模不会。** 今天为省 KV 缓存发明的机制，下一代还能用；今天多堆的参数，下一代就作废了。

## 架构改动与效率的对应关系

把前面几章的零件和效率账对上，脉络就清楚了：

| 零件 | 省在哪 | 归入哪种效率 |
| --- | --- | --- |
| KDA（69 层） | 长上下文的 KV 缓存与解码吞吐 | 推理 |
| 896 选 16 | 每 token 的计算量 | 训练 + 推理 |
| MXFP4 权重 | 权重存储与显存带宽 | 推理 + 部署 |
| AttnRes | 深层信息流（换成更快收敛） | 训练 |

**四个零件，四笔账，没有一个是为了「更大」而做的。** 这就是 K3 这一代的性格。

<Callout type="info">
  关于预训练数据量，K3 的技术报告摘要**未披露 token 数**。作为参照，同期的 DeepSeek V4 公开了「32T+ token」这个数字。K3 这边没有可引用的一手数据，本专栏就不填这个空。
</Callout>

下一章讲后训练——K3 的 agentic 能力从哪来。👉 [后训练：三个域的强化学习](https://daiw.net/manual/kimi-k3/post-training)

## 参考文献

- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— 「约 2.5 倍规模效率」出自其摘要。
- [2] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026. arXiv:2606.19348. —— 32T token 的参照数字。
