规模效率提升 2.5 倍
技术报告最值钱的一句话不是「2.8T 参数」,而是「相对 K2 规模效率提升约 2.5 倍」——拆开这个口径在说什么,以及为什么它比参数量更该被关心。
规模效率提升 2.5 倍
技术报告摘要里有一句容易被参数量盖过去的话:相对 Kimi K2,整体规模效率(scaling efficiency)提升约 2.5 倍。
这一章解释为什么这句话比「2.8T」更值得琢磨。
参数量是个越来越差的指标
2023 年前后,「多少 B 参数」还能大致代表能力。MoE 普及之后,这个指标基本废了:
- DeepSeek-V3 是 671B,但每 token 只算 37B;
- K3 是 2.8T,每 token 只算 104B;
- 两者的存储需求差 4 倍,单步计算量差不到 3 倍,实际能力差多少?参数量完全答不了。
再加上训练数据量、数据质量、训练轮次、后训练强度这些变量,「参数量 → 能力」的映射早就不是单调的了。
所以厂商开始换口径。「规模效率」问的是另一个问题:投入同样的资源,你能换到多少能力?
「2.5 倍」可能在说什么
需要说明:技术报告摘要给的是结论,没有公开这个口径的完整定义。以下是这类表述通常的三种含义,按可能性排列——本专栏把它标成解读,不是转述。
解读一:同等能力所需的训练算力降到约 1/2.5。 最常见的一种口径。含义是训练曲线整体左移:达到 K2 的水平,K3 的架构只要花 40% 的算力。
解读二:同等算力下的能力提升相当于「参数量翻 2.5 倍」。 把效率换算成等效参数的说法,营销上更好看。
解读三:推理侧的效率——同等吞吐下能力更强,或同等能力下更便宜。 考虑到 K3 的架构改动(KDA、MXFP4)大量集中在推理效率上,这一层收益是实打实的,但它通常不叫 scaling efficiency。
没有定义的效率倍数,不能拿来横向比较。 不同厂商的「效率提升 N 倍」口径各不相同,把 A 家的 2.5× 和 B 家的 3× 并排放是没有意义的。这类数字的正确用法是纵向的:同一家、同一口径、上一代与这一代之间的相对进步。
为什么这个方向是对的
抛开具体口径,「把效率而非规模当成主要指标」本身是一个健康的转向,理由有三:
- 算力是有限的。 前沿实验室的规模竞赛已经撞到电力、芯片供应与资本开支的天花板。继续堆参数的边际收益在下降,提高效率的边际收益在上升。
- 效率决定谁用得起。 一个 2.8T 的模型如果推理成本降不下来,它的开放权重就只是象征意义。K3 的 MXFP4 把权重压到 1.42 TiB、KDA 把长上下文缓存压掉大半——这些才是「开放」能落地的前提。
- 效率改进会累积,规模不会。 今天为省 KV 缓存发明的机制,下一代还能用;今天多堆的参数,下一代就作废了。
架构改动与效率的对应关系
把前面几章的零件和效率账对上,脉络就清楚了:
| 零件 | 省在哪 | 归入哪种效率 |
|---|---|---|
| KDA(69 层) | 长上下文的 KV 缓存与解码吞吐 | 推理 |
| 896 选 16 | 每 token 的计算量 | 训练 + 推理 |
| MXFP4 权重 | 权重存储与显存带宽 | 推理 + 部署 |
| AttnRes | 深层信息流(换成更快收敛) | 训练 |
四个零件,四笔账,没有一个是为了「更大」而做的。 这就是 K3 这一代的性格。
关于预训练数据量,K3 的技术报告摘要未披露 token 数。作为参照,同期的 DeepSeek V4 公开了「32T+ token」这个数字。K3 这边没有可引用的一手数据,本专栏就不填这个空。
下一章讲后训练——K3 的 agentic 能力从哪来。👉 后训练:三个域的强化学习
参考文献
- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653. —— 「约 2.5 倍规模效率」出自其摘要。
- [2] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026. arXiv:2606.19348. —— 32T token 的参照数字。