自己跑得起来吗
1.42 TiB 的 MXFP4 权重意味着什么样的硬件账,三种官方推荐的推理引擎,以及许可证里那条真正需要读原文的条款。
自己跑得起来吗
开放权重的价值,最终要落到这个问题上。这一章算三笔账:存得下吗、跑得动吗、用得合规吗。
第一笔:权重放得下吗
| 项目 | 数值 |
|---|---|
| 权重体积 | 约 1.42 TiB |
| 分片数 | 96 个 Safetensors 文件 |
| 权重精度 | MXFP4(原生) |
| 激活精度 | MXFP8 |
先做个对照:如果 2.8T 参数按 BF16 存,需要约 5.6 TB。MXFP4 把它压到 1.42 TiB——约 1/4。
但 1.42 TiB 仍然不是个小数目。按当前主流加速卡的单卡显存换算:
- 单卡 80 GB 级别:需要约 18 张卡才装得下权重,还没算 KV 缓存与激活;
- 单卡 192 GB 级别:约 8 张;
- 加上运行时开销与长上下文缓存,实际部署要在此基础上再留余量。
结论:K3 是机构级部署,不是个人玩具。 它的「开放」面向的是有集群的团队——研究机构、云厂商、以及有合规需求的大型企业。个人用户能从中获益的路径主要是两条:一是通过 API 用它,二是等社区放出蒸馏版或更激进的量化版。
为什么原生 MXFP4 比事后量化更重要:社区通常能把任何模型压到 4 bit,但那是训练后强行压缩,会掉点。K3 从 SFT 阶段起就带着 4 bit 约束训练——这份权重的 4 bit 形态就是它的原生形态,不存在「量化损失」。这意味着社区拿到的是无损的完整能力,而不是打折版。
第二笔:用什么跑
模型卡给出三个推荐引擎,且都有官方配方:
| 引擎 | 说明 |
|---|---|
| vLLM | 生态最广,官方提供 recipe |
| SGLang | 官方提供 cookbook |
| TokenSpeed | 官方提供 recipe |
三者都要处理两件 K3 特有的事:混合注意力堆叠(69 层 KDA 的状态管理与 24 层 MLA 的缓存管理逻辑完全不同)和 MXFP4/MXFP8 的算子支持。这也是「官方 recipe」有价值的原因——不是随便一个推理框架 pull 下来就能跑。
采样参数方面,模型卡对长思考模式给出了上下文下限建议;具体数值以模型卡为准,不同版本可能调整。
第三笔:许可
再强调一次第一章里的那条线:
- 研究、微调、内部部署、绝大多数商用 —— 可以;
- 作为 MaaS 对外提供且相关年营收超过 $20M —— 需另行签署协议。
对绝大多数读者,这条门槛不会触及。但有两类人要认真读原文:做模型托管/转售生意的,以及要把它嵌进对外售卖的产品里、且规模可能做大的。许可证文本在模型仓库里,别只看二手转述。
更现实的三条路径
如果你想用 K3 但没有集群:
- 走 API —— $3 / $15,缓存命中 $0.30。对绝大多数应用,这比自建便宜一个数量级。
- 等社区衍生版 —— 开放权重的最大价值往往在下游:蒸馏、剪枝、领域微调。历史上这些衍生版通常在权重发布后几周内出现。
- 只借鉴架构 —— 如果你在训自己的模型,KDA、混合堆叠、原生低精度训练这几个设计是可以单独拿走的,不需要 2.8T 的规模。
最后一章把整个专栏收束一下。👉 回顾:K3 押对了什么
参考文献
- [1] Hugging Face 模型卡:moonshotai/Kimi-K3 —— 权重体积、分片数、精度、推荐引擎与采样建议。
- [2] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.