自己跑得起来吗

1.42 TiB 的 MXFP4 权重意味着什么样的硬件账,三种官方推荐的推理引擎,以及许可证里那条真正需要读原文的条款。

作者 David更新于 12 篇(共 13 篇)

自己跑得起来吗

开放权重的价值,最终要落到这个问题上。这一章算三笔账:存得下吗、跑得动吗、用得合规吗。

第一笔:权重放得下吗

项目数值
权重体积1.42 TiB
分片数96 个 Safetensors 文件
权重精度MXFP4(原生)
激活精度MXFP8

先做个对照:如果 2.8T 参数按 BF16 存,需要约 5.6 TB。MXFP4 把它压到 1.42 TiB——约 1/4

但 1.42 TiB 仍然不是个小数目。按当前主流加速卡的单卡显存换算:

  • 单卡 80 GB 级别:需要约 18 张卡才装得下权重,还没算 KV 缓存与激活;
  • 单卡 192 GB 级别:约 8 张
  • 加上运行时开销与长上下文缓存,实际部署要在此基础上再留余量。

结论:K3 是机构级部署,不是个人玩具。 它的「开放」面向的是有集群的团队——研究机构、云厂商、以及有合规需求的大型企业。个人用户能从中获益的路径主要是两条:一是通过 API 用它,二是等社区放出蒸馏版或更激进的量化版。

为什么原生 MXFP4 比事后量化更重要:社区通常能把任何模型压到 4 bit,但那是训练后强行压缩,会掉点。K3 从 SFT 阶段起就带着 4 bit 约束训练——这份权重的 4 bit 形态就是它的原生形态,不存在「量化损失」。这意味着社区拿到的是无损的完整能力,而不是打折版。

第二笔:用什么跑

模型卡给出三个推荐引擎,且都有官方配方:

引擎说明
vLLM生态最广,官方提供 recipe
SGLang官方提供 cookbook
TokenSpeed官方提供 recipe

三者都要处理两件 K3 特有的事:混合注意力堆叠(69 层 KDA 的状态管理与 24 层 MLA 的缓存管理逻辑完全不同)和 MXFP4/MXFP8 的算子支持。这也是「官方 recipe」有价值的原因——不是随便一个推理框架 pull 下来就能跑

采样参数方面,模型卡对长思考模式给出了上下文下限建议;具体数值以模型卡为准,不同版本可能调整。

第三笔:许可

再强调一次第一章里的那条线:

  • 研究、微调、内部部署、绝大多数商用 —— 可以
  • 作为 MaaS 对外提供且相关年营收超过 $20M —— 需另行签署协议。

对绝大多数读者,这条门槛不会触及。但有两类人要认真读原文:做模型托管/转售生意的,以及要把它嵌进对外售卖的产品里、且规模可能做大的。许可证文本在模型仓库里,别只看二手转述。

更现实的三条路径

如果你想用 K3 但没有集群:

  1. 走 API —— $3 / $15,缓存命中 $0.30。对绝大多数应用,这比自建便宜一个数量级。
  2. 等社区衍生版 —— 开放权重的最大价值往往在下游:蒸馏、剪枝、领域微调。历史上这些衍生版通常在权重发布后几周内出现。
  3. 只借鉴架构 —— 如果你在训自己的模型,KDA、混合堆叠、原生低精度训练这几个设计是可以单独拿走的,不需要 2.8T 的规模。

最后一章把整个专栏收束一下。👉 回顾:K3 押对了什么

参考文献

  • [1] Hugging Face 模型卡:moonshotai/Kimi-K3 —— 权重体积、分片数、精度、推荐引擎与采样建议。
  • [2] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.

本页目录