规格总表

一页摊开 Kimi K3 的全部规格:2.8T/104B 参数、93 层的 69+24+1 排布、896 选 16 的专家配置、1M 上下文、MXFP4 权重与两地定价。

作者 David更新于 2 篇(共 13 篇)

规格总表

这一页是本专栏的索引页。后面每一章都会从这里取一两行展开,读到某处发现数字对不上,回来查这张表。

主干

项目数值出处
总参数2.8T技术报告摘要
每 token 激活参数104B(约 3.7%)技术报告摘要
层数93 = 69 KDA + 24 Gated MLA + 1 dense模型卡
隐藏维度7,168模型卡
注意力头数96模型卡
词表约 160K模型卡
上下文窗口1,048,576(1M)技术报告 / 模型卡
视觉编码器MoonViT-V2,401M 参数模型卡
模态文本 + 图像 + 视频 → 文本模型卡

MoE

项目数值
路由专家总数896
每 token 激活路由专家16
共享专家2(常驻)
稀疏度16/896 ≈ 1.8%
架构名Stable LatentMoE

把这一行和《AI 大模型解构》里那张 MoE 对比表并排看,K3 的位置一眼可见:DeepSeek-V3 是 256 选 8,Qwen3 是 128 选 8,K3 直接跳到 896 选 16。专家数翻了 3.5 倍,激活数只翻一倍——这是一次明确的「更多、更小、更稀疏」下注。

精度与权重形态

项目数值
权重精度MXFP4(原生,非事后量化)
激活精度MXFP8
量化感知训练SFT 阶段起启用
权重体积1.42 TiB,96 个 Safetensors 分片

「原生 MXFP4」是这张表里最容易被略过、其实最有分量的一行。它不是把 BF16 权重压成 4 bit,而是从监督微调阶段就带着 4 bit 的约束训练。 差别在于:事后量化是「训完再损失一点精度」,量化感知训练是「让模型在训练时就学会在低精度下工作」。2.8T 参数如果按 BF16 存,光权重就是 5.6 TB;MXFP4 把它压到 1.42 TiB,这是它能被普通机构部署的前提。

定价

区域输入(未命中缓存)输入(命中缓存)输出
国际$3 / 百万 token$0.30 / 百万 token$15 / 百万 token
国内¥20 / 百万 token¥2 / 百万 token¥100 / 百万 token

缓存命中价是未命中的 1/10,这个折扣幅度在长上下文场景下几乎决定了成本结构——一个反复追加的 agent 会话,绝大部分输入 token 都是命中的。

许可与部署

项目内容
许可Kimi K3 License(年营收 > $20M 的 MaaS 需另签)
推荐推理引擎vLLM、SGLang、TokenSpeed(三者均有官方 recipe)

一句话读懂这张表

K3 的每一处规格都在为同一个目标服务:让 1M 上下文在可接受的成本下真正可用。

  • 69 层线性注意力 → 压住 KV 缓存随长度的增长;
  • 896 选 16 → 压住每步的算力;
  • MXFP4 → 压住权重的体积;
  • 缓存命中十分之一价 → 压住长会话的账单。

四条线索指向同一个瓶颈。下一章就从这个瓶颈本身讲起:为什么 1M 上下文首先撞上的不是算力,而是显存。👉 1M 上下文撞上的那堵墙

参考文献

  • [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
  • [2] Hugging Face 模型卡:moonshotai/Kimi-K3

本页目录