规格总表
一页摊开 Kimi K3 的全部规格:2.8T/104B 参数、93 层的 69+24+1 排布、896 选 16 的专家配置、1M 上下文、MXFP4 权重与两地定价。
作者 David更新于 第 2 篇(共 13 篇)
规格总表
这一页是本专栏的索引页。后面每一章都会从这里取一两行展开,读到某处发现数字对不上,回来查这张表。
主干
| 项目 | 数值 | 出处 |
|---|---|---|
| 总参数 | 2.8T | 技术报告摘要 |
| 每 token 激活参数 | 104B(约 3.7%) | 技术报告摘要 |
| 层数 | 93 = 69 KDA + 24 Gated MLA + 1 dense | 模型卡 |
| 隐藏维度 | 7,168 | 模型卡 |
| 注意力头数 | 96 | 模型卡 |
| 词表 | 约 160K | 模型卡 |
| 上下文窗口 | 1,048,576(1M) | 技术报告 / 模型卡 |
| 视觉编码器 | MoonViT-V2,401M 参数 | 模型卡 |
| 模态 | 文本 + 图像 + 视频 → 文本 | 模型卡 |
MoE
| 项目 | 数值 |
|---|---|
| 路由专家总数 | 896 |
| 每 token 激活路由专家 | 16 |
| 共享专家 | 2(常驻) |
| 稀疏度 | 16/896 ≈ 1.8% |
| 架构名 | Stable LatentMoE |
把这一行和《AI 大模型解构》里那张 MoE 对比表并排看,K3 的位置一眼可见:DeepSeek-V3 是 256 选 8,Qwen3 是 128 选 8,K3 直接跳到 896 选 16。专家数翻了 3.5 倍,激活数只翻一倍——这是一次明确的「更多、更小、更稀疏」下注。
精度与权重形态
| 项目 | 数值 |
|---|---|
| 权重精度 | MXFP4(原生,非事后量化) |
| 激活精度 | MXFP8 |
| 量化感知训练 | 自 SFT 阶段起启用 |
| 权重体积 | 约 1.42 TiB,96 个 Safetensors 分片 |
「原生 MXFP4」是这张表里最容易被略过、其实最有分量的一行。它不是把 BF16 权重压成 4 bit,而是从监督微调阶段就带着 4 bit 的约束训练。 差别在于:事后量化是「训完再损失一点精度」,量化感知训练是「让模型在训练时就学会在低精度下工作」。2.8T 参数如果按 BF16 存,光权重就是 5.6 TB;MXFP4 把它压到 1.42 TiB,这是它能被普通机构部署的前提。
定价
| 区域 | 输入(未命中缓存) | 输入(命中缓存) | 输出 |
|---|---|---|---|
| 国际 | $3 / 百万 token | $0.30 / 百万 token | $15 / 百万 token |
| 国内 | ¥20 / 百万 token | ¥2 / 百万 token | ¥100 / 百万 token |
缓存命中价是未命中的 1/10,这个折扣幅度在长上下文场景下几乎决定了成本结构——一个反复追加的 agent 会话,绝大部分输入 token 都是命中的。
许可与部署
| 项目 | 内容 |
|---|---|
| 许可 | Kimi K3 License(年营收 > $20M 的 MaaS 需另签) |
| 推荐推理引擎 | vLLM、SGLang、TokenSpeed(三者均有官方 recipe) |
一句话读懂这张表
K3 的每一处规格都在为同一个目标服务:让 1M 上下文在可接受的成本下真正可用。
- 69 层线性注意力 → 压住 KV 缓存随长度的增长;
- 896 选 16 → 压住每步的算力;
- MXFP4 → 压住权重的体积;
- 缓存命中十分之一价 → 压住长会话的账单。
四条线索指向同一个瓶颈。下一章就从这个瓶颈本身讲起:为什么 1M 上下文首先撞上的不是算力,而是显存。👉 1M 上下文撞上的那堵墙
参考文献
- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
- [2] Hugging Face 模型卡:moonshotai/Kimi-K3