# 规格总表

> 一页摊开 Kimi K3 的全部规格：2.8T/104B 参数、93 层的 69+24+1 排布、896 选 16 的专家配置、1M 上下文、MXFP4 权重与两地定价。

- 作者：David（道雾轩）
- 专栏：Kimi K3 深度解析（https://daiw.net/manual/kimi-k3.md）
- 最后更新：2026-08-06
- 原文：https://daiw.net/manual/kimi-k3/spec-sheet
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

# 规格总表

这一页是本专栏的**索引页**。后面每一章都会从这里取一两行展开，读到某处发现数字对不上，回来查这张表。

## 主干

| 项目 | 数值 | 出处 |
| --- | --- | --- |
| 总参数 | **2.8T** | 技术报告摘要 |
| 每 token 激活参数 | **104B**（约 3.7%） | 技术报告摘要 |
| 层数 | **93** = 69 KDA + 24 Gated MLA + 1 dense | 模型卡 |
| 隐藏维度 | 7,168 | 模型卡 |
| 注意力头数 | 96 | 模型卡 |
| 词表 | 约 160K | 模型卡 |
| 上下文窗口 | **1,048,576**（1M） | 技术报告 / 模型卡 |
| 视觉编码器 | MoonViT-V2，401M 参数 | 模型卡 |
| 模态 | 文本 + 图像 + 视频 → 文本 | 模型卡 |

## MoE

| 项目 | 数值 |
| --- | --- |
| 路由专家总数 | **896** |
| 每 token 激活路由专家 | **16** |
| 共享专家 | **2**（常驻） |
| 稀疏度 | 16/896 ≈ **1.8%** |
| 架构名 | Stable LatentMoE |

把这一行和[《AI 大模型解构》里那张 MoE 对比表](https://daiw.net/manual/llm-anatomy/moe-knobs)并排看，K3 的位置一眼可见：DeepSeek-V3 是 256 选 8，Qwen3 是 128 选 8，K3 直接跳到 896 选 16。**专家数翻了 3.5 倍，激活数只翻一倍**——这是一次明确的「更多、更小、更稀疏」下注。

## 精度与权重形态

| 项目 | 数值 |
| --- | --- |
| 权重精度 | **MXFP4**（原生，非事后量化） |
| 激活精度 | MXFP8 |
| 量化感知训练 | 自 **SFT 阶段起**启用 |
| 权重体积 | 约 **1.42 TiB**，96 个 Safetensors 分片 |

<Callout type="info">
  「原生 MXFP4」是这张表里最容易被略过、其实最有分量的一行。**它不是把 BF16 权重压成 4 bit，而是从监督微调阶段就带着 4 bit 的约束训练。** 差别在于：事后量化是「训完再损失一点精度」，量化感知训练是「让模型在训练时就学会在低精度下工作」。2.8T 参数如果按 BF16 存，光权重就是 5.6 TB；MXFP4 把它压到 1.42 TiB，这是它能被普通机构部署的前提。
</Callout>

## 定价

| 区域 | 输入（未命中缓存） | 输入（命中缓存） | 输出 |
| --- | --- | --- | --- |
| 国际 | \$3 / 百万 token | \$0.30 / 百万 token | \$15 / 百万 token |
| 国内 | ￥20 / 百万 token | ￥2 / 百万 token | ￥100 / 百万 token |

缓存命中价是未命中的 **1/10**，这个折扣幅度在长上下文场景下几乎决定了成本结构——一个反复追加的 agent 会话，绝大部分输入 token 都是命中的。

## 许可与部署

| 项目 | 内容 |
| --- | --- |
| 许可 | Kimi K3 License（年营收 > \$20M 的 MaaS 需另签） |
| 推荐推理引擎 | vLLM、SGLang、TokenSpeed（三者均有官方 recipe） |

## 一句话读懂这张表

**K3 的每一处规格都在为同一个目标服务：让 1M 上下文在可接受的成本下真正可用。**

- 69 层线性注意力 → 压住 KV 缓存随长度的增长；
- 896 选 16 → 压住每步的算力；
- MXFP4 → 压住权重的体积；
- 缓存命中十分之一价 → 压住长会话的账单。

四条线索指向同一个瓶颈。下一章就从这个瓶颈本身讲起：为什么 1M 上下文首先撞上的不是算力，而是显存。👉 [1M 上下文撞上的那堵墙](https://daiw.net/manual/kimi-k3/kv-cache-wall)

## 参考文献

- [1] Moonshot AI. “Kimi K3: Open Frontier Intelligence.” 2026. arXiv:2607.24653.
- [2] Hugging Face 模型卡：[moonshotai/Kimi-K3](https://huggingface.co/moonshotai/Kimi-K3)
