# 规格总表

> 把 V4.1-Flash 与前代 V4-Flash 的规格并排摊开：参数口径、层配置、注意力与缓存、MoE、训练、推理控制、精度、API 价格与部署门槛，每一行都标出处。

- 作者：David（道雾轩）
- 专栏：DeepSeek V4.1 Flash 深度解析（https://daiw.net/manual/deepseek-v4-flash.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash/spec-sheet
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

这是本专栏的索引页，后面每章从这里取一两行展开。V4-Flash 一列是前代数据，方便对照；数字出处见文末，价格为 **2026 年 9 月 19 日**查阅官方价格页所得。

## 主干

| 项目 | V4-Flash（前代） | **V4.1-Flash** |
| --- | --- | --- |
| 参数 | 284B（总参数） | **552B 主干 + 196B Engram** |
| 每 token 激活 | 13B | **预填充 8B / 解码 16B** |
| 层数 | 43 | **40**（因果编码器 20 + 解码器 20） |
| 隐藏维度 | 4096 | **5120** |
| 注意力头 | 64 个查询头、1 个共享 KV 头，头维 512 | 同左 |
| 查询压缩维度 | 1024 | 1280 |
| 词表 | 129,280 | 129,280 |
| 上下文 | 1M（YaRN 16 倍，原始窗口 65,536） | 同左 |
| 模态 | 文本 | **图像 + 文本输入**，文本输出 |
| 许可 | MIT | MIT |

<Callout type="info">
  **参数口径不完全一致。** V4 报告写的是“总参数 284B”；V4.1 报告把 552B 称为“主干参数”，另报 196B Engram 参数 [1][2]。据 vLLM 配方页的拆分，552B 覆盖路由专家、注意力与嵌入，Engram 表、约 14B 的 DSpark 草稿头和量化缩放因子都在它之外 [7]。所以“V4.1 比 V4 大了近一倍”只是主干之间的比较；把 Engram 算进去，差得更多。
</Callout>

## 注意力与缓存

| 项目 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| 全局注意力 | CSA（压缩率 4，top-512）与 HCA（压缩率 128，稠密）逐层交替 | **纯 CSA2**：编码器压缩率 2，解码器压缩率 1（即不压缩），top-512 |
| 只用滑动窗口的层 | 第 0、1 层 | 第 0、1 层 |
| 自己产生全局 KV 的层 | 41 层（每个 CSA / HCA 层） | **4 层**（第 2、8、14、20 层） |
| 运行索引器的层 | 21 个 CSA 层 | 8 层（第 2、8、14、20、24、28、32、36 层） |
| 索引器 | 64 头 × 128 维 | 32 头 × 128 维；解码器里另有分层候选池（2,048 块 × 8 个位置） |
| 滑动窗口 | 128 token | 128 token |
| 主 KV 精度 | FP8（RoPE 维为 BF16） | **FP4**（E2M1，每 16 个通道一个 E4M3 缩放） |
| 每 token 全局 KV | 3,514 字节 | **890 字节** |
| 持久化 KV（SSD / 主机内存） | 基准 | 约 **1/8** |

层号从 0 数。V4-Flash 的排布来自 V4 论文与 `config.json` 的 `compress_ratios`；V4.1-Flash 的来自技术报告第 4.2.1 节与 `config.json` 的 `kv_source_layer_ids`、`index_source_layer_ids` [1][2][3][4]。每 token 字节数取自模型卡里的各代对比图 [2]。

## MoE

| 项目 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| 共享专家 | 1 | 1 |
| 路由专家 | 256 | **384** |
| 每 token 激活路由专家 | 6 | 6 |
| 专家中间维度 | 2048 | **2304** |
| 亲和度打分 | Sqrt(Softplus) | 同左 |
| 开头几层 | 前 3 层用哈希路由 | 报告与 `config.json` 里都没有哈希路由 |
| 负载均衡 | 无辅助损失的偏置 + 轻微的序列级平衡损失 | 同左，**图像与文本 token 各用一套偏置** |

## 其他组件

| 组件 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| mHC | 4 条残差流，Sinkhorn-Knopp 迭代 20 次 | Single-Pass mHC，同样 4 条、20 次 |
| 投机解码 | MTP 深度 1（6 月起另有外挂 DSpark 的版本） | **DSpark**：3 个块，一次草拟 5 个 token，预训练后单独训练 |
| Engram | 无 | **第 1、14 层，共 196B 参数，FP8** |
| 视觉编码器 | 无 | **DeepSeek-ViT**：32 层、隐藏维度 1024、patch 14，单图最多 1024 个 token |

## 训练

| 项目 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| 预训练数据 | 32T token | **45T** token，多模态（纯文本与多模态约 7:1） |
| 批量 | 逐步增大到 75.5M token | 全程固定 100.6M token |
| 学习率 | 峰值 2.7×10⁻⁴，末段降到 2.7×10⁻⁵ | 峰值 2.6×10⁻⁴，28T–40T 之间余弦降到 2.6×10⁻⁵ |
| 稀疏注意力 | 先用稠密注意力热身 1T token，64K 长度时引入 | 从头就是稀疏注意力，在 64K 长度上训 |
| 上下文扩展 | 4K → 16K → 64K → 1M | 训练到 34T token 时由 64K 扩到 1M |
| 优化器 | Muon + AdamW | head-wise Muon + AdamW + Sinkhorn 均衡更新 |
| 后训练 | 分领域专家（SFT + GRPO）→ 在线策略蒸馏合并 | SFT → RL → 在线策略蒸馏，算法不变，数据与环境放大 |

## 推理控制与采样

| 项目 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| 推理控制 | Non-think / Think High / Think Max 三种模式；0731 起 API 为 low / high / max | **1–100 的整数**；API 三档 low / high / max 对应 50 / 75 / 100 |
| 推荐采样 | temperature 1.0，top_p 1.0（0731：agent 场景 top_p 0.95） | temperature 1.0，top_p 0.95 或 1.0 |
| 输出长度 | Think Max 建议上下文不少于 384K | 模型卡建议 `max_tokens` 不少于 256K；API 最大输出 384K |

## 精度

| 部件 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| 路由专家权重 | FP4 | FP4 |
| 其余大部分权重 | FP8 | FP8 |
| 索引器 Q / K | FP4（MXFP4） | FP4（MXFP4） |
| 主 KV 缓存 | FP8，RoPE 维 BF16 | **FP4** |
| 滑动窗口 KV | FP8，RoPE 维 BF16 | FP8 |
| Engram 表 | — | FP8 |

“在参数最多的地方省得最狠”这条原则 V4.1 没变，只是把它延伸到了缓存上，[FP4 那一章](https://daiw.net/manual/deepseek-v4-flash/fp8-fp4)细讲。

## API 定价

`deepseek-flash`（DeepSeek-V4.1-Flash）的官方价格，单位是每百万 token [5]：

| 计费项 | 闲时 | 高峰 |
| --- | --- | --- |
| 输入（缓存命中） | \$0.003（0.02 元） | \$0.006（0.04 元） |
| 输入（缓存未命中） | \$0.15（1 元） | \$0.3（2 元） |
| 输出 | \$0.6（4 元） | \$1.2（8 元） |

高峰时段是北京时间周一至周五 9:00–12:00、14:00–18:00，不含中国法定节假日；其余时间（含周末与法定节假日全天）都算闲时，闲时价是高峰价的一半。并发上限 2500。

前代 V4-Flash 的价格变过三次，按官方价格页的存档整理如下（美元，闲时 / 高峰）[5][6]：

| 时间点 | 缓存命中 | 缓存未命中 | 输出 |
| --- | --- | --- | --- |
| 2026-04-24，V4-Flash 发布时 | 0.028 | 0.14 | 0.28 |
| 2026-08-01 存档，V4-Flash-0731 | 0.0028 | 0.14 | 0.28 |
| 2026-08-16 起，峰谷定价 | 0.007 / 0.014 | 0.22 / 0.44 | 0.66 / 1.32 |
| 2026-09-10 起，V4.1-Flash | 0.003 / 0.006 | 0.15 / 0.3 | 0.6 / 1.2 |

<Callout type="info">
  和 V4.1 发布前一天的 V4-Flash 相比，缓存命中价降了约 57%，未命中降了约 32%，输出降了约 9%。官方把降价归因于新架构“能够以更低的成本服务更多的用户”，并特别指出 Agent 场景里缓存命中的费用占比往往较高 [8]。

  缓存命中价始终是未命中价的 1/50（高峰、闲时都是）。对反复追加上下文的 Agent 循环，这一条比输出价更决定账单。和 [Kimi K3](https://daiw.net/manual/kimi-k3/spec-sheet) 的 \$3 / \$15 对比，V4.1-Flash 的输出价是它的 1/12.5（高峰）到 1/25（闲时）。
</Callout>

## 部署

| 项目 | 数值 | 出处 |
| --- | --- | --- |
| 官方权重 | 约 510 GB，48 个 safetensors 分片（V4-Flash 约 160 GB） | Hugging Face 仓库文件列表 |
| 其中 Engram 表 | 约 183 GiB，FP8 | vLLM 配方页 [7] |
| 最低显存估算 | 约 614 GB：一组 GB200 NVL4，或一台 8 卡 H200 | vLLM 配方页 [7] |
| 1M token 的全局 KV | 不到 1 GB | 按 890 字节推算 |

下一章从成本账讲起：百万 token 到底贵在哪。👉 [百万 token 的成本账](https://daiw.net/manual/deepseek-v4-flash/million-token-cost)

## 参考文献

- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969) —— 第 2 节（架构）、第 4.2 节（模型与训练设置）、第 5.1.4 节（推理强度档位映射）。
- [2] Hugging Face：[deepseek-ai/DeepSeek-V4.1-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) 的模型卡、`config.json` 与文件列表 —— 层配置、推荐采样参数、各代每 token 全局 KV 对比图、权重体积。
- [3] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. [arXiv:2606.19348](https://arxiv.org/abs/2606.19348) —— V4-Flash 的模型设置、训练设置与 KV 存储格式。
- [4] Hugging Face：[deepseek-ai/DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) 与 [DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) 的模型卡和 `config.json` —— 前代的逐层压缩率、三种推理模式、推荐采样与输出长度。
- [5] DeepSeek API 文档. “模型 & 价格.” 2026-09-19 查阅. [api-docs.deepseek.com/zh-cn/quick_start/pricing](https://api-docs.deepseek.com/zh-cn/quick_start/pricing) —— V4.1-Flash 的美元与人民币价格、峰谷时段、并发上限。
- [6] Wayback Machine 对官方价格页的存档：[2026-04-24](https://web.archive.org/web/20260424152549/https://api-docs.deepseek.com/quick_start/pricing)、[2026-08-01](https://web.archive.org/web/20260801170952/https://api-docs.deepseek.com/quick_start/pricing)、[2026-08-18](https://web.archive.org/web/20260818015542/https://api-docs.deepseek.com/quick_start/pricing)、[2026-09-09](https://web.archive.org/web/20260909004920/https://api-docs.deepseek.com/quick_start/pricing) —— V4-Flash 的历次价格；峰谷定价的生效时间见 DeepSeek 2026-08-13 的公告。
- [7] vLLM Recipes. “deepseek-ai/DeepSeek-V4.1-Flash.” 2026-09-19 查阅. [recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash](https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash) —— 第三方推理引擎文档：检查点各部分体积、主干参数的口径、最低显存估算。
- [8] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. [api-docs.deepseek.com/zh-cn/news/news260910](https://api-docs.deepseek.com/zh-cn/news/news260910) —— 降价说明与缓存命中费用的说法。
