规格总表
把 V4.1-Flash 与前代 V4-Flash 的规格并排摊开:参数口径、层配置、注意力与缓存、MoE、训练、推理控制、精度、API 价格与部署门槛,每一行都标出处。
这是本专栏的索引页,后面每章从这里取一两行展开。V4-Flash 一列是前代数据,方便对照;数字出处见文末,价格为 2026 年 9 月 19 日查阅官方价格页所得。
主干
| 项目 | V4-Flash(前代) | V4.1-Flash |
|---|---|---|
| 参数 | 284B(总参数) | 552B 主干 + 196B Engram |
| 每 token 激活 | 13B | 预填充 8B / 解码 16B |
| 层数 | 43 | 40(因果编码器 20 + 解码器 20) |
| 隐藏维度 | 4096 | 5120 |
| 注意力头 | 64 个查询头、1 个共享 KV 头,头维 512 | 同左 |
| 查询压缩维度 | 1024 | 1280 |
| 词表 | 129,280 | 129,280 |
| 上下文 | 1M(YaRN 16 倍,原始窗口 65,536) | 同左 |
| 模态 | 文本 | 图像 + 文本输入,文本输出 |
| 许可 | MIT | MIT |
参数口径不完全一致。 V4 报告写的是“总参数 284B”;V4.1 报告把 552B 称为“主干参数”,另报 196B Engram 参数 [1][2]。据 vLLM 配方页的拆分,552B 覆盖路由专家、注意力与嵌入,Engram 表、约 14B 的 DSpark 草稿头和量化缩放因子都在它之外 [7]。所以“V4.1 比 V4 大了近一倍”只是主干之间的比较;把 Engram 算进去,差得更多。
注意力与缓存
| 项目 | V4-Flash | V4.1-Flash |
|---|---|---|
| 全局注意力 | CSA(压缩率 4,top-512)与 HCA(压缩率 128,稠密)逐层交替 | 纯 CSA2:编码器压缩率 2,解码器压缩率 1(即不压缩),top-512 |
| 只用滑动窗口的层 | 第 0、1 层 | 第 0、1 层 |
| 自己产生全局 KV 的层 | 41 层(每个 CSA / HCA 层) | 4 层(第 2、8、14、20 层) |
| 运行索引器的层 | 21 个 CSA 层 | 8 层(第 2、8、14、20、24、28、32、36 层) |
| 索引器 | 64 头 × 128 维 | 32 头 × 128 维;解码器里另有分层候选池(2,048 块 × 8 个位置) |
| 滑动窗口 | 128 token | 128 token |
| 主 KV 精度 | FP8(RoPE 维为 BF16) | FP4(E2M1,每 16 个通道一个 E4M3 缩放) |
| 每 token 全局 KV | 3,514 字节 | 890 字节 |
| 持久化 KV(SSD / 主机内存) | 基准 | 约 1/8 |
层号从 0 数。V4-Flash 的排布来自 V4 论文与 config.json 的 compress_ratios;V4.1-Flash 的来自技术报告第 4.2.1 节与 config.json 的 kv_source_layer_ids、index_source_layer_ids [1][2][3][4]。每 token 字节数取自模型卡里的各代对比图 [2]。
MoE
| 项目 | V4-Flash | V4.1-Flash |
|---|---|---|
| 共享专家 | 1 | 1 |
| 路由专家 | 256 | 384 |
| 每 token 激活路由专家 | 6 | 6 |
| 专家中间维度 | 2048 | 2304 |
| 亲和度打分 | Sqrt(Softplus) | 同左 |
| 开头几层 | 前 3 层用哈希路由 | 报告与 config.json 里都没有哈希路由 |
| 负载均衡 | 无辅助损失的偏置 + 轻微的序列级平衡损失 | 同左,图像与文本 token 各用一套偏置 |
其他组件
| 组件 | V4-Flash | V4.1-Flash |
|---|---|---|
| mHC | 4 条残差流,Sinkhorn-Knopp 迭代 20 次 | Single-Pass mHC,同样 4 条、20 次 |
| 投机解码 | MTP 深度 1(6 月起另有外挂 DSpark 的版本) | DSpark:3 个块,一次草拟 5 个 token,预训练后单独训练 |
| Engram | 无 | 第 1、14 层,共 196B 参数,FP8 |
| 视觉编码器 | 无 | DeepSeek-ViT:32 层、隐藏维度 1024、patch 14,单图最多 1024 个 token |
训练
| 项目 | V4-Flash | V4.1-Flash |
|---|---|---|
| 预训练数据 | 32T token | 45T token,多模态(纯文本与多模态约 7:1) |
| 批量 | 逐步增大到 75.5M token | 全程固定 100.6M token |
| 学习率 | 峰值 2.7×10⁻⁴,末段降到 2.7×10⁻⁵ | 峰值 2.6×10⁻⁴,28T–40T 之间余弦降到 2.6×10⁻⁵ |
| 稀疏注意力 | 先用稠密注意力热身 1T token,64K 长度时引入 | 从头就是稀疏注意力,在 64K 长度上训 |
| 上下文扩展 | 4K → 16K → 64K → 1M | 训练到 34T token 时由 64K 扩到 1M |
| 优化器 | Muon + AdamW | head-wise Muon + AdamW + Sinkhorn 均衡更新 |
| 后训练 | 分领域专家(SFT + GRPO)→ 在线策略蒸馏合并 | SFT → RL → 在线策略蒸馏,算法不变,数据与环境放大 |
推理控制与采样
| 项目 | V4-Flash | V4.1-Flash |
|---|---|---|
| 推理控制 | Non-think / Think High / Think Max 三种模式;0731 起 API 为 low / high / max | 1–100 的整数;API 三档 low / high / max 对应 50 / 75 / 100 |
| 推荐采样 | temperature 1.0,top_p 1.0(0731:agent 场景 top_p 0.95) | temperature 1.0,top_p 0.95 或 1.0 |
| 输出长度 | Think Max 建议上下文不少于 384K | 模型卡建议 max_tokens 不少于 256K;API 最大输出 384K |
精度
| 部件 | V4-Flash | V4.1-Flash |
|---|---|---|
| 路由专家权重 | FP4 | FP4 |
| 其余大部分权重 | FP8 | FP8 |
| 索引器 Q / K | FP4(MXFP4) | FP4(MXFP4) |
| 主 KV 缓存 | FP8,RoPE 维 BF16 | FP4 |
| 滑动窗口 KV | FP8,RoPE 维 BF16 | FP8 |
| Engram 表 | — | FP8 |
“在参数最多的地方省得最狠”这条原则 V4.1 没变,只是把它延伸到了缓存上,FP4 那一章细讲。
API 定价
deepseek-flash(DeepSeek-V4.1-Flash)的官方价格,单位是每百万 token [5]:
| 计费项 | 闲时 | 高峰 |
|---|---|---|
| 输入(缓存命中) | $0.003(0.02 元) | $0.006(0.04 元) |
| 输入(缓存未命中) | $0.15(1 元) | $0.3(2 元) |
| 输出 | $0.6(4 元) | $1.2(8 元) |
高峰时段是北京时间周一至周五 9:00–12:00、14:00–18:00,不含中国法定节假日;其余时间(含周末与法定节假日全天)都算闲时,闲时价是高峰价的一半。并发上限 2500。
前代 V4-Flash 的价格变过三次,按官方价格页的存档整理如下(美元,闲时 / 高峰)[5][6]:
| 时间点 | 缓存命中 | 缓存未命中 | 输出 |
|---|---|---|---|
| 2026-04-24,V4-Flash 发布时 | 0.028 | 0.14 | 0.28 |
| 2026-08-01 存档,V4-Flash-0731 | 0.0028 | 0.14 | 0.28 |
| 2026-08-16 起,峰谷定价 | 0.007 / 0.014 | 0.22 / 0.44 | 0.66 / 1.32 |
| 2026-09-10 起,V4.1-Flash | 0.003 / 0.006 | 0.15 / 0.3 | 0.6 / 1.2 |
和 V4.1 发布前一天的 V4-Flash 相比,缓存命中价降了约 57%,未命中降了约 32%,输出降了约 9%。官方把降价归因于新架构“能够以更低的成本服务更多的用户”,并特别指出 Agent 场景里缓存命中的费用占比往往较高 [8]。
缓存命中价始终是未命中价的 1/50(高峰、闲时都是)。对反复追加上下文的 Agent 循环,这一条比输出价更决定账单。和 Kimi K3 的 $3 / $15 对比,V4.1-Flash 的输出价是它的 1/12.5(高峰)到 1/25(闲时)。
部署
| 项目 | 数值 | 出处 |
|---|---|---|
| 官方权重 | 约 510 GB,48 个 safetensors 分片(V4-Flash 约 160 GB) | Hugging Face 仓库文件列表 |
| 其中 Engram 表 | 约 183 GiB,FP8 | vLLM 配方页 [7] |
| 最低显存估算 | 约 614 GB:一组 GB200 NVL4,或一台 8 卡 H200 | vLLM 配方页 [7] |
| 1M token 的全局 KV | 不到 1 GB | 按 890 字节推算 |
下一章从成本账讲起:百万 token 到底贵在哪。👉 百万 token 的成本账
参考文献
- [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 第 2 节(架构)、第 4.2 节(模型与训练设置)、第 5.1.4 节(推理强度档位映射)。
- [2] Hugging Face:deepseek-ai/DeepSeek-V4.1-Flash 的模型卡、
config.json与文件列表 —— 层配置、推荐采样参数、各代每 token 全局 KV 对比图、权重体积。 - [3] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. arXiv:2606.19348 —— V4-Flash 的模型设置、训练设置与 KV 存储格式。
- [4] Hugging Face:deepseek-ai/DeepSeek-V4-Flash 与 DeepSeek-V4-Flash-0731 的模型卡和
config.json—— 前代的逐层压缩率、三种推理模式、推荐采样与输出长度。 - [5] DeepSeek API 文档. “模型 & 价格.” 2026-09-19 查阅. api-docs.deepseek.com/zh-cn/quick_start/pricing —— V4.1-Flash 的美元与人民币价格、峰谷时段、并发上限。
- [6] Wayback Machine 对官方价格页的存档:2026-04-24、2026-08-01、2026-08-18、2026-09-09 —— V4-Flash 的历次价格;峰谷定价的生效时间见 DeepSeek 2026-08-13 的公告。
- [7] vLLM Recipes. “deepseek-ai/DeepSeek-V4.1-Flash.” 2026-09-19 查阅. recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash —— 第三方推理引擎文档:检查点各部分体积、主干参数的口径、最低显存估算。
- [8] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. api-docs.deepseek.com/zh-cn/news/news260910 —— 降价说明与缓存命中费用的说法。