规格总表

把 V4.1-Flash 与前代 V4-Flash 的规格并排摊开:参数口径、层配置、注意力与缓存、MoE、训练、推理控制、精度、API 价格与部署门槛,每一行都标出处。

作者 David更新于 2 篇(共 21 篇)

这是本专栏的索引页,后面每章从这里取一两行展开。V4-Flash 一列是前代数据,方便对照;数字出处见文末,价格为 2026 年 9 月 19 日查阅官方价格页所得。

主干

项目V4-Flash(前代)V4.1-Flash
参数284B(总参数)552B 主干 + 196B Engram
每 token 激活13B预填充 8B / 解码 16B
层数4340(因果编码器 20 + 解码器 20)
隐藏维度40965120
注意力头64 个查询头、1 个共享 KV 头,头维 512同左
查询压缩维度10241280
词表129,280129,280
上下文1M(YaRN 16 倍,原始窗口 65,536)同左
模态文本图像 + 文本输入,文本输出
许可MITMIT

参数口径不完全一致。 V4 报告写的是“总参数 284B”;V4.1 报告把 552B 称为“主干参数”,另报 196B Engram 参数 [1][2]。据 vLLM 配方页的拆分,552B 覆盖路由专家、注意力与嵌入,Engram 表、约 14B 的 DSpark 草稿头和量化缩放因子都在它之外 [7]。所以“V4.1 比 V4 大了近一倍”只是主干之间的比较;把 Engram 算进去,差得更多。

注意力与缓存

项目V4-FlashV4.1-Flash
全局注意力CSA(压缩率 4,top-512)与 HCA(压缩率 128,稠密)逐层交替纯 CSA2:编码器压缩率 2,解码器压缩率 1(即不压缩),top-512
只用滑动窗口的层第 0、1 层第 0、1 层
自己产生全局 KV 的层41 层(每个 CSA / HCA 层)4 层(第 2、8、14、20 层)
运行索引器的层21 个 CSA 层8 层(第 2、8、14、20、24、28、32、36 层)
索引器64 头 × 128 维32 头 × 128 维;解码器里另有分层候选池(2,048 块 × 8 个位置)
滑动窗口128 token128 token
主 KV 精度FP8(RoPE 维为 BF16)FP4(E2M1,每 16 个通道一个 E4M3 缩放)
每 token 全局 KV3,514 字节890 字节
持久化 KV(SSD / 主机内存)基准1/8

层号从 0 数。V4-Flash 的排布来自 V4 论文与 config.jsoncompress_ratios;V4.1-Flash 的来自技术报告第 4.2.1 节与 config.jsonkv_source_layer_idsindex_source_layer_ids [1][2][3][4]。每 token 字节数取自模型卡里的各代对比图 [2]。

MoE

项目V4-FlashV4.1-Flash
共享专家11
路由专家256384
每 token 激活路由专家66
专家中间维度20482304
亲和度打分Sqrt(Softplus)同左
开头几层前 3 层用哈希路由报告与 config.json 里都没有哈希路由
负载均衡无辅助损失的偏置 + 轻微的序列级平衡损失同左,图像与文本 token 各用一套偏置

其他组件

组件V4-FlashV4.1-Flash
mHC4 条残差流,Sinkhorn-Knopp 迭代 20 次Single-Pass mHC,同样 4 条、20 次
投机解码MTP 深度 1(6 月起另有外挂 DSpark 的版本)DSpark:3 个块,一次草拟 5 个 token,预训练后单独训练
Engram第 1、14 层,共 196B 参数,FP8
视觉编码器DeepSeek-ViT:32 层、隐藏维度 1024、patch 14,单图最多 1024 个 token

训练

项目V4-FlashV4.1-Flash
预训练数据32T token45T token,多模态(纯文本与多模态约 7:1)
批量逐步增大到 75.5M token全程固定 100.6M token
学习率峰值 2.7×10⁻⁴,末段降到 2.7×10⁻⁵峰值 2.6×10⁻⁴,28T–40T 之间余弦降到 2.6×10⁻⁵
稀疏注意力先用稠密注意力热身 1T token,64K 长度时引入从头就是稀疏注意力,在 64K 长度上训
上下文扩展4K → 16K → 64K → 1M训练到 34T token 时由 64K 扩到 1M
优化器Muon + AdamWhead-wise Muon + AdamW + Sinkhorn 均衡更新
后训练分领域专家(SFT + GRPO)→ 在线策略蒸馏合并SFT → RL → 在线策略蒸馏,算法不变,数据与环境放大

推理控制与采样

项目V4-FlashV4.1-Flash
推理控制Non-think / Think High / Think Max 三种模式;0731 起 API 为 low / high / max1–100 的整数;API 三档 low / high / max 对应 50 / 75 / 100
推荐采样temperature 1.0,top_p 1.0(0731:agent 场景 top_p 0.95)temperature 1.0,top_p 0.95 或 1.0
输出长度Think Max 建议上下文不少于 384K模型卡建议 max_tokens 不少于 256K;API 最大输出 384K

精度

部件V4-FlashV4.1-Flash
路由专家权重FP4FP4
其余大部分权重FP8FP8
索引器 Q / KFP4(MXFP4)FP4(MXFP4)
主 KV 缓存FP8,RoPE 维 BF16FP4
滑动窗口 KVFP8,RoPE 维 BF16FP8
Engram 表FP8

“在参数最多的地方省得最狠”这条原则 V4.1 没变,只是把它延伸到了缓存上,FP4 那一章细讲。

API 定价

deepseek-flash(DeepSeek-V4.1-Flash)的官方价格,单位是每百万 token [5]:

计费项闲时高峰
输入(缓存命中)$0.003(0.02 元)$0.006(0.04 元)
输入(缓存未命中)$0.15(1 元)$0.3(2 元)
输出$0.6(4 元)$1.2(8 元)

高峰时段是北京时间周一至周五 9:00–12:00、14:00–18:00,不含中国法定节假日;其余时间(含周末与法定节假日全天)都算闲时,闲时价是高峰价的一半。并发上限 2500。

前代 V4-Flash 的价格变过三次,按官方价格页的存档整理如下(美元,闲时 / 高峰)[5][6]:

时间点缓存命中缓存未命中输出
2026-04-24,V4-Flash 发布时0.0280.140.28
2026-08-01 存档,V4-Flash-07310.00280.140.28
2026-08-16 起,峰谷定价0.007 / 0.0140.22 / 0.440.66 / 1.32
2026-09-10 起,V4.1-Flash0.003 / 0.0060.15 / 0.30.6 / 1.2

和 V4.1 发布前一天的 V4-Flash 相比,缓存命中价降了约 57%,未命中降了约 32%,输出降了约 9%。官方把降价归因于新架构“能够以更低的成本服务更多的用户”,并特别指出 Agent 场景里缓存命中的费用占比往往较高 [8]。

缓存命中价始终是未命中价的 1/50(高峰、闲时都是)。对反复追加上下文的 Agent 循环,这一条比输出价更决定账单。和 Kimi K3 的 $3 / $15 对比,V4.1-Flash 的输出价是它的 1/12.5(高峰)到 1/25(闲时)。

部署

项目数值出处
官方权重约 510 GB,48 个 safetensors 分片(V4-Flash 约 160 GB)Hugging Face 仓库文件列表
其中 Engram 表约 183 GiB,FP8vLLM 配方页 [7]
最低显存估算约 614 GB:一组 GB200 NVL4,或一台 8 卡 H200vLLM 配方页 [7]
1M token 的全局 KV不到 1 GB按 890 字节推算

下一章从成本账讲起:百万 token 到底贵在哪。👉 百万 token 的成本账

参考文献

  • [1] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 第 2 节(架构)、第 4.2 节(模型与训练设置)、第 5.1.4 节(推理强度档位映射)。
  • [2] Hugging Face:deepseek-ai/DeepSeek-V4.1-Flash 的模型卡、config.json 与文件列表 —— 层配置、推荐采样参数、各代每 token 全局 KV 对比图、权重体积。
  • [3] DeepSeek-AI. “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.” 2026-04. arXiv:2606.19348 —— V4-Flash 的模型设置、训练设置与 KV 存储格式。
  • [4] Hugging Face:deepseek-ai/DeepSeek-V4-FlashDeepSeek-V4-Flash-0731 的模型卡和 config.json —— 前代的逐层压缩率、三种推理模式、推荐采样与输出长度。
  • [5] DeepSeek API 文档. “模型 & 价格.” 2026-09-19 查阅. api-docs.deepseek.com/zh-cn/quick_start/pricing —— V4.1-Flash 的美元与人民币价格、峰谷时段、并发上限。
  • [6] Wayback Machine 对官方价格页的存档:2026-04-242026-08-012026-08-182026-09-09 —— V4-Flash 的历次价格;峰谷定价的生效时间见 DeepSeek 2026-08-13 的公告。
  • [7] vLLM Recipes. “deepseek-ai/DeepSeek-V4.1-Flash.” 2026-09-19 查阅. recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash —— 第三方推理引擎文档:检查点各部分体积、主干参数的口径、最低显存估算。
  • [8] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. api-docs.deepseek.com/zh-cn/news/news260910 —— 降价说明与缓存命中费用的说法。

本页目录