自己跑起来
V4.1-Flash 的官方权重约 510 GB,其中近 200 GB 是可以放在主机内存甚至 SSD 上的 Engram 表。这一章算硬件账,介绍官方参考实现与推理引擎的支持情况、提示词格式与采样参数,以及 MIT 许可放开了什么。
前代 V4-Flash 的一大卖点是“少数几个个人有可能跑起来的前沿模型”。V4.1-Flash 变大了,这笔账要重算。
硬件账
| 项目 | V4-Flash | V4.1-Flash |
|---|---|---|
| 官方权重 | 约 160 GB,46 个分片 | 约 510 GB,48 个分片 |
| 其中 FP8 的 Engram 表 | —— | 约 183 GiB |
权重体积取自 Hugging Face 仓库的文件列表 [1]。vLLM 配方页给出了 V4.1-Flash 检查点的拆分(第三方推理引擎的估算)[3]:
| 部分 | 存储 |
|---|---|
| 路由专家与 DSpark 专家(MXFP4) | 259.5 GiB |
| Engram 表(FP8) | 183.1 GiB |
| 注意力、稠密投影与路由器(FP8) | 6.9 GiB |
| 嵌入与输出头(BF16)、归一化(FP32) | 3.9 GiB |
| 各处量化缩放因子 | 21.9 GiB |
按这份拆分,vLLM 给的最低显存估算约 614 GB(总量乘 1.2 的余量):放得进一组 GB200 NVL4(768 GB,4 卡张量并行),或一台 8 卡 H200(1128 GB)并留出缓存空间 [3]。换句话说,全部权重进显存的话,门槛是一台多卡服务器,不再是一台工作站。
缓存反而不是瓶颈。按 890 字节 / token,一条 1M token 的提示词全局 KV 不到 1 GB,每层再加固定 128 个 token 的滑动窗口缓存 [3]。决定容量上限的是权重和批量大小。
Engram 不一定要进显存。 它的查表地址只取决于输入 token,DeepSeek 自己的推理系统就是把嵌入放在主机内存里、通过后台 RDMA 提前取到 GPU [2]。社区已经有人更进一步:antirez 为自己的 DwarfStar 推理程序发布的 GGUF 量化版,把约 189 GiB 的原生 FP8 Engram 表留在文件里、运行时直接从 SSD 读需要的行;它的说明称 Q2 版(文件 340.6 GiB,主权重 151.77 GiB)可以在一台 128 GB 内存的 Mac 上用 SSD 流式读取运行 [5]。这是社区项目的自述,速度与质量本专栏没有验证。
推理引擎
官方参考实现:仓库的 inference 目录,官方说明它是“可读的参考实现,而不是生产级的推理引擎”,覆盖视觉编码器、滑动窗口加压缩稀疏注意力与两级索引器、Engram、MoE、超连接和 DSpark 的前向,生成本身只是普通的自回归采样。用法是先把 Hugging Face 权重按张量并行的份数转换(示例是 8 份),再用 torchrun 启动 [4]。
vLLM:配方页(9 月 19 日查阅)的要点 [3]:
- 需要 vLLM 0.30.0 以上,目前只能用 Docker 镜像;NVIDIA 平台用 9 月 10 日及以后的 nightly 镜像。
- 列出了在 NVIDIA Blackwell(B200、B300、GB200、GB300)与 Hopper(H100、H200、H20)上验证过的命令,也给了 AMD MI355X 四卡的配置。
- 这个架构不支持
torch.compile;首次加载很慢,配方把就绪超时设到 3600 秒。 - 纯文本负载可以加
--language-model-only跳过视觉编码器,把显存让给 KV 缓存。 - DSpark 是这个检查点唯一的投机解码方式,每轮草拟 5 个 token。
其他版本:NVIDIA 在 9 月 16 日发布了用 Model Optimizer 量化的 NVFP4 版本,说明里写着在 GB300 上用 vLLM 与 SGLang 测试过 [6]。发布后几天内,Hugging Face 上还出现了数十个社区量化与微调版本(GGUF、MLX、EXL3 等)。用社区版之前,先看它基于官方仓库的哪个提交转换,前代那一章讲过的“同名不同版”在这里同样适用。
提示词格式与采样参数
V4.1 没有 Jinja 格式的对话模板。官方提供两样东西 [1][7]:
encoding/encoding.py:独立的提示词格式参考实现,带测试用例,覆盖多轮对话、工具调用、思考模式、数值推理强度、对话中途的系统消息和图文交错。- deepseek-recipe:一组带 Python 绑定的 Rust 库,把 Messages、Chat Completions、Responses 三种 API 请求转换成 V4 / V4.1 的提示词或 token,再把模型输出解析回来。
相对 V4 的三处格式变化 [7]:工具调用的 DSML 标签名前多了一个空格(V4 是 <|DSML|tool_calls>,V4.1 是 <|DSML| calls>);推理强度改为数值前缀,只在思考模式、只在对话开头渲染一次;支持对话中途插入系统消息。
模型卡推荐的采样参数 [1]:
| 参数 | 建议值 |
|---|---|
temperature | 1.0 |
top_p | 0.95 或 1.0 |
| 上下文窗口 | 1M token |
max_tokens | 不少于 256K |
max_tokens 这一条要当真:最高推理强度下思考很长,额度给少了会中途截断。推理强度的字符串映射在发布当天改过一次,不同引擎可能不一致,要和 API 行为对齐就直接传 1–100 的整数,详见推理强度那一章。
MIT 许可放开了什么
仓库与权重都以 MIT 许可发布 [1]:
- 可以商用,没有营收门槛、没有规模限制;
- 可以修改、微调、蒸馏,产物归你;
- 可以转售或作为服务对外提供——这是 MIT 与大多数“开放权重”许可的分水岭;
- 可以闭源分发,嵌进闭源产品;
- 唯一的义务是保留版权与许可声明。
三种典型用法
- 数据不出内网的场景:医疗、法务、金融里很多场景只能自托管。现在的门槛是一台多卡服务器(或者接受社区方案的速度与质量折损)。
- 超大批量:官方公告专门写了一句——有大规模部署需求、且具备相应资源(2k 卡 GPU、有存储集群)的,欢迎联系 [8]。持久化缓存依赖存储集群,这也说明 DeepSeek 自己的服务形态离不开它。
- 做领域模型的起点:MIT 加上完整的后训练权重。注意截至 9 月 19 日,Hugging Face 上只有 V4.1-Flash 这一个仓库,没有像 V4 那样单独放出 Base 权重。
如果都不属于这三类,直接用 API 通常更划算:闲时 $0.15 / $0.6、高峰 $0.3 / $1.2 每百万 token(缓存未命中的输入 / 输出),自建很难打赢。
主线到这里结束。接下来的第 6 部分是前代 V4-Flash 的档案:V4.1 已经不再使用、但值得对照着读的几处设计。👉 前代 · CSA:4 倍压缩 + 闪电索引器
参考文献
- [1] Hugging Face:deepseek-ai/DeepSeek-V4.1-Flash 的模型卡与文件列表,以及 DeepSeek-V4-Flash 的文件列表 —— 权重体积、推荐采样参数、对话模板说明、MIT 许可。
- [2] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. arXiv:2609.19969 —— 第 2.4.2 节:Engram 嵌入从主机内存经 RDMA 预取。
- [3] vLLM Recipes. “deepseek-ai/DeepSeek-V4.1-Flash.” 2026-09-19 查阅. recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash —— 第三方推理引擎文档:检查点拆分、最低显存估算、版本与硬件要求、纯文本模式、投机解码。
- [4] Hugging Face:deepseek-ai/DeepSeek-V4.1-Flash 的 inference/README.md —— 官方参考实现的定位、权重转换与启动方式。
- [5] Hugging Face:antirez/deepseek-v4.1-flash-gguf —— 社区项目:GGUF 各版本体积、Engram 表从 SSD 读取、在 128 GB 内存 Mac 上运行的说法。
- [6] Hugging Face:nvidia/DeepSeek-V4.1-Flash-NVFP4 —— NVIDIA 发布的 NVFP4 量化版及其测试环境。
- [7] Hugging Face:deepseek-ai/DeepSeek-V4.1-Flash 的 encoding/README.md —— 相对 V4 的三处格式变化。
- [8] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. api-docs.deepseek.com/zh-cn/news/news260910 —— 大规模部署的邀请。