# 自己跑起来

> V4.1-Flash 的官方权重约 510 GB，其中近 200 GB 是可以放在主机内存甚至 SSD 上的 Engram 表。这一章算硬件账，介绍官方参考实现与推理引擎的支持情况、提示词格式与采样参数，以及 MIT 许可放开了什么。

- 作者：David（道雾轩）
- 专栏：DeepSeek V4.1 Flash 深度解析（https://daiw.net/manual/deepseek-v4-flash.md）
- 最后更新：2026-09-19
- 原文：https://daiw.net/manual/deepseek-v4-flash/self-host
- 转载与引用：请注明出处并附原文链接（https://daiw.net/about/copyright）

前代 V4-Flash 的一大卖点是“少数几个个人有可能跑起来的前沿模型”。V4.1-Flash 变大了，这笔账要重算。

## 硬件账

| 项目 | V4-Flash | **V4.1-Flash** |
| --- | --- | --- |
| 官方权重 | 约 160 GB，46 个分片 | **约 510 GB**，48 个分片 |
| 其中 FP8 的 Engram 表 | —— | 约 183 GiB |

权重体积取自 Hugging Face 仓库的文件列表 [1]。vLLM 配方页给出了 V4.1-Flash 检查点的拆分（第三方推理引擎的估算）[3]：

| 部分 | 存储 |
| --- | --- |
| 路由专家与 DSpark 专家（MXFP4） | 259.5 GiB |
| Engram 表（FP8） | 183.1 GiB |
| 注意力、稠密投影与路由器（FP8） | 6.9 GiB |
| 嵌入与输出头（BF16）、归一化（FP32） | 3.9 GiB |
| 各处量化缩放因子 | 21.9 GiB |

按这份拆分，vLLM 给的最低显存估算约 **614 GB**（总量乘 1.2 的余量）：放得进一组 GB200 NVL4（768 GB，4 卡张量并行），或一台 8 卡 H200（1128 GB）并留出缓存空间 [3]。**换句话说，全部权重进显存的话，门槛是一台多卡服务器，不再是一台工作站。**

缓存反而不是瓶颈。按 890 字节 / token，一条 1M token 的提示词全局 KV 不到 1 GB，每层再加固定 128 个 token 的滑动窗口缓存 [3]。决定容量上限的是权重和批量大小。

<Callout type="info">
  **Engram 不一定要进显存。** 它的查表地址只取决于输入 token，DeepSeek 自己的推理系统就是把嵌入放在主机内存里、通过后台 RDMA 提前取到 GPU [2]。社区已经有人更进一步：antirez 为自己的 DwarfStar 推理程序发布的 GGUF 量化版，把约 189 GiB 的原生 FP8 Engram 表留在文件里、运行时直接从 SSD 读需要的行；它的说明称 Q2 版（文件 340.6 GiB，主权重 151.77 GiB）可以在一台 128 GB 内存的 Mac 上用 SSD 流式读取运行 [5]。这是**社区项目的自述**，速度与质量本专栏没有验证。
</Callout>

## 推理引擎

**官方参考实现**：仓库的 `inference` 目录，官方说明它是“可读的参考实现，而不是生产级的推理引擎”，覆盖视觉编码器、滑动窗口加压缩稀疏注意力与两级索引器、Engram、MoE、超连接和 DSpark 的前向，生成本身只是普通的自回归采样。用法是先把 Hugging Face 权重按张量并行的份数转换（示例是 8 份），再用 `torchrun` 启动 [4]。

**vLLM**：配方页（9 月 19 日查阅）的要点 [3]：

- 需要 vLLM 0.30.0 以上，目前只能用 Docker 镜像；NVIDIA 平台用 9 月 10 日及以后的 nightly 镜像。
- 列出了在 NVIDIA Blackwell（B200、B300、GB200、GB300）与 Hopper（H100、H200、H20）上验证过的命令，也给了 AMD MI355X 四卡的配置。
- 这个架构不支持 `torch.compile`；首次加载很慢，配方把就绪超时设到 3600 秒。
- 纯文本负载可以加 `--language-model-only` 跳过视觉编码器，把显存让给 KV 缓存。
- DSpark 是这个检查点唯一的投机解码方式，每轮草拟 5 个 token。

**其他版本**：NVIDIA 在 9 月 16 日发布了用 Model Optimizer 量化的 NVFP4 版本，说明里写着在 GB300 上用 vLLM 与 SGLang 测试过 [6]。发布后几天内，Hugging Face 上还出现了数十个社区量化与微调版本（GGUF、MLX、EXL3 等）。用社区版之前，先看它基于官方仓库的哪个提交转换，[前代那一章讲过的“同名不同版”](https://daiw.net/manual/deepseek-v4-flash/post-training-0731)在这里同样适用。

## 提示词格式与采样参数

V4.1 **没有 Jinja 格式的对话模板**。官方提供两样东西 [1][7]：

- `encoding/encoding.py`：独立的提示词格式参考实现，带测试用例，覆盖多轮对话、工具调用、思考模式、数值推理强度、对话中途的系统消息和图文交错。
- deepseek-recipe：一组带 Python 绑定的 Rust 库，把 Messages、Chat Completions、Responses 三种 API 请求转换成 V4 / V4.1 的提示词或 token，再把模型输出解析回来。

相对 V4 的三处格式变化 [7]：工具调用的 DSML 标签名前多了一个空格（V4 是 `<｜DSML｜tool_calls>`，V4.1 是 `<｜DSML｜ calls>`）；推理强度改为数值前缀，只在思考模式、只在对话开头渲染一次；支持对话中途插入系统消息。

模型卡推荐的采样参数 [1]：

| 参数 | 建议值 |
| --- | --- |
| `temperature` | 1.0 |
| `top_p` | 0.95 或 1.0 |
| 上下文窗口 | 1M token |
| `max_tokens` | 不少于 256K |

`max_tokens` 这一条要当真：最高推理强度下思考很长，额度给少了会中途截断。推理强度的字符串映射在发布当天改过一次，不同引擎可能不一致，要和 API 行为对齐就直接传 1–100 的整数，详见[推理强度那一章](https://daiw.net/manual/deepseek-v4-flash/reasoning-effort)。

## MIT 许可放开了什么

仓库与权重都以 MIT 许可发布 [1]：

- 可以**商用**，没有营收门槛、没有规模限制；
- 可以**修改、微调、蒸馏**，产物归你；
- 可以**转售或作为服务对外提供**——这是 MIT 与大多数“开放权重”许可的分水岭；
- 可以**闭源分发**，嵌进闭源产品；
- 唯一的义务是保留版权与许可声明。

## 三种典型用法

1. **数据不出内网的场景**：医疗、法务、金融里很多场景只能自托管。现在的门槛是一台多卡服务器（或者接受社区方案的速度与质量折损）。
2. **超大批量**：官方公告专门写了一句——有大规模部署需求、且具备相应资源（2k 卡 GPU、有存储集群）的，欢迎联系 [8]。持久化缓存依赖存储集群，这也说明 DeepSeek 自己的服务形态离不开它。
3. **做领域模型的起点**：MIT 加上完整的后训练权重。注意截至 9 月 19 日，Hugging Face 上**只有 V4.1-Flash 这一个仓库**，没有像 V4 那样单独放出 Base 权重。

如果都不属于这三类，**直接用 API 通常更划算**：闲时 \$0.15 / \$0.6、高峰 \$0.3 / \$1.2 每百万 token（缓存未命中的输入 / 输出），自建很难打赢。

主线到这里结束。接下来的第 6 部分是前代 V4-Flash 的档案：V4.1 已经不再使用、但值得对照着读的几处设计。👉 [前代 · CSA：4 倍压缩 + 闪电索引器](https://daiw.net/manual/deepseek-v4-flash/csa)

## 参考文献

- [1] Hugging Face：[deepseek-ai/DeepSeek-V4.1-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) 的模型卡与文件列表，以及 [DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) 的文件列表 —— 权重体积、推荐采样参数、对话模板说明、MIT 许可。
- [2] DeepSeek-AI. “DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.” 2026-09. [arXiv:2609.19969](https://arxiv.org/abs/2609.19969) —— 第 2.4.2 节：Engram 嵌入从主机内存经 RDMA 预取。
- [3] vLLM Recipes. “deepseek-ai/DeepSeek-V4.1-Flash.” 2026-09-19 查阅. [recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash](https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash) —— 第三方推理引擎文档：检查点拆分、最低显存估算、版本与硬件要求、纯文本模式、投机解码。
- [4] Hugging Face：[deepseek-ai/DeepSeek-V4.1-Flash 的 inference/README.md](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/inference/README.md) —— 官方参考实现的定位、权重转换与启动方式。
- [5] Hugging Face：[antirez/deepseek-v4.1-flash-gguf](https://huggingface.co/antirez/deepseek-v4.1-flash-gguf) —— 社区项目：GGUF 各版本体积、Engram 表从 SSD 读取、在 128 GB 内存 Mac 上运行的说法。
- [6] Hugging Face：[nvidia/DeepSeek-V4.1-Flash-NVFP4](https://huggingface.co/nvidia/DeepSeek-V4.1-Flash-NVFP4) —— NVIDIA 发布的 NVFP4 量化版及其测试环境。
- [7] Hugging Face：[deepseek-ai/DeepSeek-V4.1-Flash 的 encoding/README.md](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/encoding/README.md) —— 相对 V4 的三处格式变化。
- [8] DeepSeek. “DeepSeek-V4.1-Flash 发布.” 2026-09-10. [api-docs.deepseek.com/zh-cn/news/news260910](https://api-docs.deepseek.com/zh-cn/news/news260910) —— 大规模部署的邀请。
