DeepSeek-V4-Flash 官方正式版(取代 Preview):主打 agentic 能力跃升与百万 token 级上下文的极致效率,官方称基准成绩超过更大的 V4-Pro 预览版、比肩最强闭源旗舰。7 月 31 日发布、8 月 1 日定稿,月下载高达 3,857,140 次、点赞 3.73k,是本期榜单中下载量最大的条目之一,延续 DeepSeek 一贯的"开源炸场"效应;

| 项目 | 内容 |
|---|---|
| HuggingFace 地址 | https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 |
| 类型 | Model(MoE 推理/Agent 大模型) |
| 热度分 trendingScore | 151(截至 2026-08-26) |
| 许可证 | MIT |
| 榜单 | HuggingFace 热榜 第21名 |
DeepSeek-V4-Flash 官方正式版(取代 Preview):主打 agentic 能力跃升与百万 token 级上下文的极致效率,官方称基准成绩超过更大的 V4-Pro 预览版、比肩最强闭源旗舰。
7 月 31 日发布、8 月 1 日定稿,月下载高达 3,857,140 次、点赞 3.73k,是本期榜单中下载量最大的条目之一,延续 DeepSeek 一贯的"开源炸场"效应;MIT 许可继续压低商用门槛,发布后迅速成为 vLLM、SGLang 等推理框架的优先适配对象。
总参数 304B(safetensors 约 166.9GB),MoE 架构、激活参数量远小于 V4-Pro(具体数值见技术报告,论文主题即 "Towards Highly Efficient Million-Token Context Intelligence")。亮点:同一 checkpoint 内置 DSpark 投机解码模块(草稿与目标权重同包)——草稿分支快速猜测后续 token,目标分支一次性并行验证,长输出 agentic 场景吞吐提升明显;fp8 KV cache;fp8/fp4/mxfp4 多档量化推理;reasoning_effort 三档 low/high/max,high/max 档最大输出可达 384K token。基准摘录:Terminal Bench 2.1 得 82.7(V4-Pro Preview 72.1 / Opus-4.8 85.0)、DeepSWE 54.4、Cybergym 76.7。注意细节:模型不含 Jinja 聊天模板,对话构造须用仓库 `encoding/` 目录的 Python 编码脚本;推荐 temperature=1.0、agentic 场景 top_p=0.95。
transformers 标准 `AutoTokenizer`/`AutoModelForCausalLM` 加载;vLLM 关键参数:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 \
--block-size 256 --enable-expert-parallel --moe-backend deep_gemm_mega_moe \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
SGLang 对应 `--speculative-algorithm DSPARK --moe-runner-backend flashinfer_mxfp4`。
166GB 权重至少需要 4×80GB GPU 节点或等效内存级环境,选 mxfp4/fp4 量化档可大幅压缩显存占用,配合 expert parallel 提升高并发下的利用率;中小团队建议优先走 API 或托管推理服务。
与 V4-Pro 构成"Flash 高效旗舰 + Pro 大杯"双档;对国际闭源阵营的差异点是 MIT 许可与低激活成本,flash 定位类似 GPT 小时延档的开放式平替。相比同期其他开源旗舰,DeepSeek 保持权重、推理栈与研究论文同步开放的透明策略。
模型卡、仓库 `encoding/` 脚本目录、技术报告(百万 token 上下文论文)。