首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

deepseek-ai/DeepSeek-V4-Pro-0813

DeepSeek 官方于 2026 年 8 月 13 日发布的 V4-Pro 正式版(取代此前预览版):约 1.65 万亿参数的稀疏 MoE 旗舰,主打 Agent 能力,附带自研 DSpark 投机解码模块,且以宽松的 MIT 许可开放。核心能力围绕DSpark投机解码、论文arXiv展开。

类型
Model
热度分
112
下载量
85,230
Likes
762
许可证
未标注
在 HuggingFace 打开 回到总表

配图

信息卡

项目内容
HuggingFace 地址https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
类型Model
热度分 trendingScore112(截至 2026-08-26)
许可证MIT
榜单HuggingFace 热榜 L4 第29名

一句话定位

DeepSeek 官方于 2026 年 8 月 13 日发布的 V4-Pro 正式版(取代此前预览版):约 1.65 万亿参数的稀疏 MoE 旗舰,主打 Agent 能力,附带自研 DSpark 投机解码模块,且以宽松的 MIT 许可开放。

为什么上热度榜

开源阵营重量级旗舰的"转正式"发布:两周内 8.5 万下载、762 点赞;MIT 零商用门槛在万亿级模型中罕见;DSpark 投机解码与 fp8 KV cache 让超大 MoE 的推理成本进一步下探;Agent/工具基准(Terminal-Bench、NL2Repo、Cybergym)位列第一梯队。

规格与技术亮点

使用方式与代码示例

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
    "deepseek-ai/DeepSeek-V4-Pro-0813", device_map="auto")

vLLM 服务需叠加 kv-cache fp8、block-size 256 与 speculative JSON 配置。代表基准(最小化 Agent 框架、max effort):Terminal Bench 2.1 = 87.9、HLE 无工具/带工具 = 42.7/60.0、NL2Repo 61.5、Cybergym 83.3、DeepSWE 62.7。

部署建议(本地/云端/量化选择)

893GB 权重决定了本地部署是多节点集群级工程;个人与企业优先选择官方 API 或第三方托管(deepinfra 输出价 $2.60/M 级别、baseten 峰值约 114 tok/s);Hub 已有 12 个社区量化可作为压测参考,但实际可用性仍受显存墙限制。私有化需求建议关注后续蒸馏小杯版本。

典型应用场景

同类对比

对比 Kimi-K3:体量更轻(1.7T vs 2.8T)、许可更自由(MIT),编码基础设施类任务互有胜负;对比 GLM-5.2 在 Terminal-Bench/HLE 基本持平;对闭源 Opus-4.8/Fable-5 以免许可优势换部分场景分差。

资源导航

论文:arXiv:2606.19348|集合:DeepSeek-V4 Collection(共 8 项)|讨论区 19 条|在线推理:deepinfra / baseten / 官方端点。

← 上一篇0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF下一篇 →LBH-123-AI/Minimax_h3_latent_Upscaler