首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

Qwen/Qwen3.8-2.4T-A95B

Qwen 首次把「Max 级」能力开到底:总参数约 2.4 万亿、每次前向仅激活 95B 的巨型稀疏 MoE,即云端 Qwen3.8-Max 的后训练完整权重,是当前 Qwen 开源家族最强一代的底模本尊。一是开源界罕见的万亿级底模直接释出,官方明示它就是 Qwen Cloud 上 Qwen3.8-Max 的基底;

类型
Model
热度分
73
下载量
21,340
Likes
1,167
许可证
未标注
在 HuggingFace 打开 回到总表

配图

信息卡

项目内容
HuggingFace 地址https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
类型Model
热度分 trendingScore73(截至 2026-08-26)
许可证other / qwen3.8-max(自定义许可)
月下载量约 21,340;已有 31 个社区量化跟进
榜单HuggingFace 热榜 L4 第43名

一句话定位

Qwen 首次把「Max 级」能力开到底:总参数约 2.4 万亿、每次前向仅激活 95B 的巨型稀疏 MoE,即云端 Qwen3.8-Max 的后训练完整权重,是当前 Qwen 开源家族最强一代的底模本尊。

为什么上热度榜

一是开源界罕见的万亿级底模直接释出,官方明示它就是 Qwen Cloud 上 Qwen3.8-Max 的基底;二是基准表火力拉满——Terminal Bench 2.1 达 86.6、PaperBench 93.0、GPQA Diamond 92.6、IFBench 82.8,与 Claude Opus 4.8 / Fable 5 / GPT-5.6 Sol 同台对垒且多项领跑;三是发版即引来 31 个量化、6 个 Space 挂载,社区消化速度极快。

规格与技术亮点

92 层混合架构按「23 组 × (3 层 Gated DeltaNet 线性注意力→MoE + 1 层 Gated Attention→MoE)」堆叠;512 专家中激活 10 路由 + 1 共享,专家中间维 2048;隐藏维 8192,词表 248,320;训练采用多步 MTP。原生上下文 262,144,可扩展至约 101 万 token。纯文本模型且强制思考(无法关闭),支持 reasoning_effort 三档(xhigh/medium/low)调节推理深度,preserve_thinking 默认保留历史思考链。

使用方式与代码示例

client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B",
    messages=[{"role":"user","content":"合并两条有序链表的 Python 实现"}],
    extra_body={"chat_template_kwargs":{"enable_thinking":True,"preserve_thinking":True}},
    reasoning_effort="xhigh",
)

推荐采样:temperature=1.0、top_p=0.95、top_k=20、presence_penalty=0。

部署建议

BF16 原始权重为 TB 级存储量,只适合多机集群;常规用户选社区量化或直接走 API。推理引擎用最新版 vLLM / SGLang / TokenSpeed;百万级上下文场景给足思考输出预算(思考 262,144 + 最终答复 131,072)。

典型应用场景

同类对比

相较 Qwen3.7-Max 全面跃升(Terminal Bench 74.5→86.6);在开源侧规模独一档,稠密大模型部署成本完全不可比;对 Opus 4.8 / GPT-5.6 Sol 在编程代理多数分项仍有小幅落后,但差距已明显收窄。

资源导航

官方博客《Qwen3.8-Max》、Model Card 基准表及脚注(harness/采样细节非常细)、Qwen3.8 Cookbook(vLLM/SGLang 配方)、Qwen Cloud 托管服务。

← 上一篇AntResearch/4DAnyone下一篇 →PoopMan333/H3_Character_Sheet_Generator