Qwen 团队于采集时点(2026 年 8 月下旬)放出的"为 Qwen4 奠定基础"的实验性预览模型:总参 125B 但每 token 仅激活 6B 的混合注意力 MoE,原生多模态 + 思考推理,发布两天即登顶热榜。核心能力围绕参数结构、混合注意力、GatedResidual展开。其一,`qwen4_exp` 标签本身就携带巨大信息量——社区将其视为 Qwen4 架构的风向标,权重尚未铺开讨论已先行。

| 项目 | 内容 |
|---|---|
| HF 地址 | https://huggingface.co/Qwen/Qwen3.8-Flash-Next |
| 类型 | 多模态因果语言模型(image-text-to-text,思考型) |
| trendingScore | 3323 |
| 许可证 | qwen-community-1.0(页面归类为 other) |
| 榜单 | HuggingFace 热榜第 1 名 |
Qwen 团队于采集时点(2026 年 8 月下旬)放出的"为 Qwen4 奠定基础"的实验性预览模型:总参 125B 但每 token 仅激活 6B 的混合注意力 MoE,原生多模态 + 思考推理,发布两天即登顶热榜。
其一,`qwen4_exp` 标签本身就携带巨大信息量——社区将其视为 Qwen4 架构的风向标,权重尚未铺开讨论已先行。其二,125B 总参 / 6B 激活的配比使其成为 MoE 效率路线的极致样本,工程研究者争相拆解。其三,GPQA Diamond 91.7、SWE-bench Multilingual 81.0 等同规模第一的成绩单提供了硬证据。热榜第 1 与 3.4k 点赞相互放大,形成正循环。
官方支持 Transformers(`AutoModelForMultimodalLM` + `AutoProcessor`)、vLLM/SGLang/TokenSpeed 与 Docker Model Runner;已有 21 个量化版本适配 llama.cpp、Ollama、LM Studio、Jan。vLLM 起服后走 OpenAI 兼容 Chat Completions,可流式读取 `reasoning_content`;`enable_thinking`、`preserve_thinking` 与 `reasoning_effort`(xhigh/medium/low)控制思考深度。推荐采样:思考模式 temperature=1.0/top_p=0.95;非思考 temperature=0.7/top_p=0.80/presence_penalty=1.5。长上下文经 config 注入 YaRN 配置启用。注意暂无 HF 官方 Inference Provider 托管。
激活仅 6B 但总量约 180B,全量 BF16 需多卡 H100 级集群;个人与中小团队建议用 GGUF/AWQ 量化版(21 个衍生量化覆盖从笔记本到工作站),配合 llama.cpp/Ollama 走稀疏激活红利;生产服务优先 vLLM + FP8;试验架构特性选 SGLang。云端则建议等 Qwen API 服务上线后直接调用。
超长文档(百万字级代码库/案卷)分析与 Agent 任务编排;图像/视频理解 + 多步推理混合工作流;低成本高吞吐的生产推理试点;面向 Qwen4 的生态预研与微调适配验证。
对比同榜 Qwen3.8-27B:Flash-Next 用 6B 激活换更低推理成本、规模上限更高但部署更重;对比 GLM-5.3-Flash(320B/18B):均为稀疏激进制路线,Qwen 以更小激活主打端侧友好与效率研究;对比 Kimi 系线性注意力模型亦属同一技术潮流。数据为采集时点信息,后续版本迭代请以官方页面为准。
模型页 https://huggingface.co/Qwen/Qwen3.8-Flash-Next · 2026 年 8 月 Qwen 团队技术报告 · 21 个社区量化仓库检索 "Qwen3.8-Flash-Next" GGUF · HF 讨论区 4 个微调衍生模型