Qwen3.8 家族中的"紧凑部署款":27B 全参稠密(非 MoE)、线性+全注意力混合、原生视觉与小视频理解,Apache-2.0 完全开放——企业私有化部署 Qwen3.8 能力时的默认答案。核心能力围绕参数、混合注意力、上下文展开。3.8 系列 2026 年 8 月集中发布形成话题共振,本型号以 Apache-2.0 + 单机可跑的组合承接了最大体量的落地需求;

| 项目 | 内容 |
|---|---|
| HF 地址 | https://huggingface.co/Qwen/Qwen3.8-27B |
| 类型 | 稠密多模态因果语言模型(image-text-to-text) |
| trendingScore | 1115 |
| 许可证 | Apache-2.0 |
| 榜单 | HuggingFace 热榜第 2 名 |
Qwen3.8 家族中的"紧凑部署款":27B 全参稠密(非 MoE)、线性+全注意力混合、原生视觉与小视频理解,Apache-2.0 完全开放——企业私有化部署 Qwen3.8 能力时的默认答案。
3.8 系列 2026 年 8 月集中发布形成话题共振,本型号以 Apache-2.0 + 单机可跑的组合承接了最大体量的落地需求;Agent 类基准亮眼(Terminal Bench 2.1 达 73.0、OSWorld-Verified 84.3),恰好踩中 agentic 应用元年对"小而能干"基座模型的饥渴;FP8 官方版与大量第三方量化同步出现,进一步推高下载与热度。
Transformers:`pipeline("image-text-to-text")` 或 `AutoModelForMultimodalLM` + `AutoProcessor` 加载;vLLM/SGLang 一行起服:
vllm serve Qwen/Qwen3.8-27B
随后经 OpenAI 兼容 API 支持文本、图像、视频输入及思考模式切换。官方另发布 FP8 版(Qwen/Qwen3.8-27B-FP8);featherless-ai、deepinfra 提供第三方托管。采样参考同家族规范:思考模式 temperature=1.0/top_p=0.95/top_k=20,非思考 temperature=0.7/top_p=0.80/presence_penalty=1.5。(以上为采集时点页面信息)
BF16 全量约 56GB 显存,单张 80GB A100/H100 或双 48GB 卡即可舒适运行,是企业级的甜点位;显存紧张时优先官方 FP8;本地体验走 llama.cpp/Ollama/LM Studio 的 GGUF 量化版(macOS 大内存机型可承担中低量化档位);并发生产环境用 vLLM 开前缀缓存。云端已有 deepinfra 等即取即用选项。
企业内网私有化多模态助手(合同/图纸/截图理解);编码 Agent 与终端自动化(Terminal Bench 强项);长文档审阅与合规审查;小时级视频内容解析与摘要管线。
对比 Qwen3.8-Flash-Next:27B 是稠密确定性方案,部署简单、行为可控,代价是每 token 计算量更大;对比 Gemma 4 同级稠密模型:本模型在 agentic 编码基准上普遍占优且上下文更长;对比旧代 Qwen3-30B-A3B MoE:新架构以更少层数实现更高推理密度。横向排名请以最新榜单为准。
模型页 https://huggingface.co/Qwen/Qwen3.8-27B · FP8 官方仓 Qwen/Qwen3.8-27B-FP8 · vLLM/SGLang 部署文档见模型卡 · Ollama/LM Studio 社区 GGUF 检索同名关键词