Meta Superintelligence Lab 出品的约 29.6B 稠密多模态语言模型:由旗舰 Muse Spark 蒸馏而来,专为消费级硬件上的自主智能体任务设计,配套量化与投机解码资产一步配齐。核心能力围绕主干、视觉、DFlash草稿模型展开。两个卖点直击 Agent 落地痛点:其一,官方基准 MCP Atlas 75.5 大幅领先同级(Gemma4-31B 仅 54.2),工具调用能力可圈可点;

| 项目 | 内容 |
|---|---|
| HuggingFace 地址 | https://huggingface.co/meta-models/Muse-Glimmer-30B |
| 类型 | Model |
| 热度分 trendingScore | 81(截至 2026-08-26) |
| 许可证 | Apache-2.0(权重、4bit 量化与 DFlash 草稿头全套开放) |
| 榜单 | HuggingFace 热榜 L4 第39名 |
Meta Superintelligence Lab 出品的约 29.6B 稠密多模态语言模型:由旗舰 Muse Spark 蒸馏而来,专为消费级硬件上的自主智能体任务设计,配套量化与投机解码资产一步配齐。
两个卖点直击 Agent 落地痛点:其一,官方基准 MCP Atlas 75.5 大幅领先同级(Gemma4-31B 仅 54.2),工具调用能力可圈可点;其二,随包开源的 DFlash 块扩散草稿头让 RTX 5090 实测从 74.9 提速到 233.4 tok/s。上架两周即录得 54 万下载、1785 点赞,衍生出 32 个微调、153 个量化。
from transformers import pipeline
pipe = pipeline("image-text-to-text", model="meta-models/Muse-Glimmer-30B")
亦可 `vllm serve` / SGLang 以 OpenAI 兼容接口对外服务,或 `docker model run hf.co/meta-models/Muse-Glimmer-30B`。聊天模板实现 ATEM 工具调用协议,reasoning effort 四档(low→xhigh),推荐采样 temp=1.0、top_p=0.95、top_k=64。
官方两个 4bit K-quant 变体均低于 20GB,专吃 24/32GB 消费显卡,量化损耗实测仅 0.2%/1.0%;BF16 全量约 59.5GB 建议上 A100/H100 或双卡。云端可选 DeepInfra(输出 $1.2、约 116 tok/s)、Together、Fireworks,均已启用工具调用。叠加 DFlash 后消费卡即可获得生产级速度。
对比 Gemma4-31B 与 Qwen3.6-27B:Agent 型基准(MCP Atlas、τ3-Banking、WildClawBench)全面占优,但 OSWorld/TerminalBench 被 Qwen3.6 反超,桌面自动化仍需取舍;对比自家满血版 Muse Spark 属于便携性换深度。注意其公开基准带有社区"unverified"标记,实际选型建议自测复跑。
论文:arXiv:2504.13181(Perception Encoder)、arXiv:2602.06036(DFlash)|生态:17 个 Spaces 引用|安全报告见模型卡 Safety 章节。