Z.ai(智谱)GLM-5 系列的 Flash 高效版:320B 总参仅激活 18B、首次引入混合注意力与 mHC 的全新基座,官方宣称性能超越 GLM-5.2 而价格只有十分之一,编程与 Agent 能力逼近 Claude Opus 4.8。核心能力围绕稀疏度、架构、多模态展开。

| 项目 | 内容 |
|---|---|
| HF 地址 | https://huggingface.co/zai-org/GLM-5.3-Flash |
| 类型 | MoE 多模态因果语言模型(image-text-to-text) |
| trendingScore | 477 |
| 许可证 | MIT |
| 榜单 | HuggingFace 热榜第 6 名 |
Z.ai(智谱)GLM-5 系列的 Flash 高效版:320B 总参仅激活 18B、首次引入混合注意力与 mHC 的全新基座,官方宣称性能超越 GLM-5.2 而价格只有十分之一,编程与 Agent 能力逼近 Claude Opus 4.8。
"低价不低能"是 2026 年 API 市场最硬的通货:Terminal-Bench 2.1 拿到 84.3、DeepSWE 63.4、HLE(带工具) 55.3 的成绩以 MIT 许可完全开源,企业可自部署亦可走 Z.ai API,双向自由度罕见;GLM 系在中文社区的既有号召力叠加 HF Inference Providers 已上线 tool calling 的即用性,热度自然走高。(数据为采集时点信息)
vLLM 两行起服:
pip install vllm
vllm serve "zai-org/GLM-5.3-Flash"
Transformers 用 `AutoModelForMultimodalLM` + `AutoProcessor`;亦支持 SGLang、TokenSpeed、KTransformers 与 Docker Model Runner。已有 5 个量化版本适配 llama.cpp/Ollama/LM Studio/Jan。在线侧:Z.ai API 官方平台、HF Inference Providers(live、支持 tool calling,实测约 36 tokens/s)、HuggingChat。技术报告见 arXiv 2602.15763《GLM-5: from Vibe Coding to Agentic Engineering》。
18B 激活显著降低推理算力需求,但总权重仍需多卡承载:全量建议 4×80GB 起(FP8 权重更省);预算有限选社区 GGUF 低比特量化配合 llama.cpp 可在工作站级硬件体验;中小企业首选 Z.ai API 或 HF 托管,零运维获得接近 Claude Opus 4.8 的编码能力;自部署生产推荐 vLLM/SGLang + FP8。
高并发代码助手与 CI 内自动修复(性价比主打场景);长仓库级代码理解与重构(NL2Repo 式任务);中文为主的 Agent 工作流编排与工具调用;多模态工单/文档审阅机器人。
对比 Qwen3.8-Flash-Next(125B/6B):GLM 激活更大、基准更全面,Qwen 更偏效率实验;对比 DeepSeek V4 Flash:同为国内开源 agentic 主力,GLM 的 MIT 许可与 Flash 定价策略对商用更友好;对标闭源 Claude Opus 4.8 则以一折价格提供近似编码表现——差距请随版本迭代复核。
模型页 https://huggingface.co/zai-org/GLM-5.3-Flash · 技术报告 arXiv 2602.15763 · Z.ai API 平台 · vLLM/SGLang 快速命令见模型卡