首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

zai-org/GLM-5.3-Flash

Z.ai(智谱)GLM-5 系列的 Flash 高效版:320B 总参仅激活 18B、首次引入混合注意力与 mHC 的全新基座,官方宣称性能超越 GLM-5.2 而价格只有十分之一,编程与 Agent 能力逼近 Claude Opus 4.8。核心能力围绕稀疏度、架构、多模态展开。

类型
Model
热度分
477
下载量
0
Likes
485
许可证
未标注
在 HuggingFace 打开 回到总表

配图

信息卡

项目内容
HF 地址https://huggingface.co/zai-org/GLM-5.3-Flash
类型MoE 多模态因果语言模型(image-text-to-text)
trendingScore477
许可证MIT
榜单HuggingFace 热榜第 6 名

一句话定位

Z.ai(智谱)GLM-5 系列的 Flash 高效版:320B 总参仅激活 18B、首次引入混合注意力与 mHC 的全新基座,官方宣称性能超越 GLM-5.2 而价格只有十分之一,编程与 Agent 能力逼近 Claude Opus 4.8。

为什么上热度榜

"低价不低能"是 2026 年 API 市场最硬的通货:Terminal-Bench 2.1 拿到 84.3、DeepSWE 63.4、HLE(带工具) 55.3 的成绩以 MIT 许可完全开源,企业可自部署亦可走 Z.ai API,双向自由度罕见;GLM 系在中文社区的既有号召力叠加 HF Inference Providers 已上线 tool calling 的即用性,热度自然走高。(数据为采集时点信息)

模型规格与技术亮点

使用方式与代码示例

vLLM 两行起服:

pip install vllm
vllm serve "zai-org/GLM-5.3-Flash"

Transformers 用 `AutoModelForMultimodalLM` + `AutoProcessor`;亦支持 SGLang、TokenSpeed、KTransformers 与 Docker Model Runner。已有 5 个量化版本适配 llama.cpp/Ollama/LM Studio/Jan。在线侧:Z.ai API 官方平台、HF Inference Providers(live、支持 tool calling,实测约 36 tokens/s)、HuggingChat。技术报告见 arXiv 2602.15763《GLM-5: from Vibe Coding to Agentic Engineering》。

部署建议(本地/云端量化选择)

18B 激活显著降低推理算力需求,但总权重仍需多卡承载:全量建议 4×80GB 起(FP8 权重更省);预算有限选社区 GGUF 低比特量化配合 llama.cpp 可在工作站级硬件体验;中小企业首选 Z.ai API 或 HF 托管,零运维获得接近 Claude Opus 4.8 的编码能力;自部署生产推荐 vLLM/SGLang + FP8。

典型应用场景

高并发代码助手与 CI 内自动修复(性价比主打场景);长仓库级代码理解与重构(NL2Repo 式任务);中文为主的 Agent 工作流编排与工具调用;多模态工单/文档审阅机器人。

同类模型对比

对比 Qwen3.8-Flash-Next(125B/6B):GLM 激活更大、基准更全面,Qwen 更偏效率实验;对比 DeepSeek V4 Flash:同为国内开源 agentic 主力,GLM 的 MIT 许可与 Flash 定价策略对商用更友好;对标闭源 Claude Opus 4.8 则以一折价格提供近似编码表现——差距请随版本迭代复核。

资源导航

模型页 https://huggingface.co/zai-org/GLM-5.3-Flash · 技术报告 arXiv 2602.15763 · Z.ai API 平台 · vLLM/SGLang 快速命令见模型卡

← 上一篇orcarouter/Qwen3.8-27B-Uncensored-MLX下一篇 →ornith-ai/Ornith-1.5-35B-A3B