macOS 听写工具 superwhisper 开源的语音后处理小模型:基于 Qwen3-0.6B 微调,专职把 ASR 原始输出变成"能直接发出去"的文字——去填充词、加标点、纠正口误、数字日期口语化,笔记本 CPU 即可运行。核心能力围绕参数、底座、三轴控制线展开。听写管线是垂类小模型的完美用例:它不做通用生成、不抢大模型饭碗,只把"最后十厘米"的文本规范化做到极致(7519 条留出集上 94.8% token 准确率)。

| 项目 | 内容 |
|---|---|
| HF 地址 | https://huggingface.co/superwhisper/s1-mini |
| 类型 | 因果语言模型(0.6B 级文本规范化器,非 ASR 本体) |
| trendingScore | 244 |
| 许可证 | Apache-2.0(附加条款:须保留 "S1-mini"/"Superwhisper" 名称精确大小写) |
| 榜单 | HuggingFace 热榜第 11 名 |
macOS 听写工具 superwhisper 开源的语音后处理小模型:基于 Qwen3-0.6B 微调,专职把 ASR 原始输出变成"能直接发出去"的文字——去填充词、加标点、纠正口误、数字日期口语化,笔记本 CPU 即可运行。
听写管线是垂类小模型的完美用例:它不做通用生成、不抢大模型饭碗,只把"最后十厘米"的文本规范化做到极致(7519 条留出集上 94.8% token 准确率)。知名付费产品反哺开源权重带来的信任加持、Apache-2.0 的商用友好度、以及 GGUF 后 462MB 可跑在任何电脑上的低门槛,共同把这个 596M 小模型顶上了热榜。(数据为采集时点信息)
Transformers ≥ 4.51.0:
messages = [
{"role": "system", "content": SYSTEM}, # 官方系统提示词必须原样保留
{"role": "user", "content":
"[Styling: semi-formal] [Structure: prose] [Context: general]\n"
+ raw_transcript},
]
text = tok.apply_chat_template(messages, tokenize=False,
add_generation_prompt=True,
enable_thinking=False) # 必须!
inputs = tok(text, return_tensors="pt").to(model.device)
out = model.generate(**inputs, do_sample=False) # 建议 greedy
两大必知坑:① 必须设 `enable_thinking=False`,否则常输出空白 `
定位为毫秒级响应的本地组件:Q4_K_M 在笔记本 CPU 上即可实时跟读;端侧 App 内嵌推荐 llama.cpp 绑定;服务化场景用 vLLM 池化多路听写流。云端部署意义不大——与其走网络不如直接选更大模型;多语言需求需另配 ASR 与其他后处理器,s1-mini 只覆盖英文环节。
听写类 App / 会议纪要产品的开箱即用润色层;ASR 直出字幕的自动排版(Whisper 后接 s1-mini);无障碍辅助沟通工具;客服通话记录的快速可读化。
对比 Whisper 自带的标点能力:s1-mini 增加 ITN、去填充词与文风控制,且可与任意 ASR 解耦组合;对比直接调 GPT 级模型做润色:小 100 倍的体积换取本地隐私与零成本;对比 distil-whisper 等 ASR 压缩路线:分工不同——一个负责听清、一个负责写对,二者天然互补而非竞争。
模型页 https://huggingface.co/superwhisper/s1-mini · 官方 GGUF 仓库 · WebGPU 网页演示 Space(3 个关联 Spaces)· superwhisper.com 与 Discord 社区