Audio8 团队的 TTS 预览检查点,口号是 "The smallest zero-shot TTS worth running"——用不到 0.2B 参数实现参考音频零样本克隆与直接合成的小型语音合成模型。CPU 可跑的零样本 TTS 是稀缺生态位:8 月 19 日创建、25 日仍在高频更新,月下载 4,257 次、172 点赞,配合 ONNX INT8 CPU 版的话题热度,以热榜末席杀入 L4 名单;在语音圈普遍堆参数做大的当下,反其道把模型做小反而引发关注。

| 项目 | 内容 |
|---|---|
| HuggingFace 地址 | https://huggingface.co/Audio8/Audio8-TTS-Preview-0.1b |
| 类型 | Model(零样本 TTS 文本转语音) |
| 热度分 trendingScore | 147(截至 2026-08-26) |
| 许可证 | Audio8 Community License v1.0(自定义社区许可) |
| 榜单 | HuggingFace 热榜 第22名 |
Audio8 团队的 TTS 预览检查点,口号是 "The smallest zero-shot TTS worth running"——用不到 0.2B 参数实现参考音频零样本克隆与直接合成的小型语音合成模型。
CPU 可跑的零样本 TTS 是稀缺生态位:8 月 19 日创建、25 日仍在高频更新,月下载 4,257 次、172 点赞,配合 ONNX INT8 CPU 版的话题热度,以热榜末席杀入 L4 名单;在语音圈普遍堆参数做大的当下,反其道把模型做小反而引发关注。
主生成模型约 170M + 约 120M 独立编解码器解码器(Safetensors 实计 169,779,904 BF16 参数)。采用 Audio8 Falcon H1 双分支自回归架构:Slow AR 共 24 层、宽度 512、8 注意力头/2 KV 头预测语义 token;Fast AR 4 层条件于慢分支隐状态补全声学码本。10 个码本 × 4096 条目,44.1kHz 编解码器,约 21.5 帧/秒;上下文最长 2048 个打包位置。中文、英文为主推语言,德西法意日韩为实验性支持。
自定义代码模型,需 `trust_remote_code=True`:
inputs = processor(text=["你好世界"], reference_audio=["reference.wav"],
reference_text=["参考文本"], return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=512, temperature=0.7)
waveforms, lens = model.decode_audio(output.codes)
省略 `reference_audio/reference_text` 两参即为不克隆的直接合成。另提供 ONNX INT8 版本供 CPU 部署。
首选 ONNX INT8 跑 CPU乃至树莓派级设备;商用前务必确认许可条款——年收入低于 200 万美元的实体免费商用,达到或超过需另行书面授权。
对标 CosyVoice、Fish-Speech 等零样本系:Audio8 的卖点是数十倍更小的参数量与 CPU 可部署性,双分支设计让语义与音色各司其职,克隆仅需几秒参考音频与对应文本;代价是多语种成熟度与长句稳定性仍在预览阶段(0.1 Preview v4 权重)。
模型卡、GitHub 仓库 Audio8-AI/Audio8_TTS、ONNX INT8 衍生版入口。