首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

Audio8/Audio8-TTS-Preview-0.1b

Audio8 团队的 TTS 预览检查点,口号是 "The smallest zero-shot TTS worth running"——用不到 0.2B 参数实现参考音频零样本克隆与直接合成的小型语音合成模型。CPU 可跑的零样本 TTS 是稀缺生态位:8 月 19 日创建、25 日仍在高频更新,月下载 4,257 次、172 点赞,配合 ONNX INT8 CPU 版的话题热度,以热榜末席杀入 L4 名单;在语音圈普遍堆参数做大的当下,反其道把模型做小反而引发关注。

类型
Model
热度分
147
下载量
4,257
Likes
172
许可证
未标注
在 HuggingFace 打开 回到总表

配图

信息卡

项目内容
HuggingFace 地址https://huggingface.co/Audio8/Audio8-TTS-Preview-0.1b
类型Model(零样本 TTS 文本转语音)
热度分 trendingScore147(截至 2026-08-26)
许可证Audio8 Community License v1.0(自定义社区许可)
榜单HuggingFace 热榜 第22名

一句话定位

Audio8 团队的 TTS 预览检查点,口号是 "The smallest zero-shot TTS worth running"——用不到 0.2B 参数实现参考音频零样本克隆与直接合成的小型语音合成模型。

为什么上热度榜

CPU 可跑的零样本 TTS 是稀缺生态位:8 月 19 日创建、25 日仍在高频更新,月下载 4,257 次、172 点赞,配合 ONNX INT8 CPU 版的话题热度,以热榜末席杀入 L4 名单;在语音圈普遍堆参数做大的当下,反其道把模型做小反而引发关注。

规格与技术亮点

主生成模型约 170M + 约 120M 独立编解码器解码器(Safetensors 实计 169,779,904 BF16 参数)。采用 Audio8 Falcon H1 双分支自回归架构:Slow AR 共 24 层、宽度 512、8 注意力头/2 KV 头预测语义 token;Fast AR 4 层条件于慢分支隐状态补全声学码本。10 个码本 × 4096 条目,44.1kHz 编解码器,约 21.5 帧/秒;上下文最长 2048 个打包位置。中文、英文为主推语言,德西法意日韩为实验性支持。

使用方式与代码示例

自定义代码模型,需 `trust_remote_code=True`:

inputs = processor(text=["你好世界"], reference_audio=["reference.wav"],
                   reference_text=["参考文本"], return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=512, temperature=0.7)
waveforms, lens = model.decode_audio(output.codes)

省略 `reference_audio/reference_text` 两参即为不克隆的直接合成。另提供 ONNX INT8 版本供 CPU 部署。

部署建议(本地/云端/量化选择)

首选 ONNX INT8 跑 CPU乃至树莓派级设备;商用前务必确认许可条款——年收入低于 200 万美元的实体免费商用,达到或超过需另行书面授权。

典型应用场景

同类对比

对标 CosyVoice、Fish-Speech 等零样本系:Audio8 的卖点是数十倍更小的参数量与 CPU 可部署性,双分支设计让语义与音色各司其职,克隆仅需几秒参考音频与对应文本;代价是多语种成熟度与长句稳定性仍在预览阶段(0.1 Preview v4 权重)。

资源导航

模型卡、GitHub 仓库 Audio8-AI/Audio8_TTS、ONNX INT8 衍生版入口。

← 上一篇deepseek-ai/DeepSeek-V4-Flash-0731下一篇 →DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF