为什么需要
出海产品做多语言内容、AI 客服语音、产品演示配音时,商业 TTS API 按字符收费,成本随量增长。MOSS-TTS-Nano 只有 0.1B 参数,能在 CPU 上实时运行,开源免费,适合独立开发者自建 TTS 服务。
怎么用
bash
pip install moss-tts-nano
python
from moss_tts import MOSS_TTS
tts = MOSS_TTS.from_pretrained("openmoss/MOSS-TTS-Nano")
audio = tts.generate("Hello, welcome to our product!", language="en")
支持中英文及多语言语音合成,可进行语音克隆(提供参考音频即可模仿说话人音色)。
核心特性
- CPU 实时运行:0.1B 参数,无需 GPU,笔记本电脑即可流畅运行
- 多语言支持:中英文及多种语言语音合成,适合出海产品多语言内容制作
- 语音克隆:提供参考音频即可克隆说话人音色
- 流式输出:支持实时流式音频生成,适合对话场景
- Hugging Face / ModelScope:模型权重在两个平台均可下载
注意事项
- 免费开源(Apache-2.0 协议),可商用
- CPU 运行可行,但 GPU 推理速度更快
- 语音质量与商业 TTS(如 ElevenLabs)有差距,但对大多数场景够用
- MOSS-TTS 2.0 即将发布,正在收集用户反馈优化功能