← 工具

OmniVoice

支持 600+ 语言的高质量语音克隆 TTS,本地可部署,延迟低于 200ms,小语种(越南、印尼、阿拉伯)效果超 ElevenLabs,是出海产品做多语言语音交互、客服 IVR、有声书的开源首选,Stars 7K+。

#74
推荐排名
7,320
GitHub Stars
5,124
推荐得分
多语言 TTS / 语音克隆
适用场景
AI工具AI应用LLM自托管国际化Python

为什么需要

出海产品做语音功能,ElevenLabs 太贵,Azure TTS 中文稀烂,开源方案大多只支持英文。OmniVoice 是为数不多同时支持 600+ 语言、本地能跑、延迟低的 TTS 引擎,小语种(越南、印尼、阿拉伯)效果尤其突出。

怎么用

  1. 拉 Docker:docker pull k2fsa/omnivoice:latest
  2. 跑:docker run -p 8080:8080 k2fsa/omnivoice
  3. 调 API:
bash
curl -X POST http://localhost:8080/v1/tts \
  -d '{"text": "你好世界", "voice": "zh-female-1"}' \
  --output hello.wav

支持 voice cloning:传 10 秒参考音频就能复刻音色。

使用案例

东南亚有声书 App 用 OmniVoice 把中文书自动转印尼语/泰语/越南语,每本成本从 $500(人工)降到 $0.5。出海客服 SaaS 用它做 IVR,支持 12 国语言实时合成。

注意事项

  • 首次跑要下载 10GB+ 模型
  • GPU 推理比 CPU 快 10 倍
  • 商业使用遵守 Apache 2.0