5大顶级的 AI 音频 / 声音克隆模型,建议你悄悄收藏备用!
1. MiniMax Speech / Audio —— 具有出色的中文表现能力,可支持音色克隆、长文本 TTS,适合小说、有声书、视频配音等长音频制作。
官网: minimax点io/audio
2. Qwen3-TTS —— 一款开源 TTS,具有多语言、音色克隆和语音生成等优势,可以本地部署。
GitHub地址: github点com/QwenLM/Qwen3-TTS
3. ElevenLabs —— 其自然度和情绪表现非常强,声音克隆也比较成熟,适合做有声书和剧情旁白。
官网: elevenlabs点io
4. Fish Audio —— 开源的声音克隆热门方案,在多语言、情感表现和流式生成等方面表现不错。
GitHub: github点com/fishaudio/fish-speech
5. Microsoft VibeVoice —— 开源的长音频模型,超长文本 + 多人对话,TTS 模型最高可生成约 90 分钟、支持最多 4 个说话人。
GitHub地址: github点com/microsoft/VibeVoice
有需要的朋友,快来试试吧!
