相比前代版本,v1.5 对语言标签、多语言发音、停顿控制以及长参考音频克隆进行了重点优化,使生成语音更贴近真实人声表达。
核心功能:
零样本语音克隆:无需训练即可快速复刻目标音色
长文本语音生成:支持长篇内容连续朗读
31种语言合成:覆盖中、英、粤语及多种国际语言
代码混说(Code-Switching):支持多语言混合表达
发音精准控制:支持拼音(Pinyin)和 IPA 音标控制
Token级时长控制:精细调节发音节奏与长度
显式停顿控制:支持 [pause 3.2s] 等自定义停顿标记
版本升级亮点:
更强多语言能力:指定语言标签后,多数语言效果显著优于 1.0
更稳定的语音克隆:提升音色相似度与生成一致性
长参考音频克隆优化:更适合“长参考音频 + 短文本”场景
更自然的标点韵律:停顿与语气更符合文本结构
新增显式停顿控制:实现精确节奏设计
新增支持语言:
粤语、荷兰语、芬兰语、印地语、马其顿语、马来语、罗马尼亚语、斯瓦希里语、他加禄语、泰语、越南语等。
应用场景:
AI 数字人配音
有声书与播客制作
多语言内容本地化
AI 客服与语音助手
教育培训与语言学习
视频旁白与短剧配音
一句话总结:MOSS-TTS-v1.5 = 一款支持 31 种语言、具备高稳定语音克隆与精细韵律控制能力的开源多语言 TTS 模型。
配置要求:
操作系统:Windows 10/11 64位
内存:建议32G及以上
显卡:至少16G及以上显存的英伟达(NVIDIA)显卡
CUDA:显卡支持的CUDA版本大于等于12.8版本
📥 相关下载链接
🔒 评论后方可查看本帖下载链接,请在下方发表评论解锁下载权限