基于 Qwen3 大模型 · 1.7B 参数 · 多语言支持 · 语音克隆
Qwen3-TTS 是阿里巴巴通义千问团队开发的新一代语音合成模型,基于强大的 Qwen3 大语言模型架构,拥有 17 亿参数,能够生成高质量、自然流畅的语音。
它支持 10 种语言,内置数十种高品质音色,并支持基于 3 秒参考音频的语音克隆功能,是目前最先进的开源 TTS 模型之一。
支持中文、英文、日文、韩文、法文、德文、西班牙文、葡萄牙文、俄文、意大利文共 10 种语言。
仅需 3 秒参考音频,即可克隆任意说话人的音色,支持 x_vector 和 ICL 两种模式。
基于 17 亿参数的大模型架构,生成语音更加自然、流畅、富有表现力。
为全球化内容生成多语言版本,支持 10 种主流语言,覆盖全球主要市场。
为移动应用、智能设备集成高质量语音合成,提升用户体验。
为课程内容生成多语言配音,支持不同语速和音色,满足个性化学习需求。
为影视作品快速生成多语言配音,支持情感表达和语音克隆。
模型大小:约 4.25GB(含语音分词器)
参数量:17 亿(1.7B)
支持语言:10 种
参考音频:3 秒即可克隆
克隆模式:x_vector(免文字)/ ICL(需文字)
推理速度:GPU 加速
第一步:上传参考音频
上传一段 3 秒以上的清晰音频,音频中应只包含目标说话人的声音。支持 WAV、MP3 等常见格式。
第二步:选择克隆模式
• 免输入文字模式(x_vector):开启后无需输入参考音频的文字内容,更方便快捷,但效果可能稍差。
• ICL 模式:关闭开关后需要输入参考音频中说的文字内容,克隆效果更精准。
第三步:选择语言
从下拉菜单中选择要合成的语言,支持中文、英文、日文、韩文等 10 种语言。
第四步:输入要合成的文本
在文本框中输入想要合成的文字内容。建议使用所选语言的标准标点符号。
第五步:点击生成
点击"生成语音"按钮,系统会自动处理并生成语音。完成后即可在线播放和下载。
使用技巧:
• 参考音频越清晰、越短(3-5秒),克隆速度越快
• 免输入文字模式适合快速测试,ICL 模式适合追求最佳效果
• 不同语言的合成效果可能有所差异
• 文本中的标点符号会影响语音的停顿和语调