Qwen3-TTS 1.7B 语音合成

基于 Qwen3 大模型 · 1.7B 参数 · 多语言支持 · 语音克隆

什么是 Qwen3-TTS?

Qwen3-TTS 是阿里巴巴通义千问团队开发的新一代语音合成模型,基于强大的 Qwen3 大语言模型架构,拥有 17 亿参数,能够生成高质量、自然流畅的语音。

它支持 10 种语言,内置数十种高品质音色,并支持基于 3 秒参考音频的语音克隆功能,是目前最先进的开源 TTS 模型之一。

核心特性

🌍

多语言支持

支持中文、英文、日文、韩文、法文、德文、西班牙文、葡萄牙文、俄文、意大利文共 10 种语言。

🎤

语音克隆

仅需 3 秒参考音频,即可克隆任意说话人的音色,支持 x_vector 和 ICL 两种模式。

🚀

1.7B 大模型

基于 17 亿参数的大模型架构,生成语音更加自然、流畅、富有表现力。

支持语言

🇨🇳 中文
🇺🇸 英文
🇯🇵 日文
🇰🇷 韩文
🇫🇷 法文
🇩🇪 德文
🇪🇸 西班牙文
🇵🇹 葡萄牙文
🇷🇺 俄文
🇮🇹 意大利文

应用场景

🌐 多语言内容创作

为全球化内容生成多语言版本,支持 10 种主流语言,覆盖全球主要市场。

📱 应用程序语音

为移动应用、智能设备集成高质量语音合成,提升用户体验。

🎓 在线教育

为课程内容生成多语言配音,支持不同语速和音色,满足个性化学习需求。

🎬 影视后期

为影视作品快速生成多语言配音,支持情感表达和语音克隆。

技术参数

模型大小:约 4.25GB(含语音分词器)

参数量:17 亿(1.7B)

支持语言:10 种

参考音频:3 秒即可克隆

克隆模式:x_vector(免文字)/ ICL(需文字)

推理速度:GPU 加速

使用说明

第一步:上传参考音频

上传一段 3 秒以上的清晰音频,音频中应只包含目标说话人的声音。支持 WAV、MP3 等常见格式。

第二步:选择克隆模式

免输入文字模式(x_vector):开启后无需输入参考音频的文字内容,更方便快捷,但效果可能稍差。

ICL 模式:关闭开关后需要输入参考音频中说的文字内容,克隆效果更精准。

第三步:选择语言

从下拉菜单中选择要合成的语言,支持中文、英文、日文、韩文等 10 种语言。

第四步:输入要合成的文本

在文本框中输入想要合成的文字内容。建议使用所选语言的标准标点符号。

第五步:点击生成

点击"生成语音"按钮,系统会自动处理并生成语音。完成后即可在线播放和下载。

使用技巧:

• 参考音频越清晰、越短(3-5秒),克隆速度越快

• 免输入文字模式适合快速测试,ICL 模式适合追求最佳效果

• 不同语言的合成效果可能有所差异

• 文本中的标点符号会影响语音的停顿和语调

立即体验 Qwen3-TTS