Open Source Apache-2.0 GitHub 4K+ Stars 文本转语音 TTS 12Hz 语音编码 10 种语言 97ms 首包延迟

Qwen3-TTS

Qwen3-TTS(qwen3tts)是阿里通义实验室开源的多模态文本转语音(TTS)模型, 基于 12Hz 离散语音编码与 Dual-Track 混合架构,支持声音克隆、音色控制与音色创造, 多项评测指标达到 SOTA。

在线使用 → GitHub 主页
1.7B / 0.6B
Qwen3-TTS 双版本
12Hz
Qwen3-TTS 离散语音编码
10
Qwen3-TTS 支持语言
97ms
Qwen3-TTS 首包延迟
Qwen3-TTS · Overview

Qwen3-TTS 模型概述

Qwen3-TTS(qwen3tts)是通义实验室 Qwen 系列在语音方向的开源文本转语音模型,采用 12Hz 离散语音 tokenizer 直接对语音建模,并基于 Dual-Track 混合流式架构,单模型同时支持流式与非流式生成, 端到端首包延迟低至 97ms。模型基于 500 万小时以上语音数据训练,覆盖中文、英文、 日文、韩文等 10 种语言。

Qwen3-TTS 提供三类核心能力:声音克隆(3 秒参考音频克隆音色)、 音色控制(9 个预训练音色 + 情感 / 语速 / 语气调控)、 音色创造(自然语言描述生成全新音色)。 Qwen3-TTS 提供 1.7B 与 0.6B 两个版本,均以 Apache-2.0 协议开源,可商用。

Qwen3-TTS 支持语言(10 种) 中文 zh English en 日本語 ja 한국어 ko Español es Deutsch de Français fr Русский ru Português pt Italiano it
Qwen3-TTS · Architecture

Qwen3-TTS 技术架构

Qwen3-TTS 基于自研 12Hz 离散语音 Tokenizer 与离散多码本语言模型(Multi-Codebook LM)的端到端架构,自回归 + 扩散双轨并行,单模型同时支持流式与非流式生成。

Dual-Track 混合流式架构 Text 文本 输入文本 Reference Audio 3 秒参考音频 Qwen3-TTS LLM 主干 Multi-Codebook LM 自回归流(AR Track) 音色 / 情感 / 韵律指令 统一建模 12Hz Tokenizer 扩散解码(Diffusion) 粗 → 细粒度重建 16 码本 × 2048 PESQ 3.21 波形输出 24 kHz 语音 文本语义 音色条件 粗粒度 Token 细粒度重建 流式:首个字输入即输出音频首包,端到端延迟 97 ms · 非流式:完整合成后一次性返回 训练数据:500 万小时以上语音 · 覆盖 10 种语言
Tokenizer

Qwen3-TTS 12Hz Tokenizer

自研 Qwen3-TTS-Tokenizer-12Hz:16 码本 × 2048 词汇,12.5 FPS 帧率,PESQ 3.21 / STOI 0.96,语义与声学信息同时保留。

Backbone

Qwen3-TTS Multi-Codebook LM

Qwen3-TTS 的离散多码本语言模型主干,将文本与语音统一为 Token 序列联合建模,实现全信息端到端生成,无需外接声码器链路。

Streaming

Qwen3-TTS Dual-Track 流式

自回归 + 扩散双轨架构,单模型兼容流式与非流式两种模式,首个字输入即可输出音频首包,端到端延迟 97 ms。

Control

Qwen3-TTS 指令驱动

自然语言指令直接控制情感、语速、语气、韵律等多维声学属性;参考音频提供音色条件,支持零样本克隆。

Qwen3-TTS 语音 Tokenizer 学术对比 NQ Codebook Size FPS PESQ_WB PESQ_NB STOI UTMOS SIM
SpeechTokenizer81024502.603.050.923.900.85
X-codec21024502.683.270.864.110.84
X-codec 2165536502.433.040.924.130.82
XY-Tokenizer8102412.52.413.000.913.980.83
Mimi16204812.52.883.420.943.870.87
FireredTTS 2 Tokenizer16204812.52.733.280.943.880.87
Qwen3-TTS-Tokenizer-12Hz16204812.53.213.680.964.160.95

来源:Qwen3-TTS GitHub 官方 README · Tokenizer 学术对比(LibriSpeech test-clean)· Qwen3-TTS 全指标最优

Qwen3-TTS · Capabilities

Qwen3-TTS 核心能力

🎙️

Qwen3-TTS 声音克隆

3 秒参考音频即可克隆目标音色,10 语种平均词错率 1.835%,说话人相似度 0.789,优于 MiniMax 与 ElevenLabs。

🎛️

Qwen3-TTS 音色控制

9 个高质量预训练音色,支持情感、音量、语速、语气调控;自然语言指令驱动,InstructTTS-Eval 风格一致性 75.4 分

🎨

Qwen3-TTS 音色创造

用自然语言描述生成全新音色,支持多角色长对话;指令遵循与表现力超越 MiniMax-Voice-Design 闭源方案。

🌐

Qwen3-TTS 多语言合成

10 种语言中 6 种 WER 低于 ElevenLabs 与 MiniMax;克隆音色可跨语言输出,音色与口音保持一致。

Qwen3-TTS 低延迟流式

Dual-Track 混合架构,单模型兼容流式与非流式,首个字输入即可输出音频首包,端到端延迟 97ms

📝

Qwen3-TTS 长文本合成

连续合成 10 分钟语音,中英文词错率分别稳定在 2.36% / 2.81%,适用于有声书与长解说场景。

Qwen3-TTS · Benchmarks

Qwen3-TTS 评测与榜单表现

Qwen3-TTS 的以下数据来自官方技术评测(Seed-tts-eval、TTS multilingual test set、InstructTTS-Eval、LibriSpeech test-clean)。

1.835%
Qwen3-TTS 10 语种平均词错率
音色克隆 · 超越 MiniMax / ElevenLabs
0.789
Qwen3-TTS 说话人相似度
高于 MiniMax 0.748 · ElevenLabs 0.646
97ms
Qwen3-TTS 流式首包延迟
流式生成端到端延迟
5M+
Qwen3-TTS 训练语音小时数
开源 TTS 模型最高量级
Qwen3-TTS 说话人相似度(10 语种平均)
Qwen3-TTS-12Hz-1.7B0.789
MiniMax-Speech0.748
ElevenLabs Multilingual v20.646
来源:TTS multilingual test set
Qwen3-TTS 音色克隆 WER(Seed-tts-eval)
Qwen3-TTS-1.7B-Base中文 0.77% · 英文 1.24%
CosyVoice 3中文 0.71% · 英文 1.45%
MiniMax-Speech中文 0.83% · 英文 1.65%
F5-TTS中文 1.56% · 英文 1.83%
来源:Seed-TTS Test Set
Qwen3-TTS 内容一致性(Content Consistency, ↓ 越低越好)— TTS Zero-Shot Test
Qwen3-TTS Qwen2.5-Omni Seed-TTS Min… GPT-4o-Audio-Preview*
Qwen3-TTS Content Consistency (↓) - TTS Zero-Shot Test 0 1 2 3 1.05 1.42 1.00 0.99 2.30 Test-zh 1.53 2.33 1.94 1.90 2.68 Test-en * Tested on seed-tts-eval test set. * GPT-4o-Audio-Preview is tested with Ballad voice in August 2025.
来源:Seed-tts-eval · 数值越低代表内容保真度越高;Qwen3-TTS 在 Test-en 上达到 SOTA。

此外,Qwen3-TTS 在音色创造任务中指令遵循与表现力超越 MiniMax-Voice-Design(InstructTTS-Eval);跨语种音色克隆超越 CosyVoice3,达到 SOTA; 语音 Tokenizer 在 LibriSpeech test-clean 上 PESQ 3.21 / 3.68、STOI 0.96、UTMOS 4.16、说话人相似度 0.95。

Qwen3-TTS · Model Card

Qwen3-TTS 技术规格与参数

模型版本Qwen3-TTS-12Hz-1.7B / Qwen3-TTS-12Hz-0.6B(Base / CustomVoice / VoiceDesign 变体)
参数量1.7B / 0.6B
模型体积约 4.5 GB / 约 2.5 GB
语音编码12Hz 离散语音 Tokenizer(PESQ 3.21 / STOI 0.96 / UTMOS 4.16)
推理显存6–8 GB(1.7B)/ 4–6 GB(0.6B)
支持语言10 种:中文、英文、日文、韩文、西班牙文、德文、法文、俄文、葡萄牙文、意大利文
声音克隆3 秒参考音频起步
音色控制9 个预训练音色 · 自然语言指令(情感 / 语速 / 语气 / 韵律)
延迟首包 97ms(流式)
硬件要求NVIDIA GPU(CUDA),不支持 AMD / Apple Silicon
许可证Apache-2.0(可商用)
Qwen3-TTS · Version Comparison

Qwen3-TTS 1.7B 与 0.6B 版本对比

项目 1.7B 推荐 0.6B(轻量)
模型体积约 4.5 GB约 2.5 GB
推理显存6–8 GB4–6 GB
音质优秀良好
情感指令跟随稳定不稳定
长文本稳定性稳定(10 分钟连续合成)约 2 分钟后质量下降
克隆保真度更高尚可
适用场景生产级合成短片段、原型验证
Qwen3-TTS · Paper & Citation

Qwen3-TTS 论文与引用

Qwen3-TTS 技术报告已发布于 arXiv。若此工作对您的研究有帮助,欢迎引用。

技术报告

Qwen3-TTS Technical Report · arXiv:2601.15621 · 2026 年 1 月

论文作者(16 人):Hangrui Hu · Xinfa Zhu · Ting He · Dake Guo · Bin Zhang · Xiong Wang 等,通义实验室 Qwen 团队。

BibTeX

引用格式(官方 README 提供):

@article{Qwen3-TTS,
  title={Qwen3-TTS Technical Report},
  author={Hangrui Hu and Xinfa Zhu and Ting He
    and Dake Guo and Bin Zhang and Xiong Wang
    and Zhifang Guo and Ziyue Jiang and Hongkun Hao
    and Zishan Guo and Xinyu Zhang and Pei Zhang
    and Baosong Yang and Jin Xu and Jingren Zhou
    and Junyang Lin},
  journal={arXiv preprint arXiv:2601.15621},
  year={2026}
}
Qwen3-TTS · Resources

Qwen3-TTS 资源与下载

🌐

在线使用 Qwen3-TTS

无需 GPU 与本地部署,浏览器直接调用 Qwen3-TTS 进行声音克隆、音色控制与多语言合成。

免部署 · 浏览器即用

Qwen3-TTS GitHub 官方仓库

源码、模型下载、推理 Demo、部署文档与微调脚本,GitHub 4K+ Stars。

github.com/QwenLM/Qwen3-TTS
📦

Qwen3-TTS Windows 一键整合包

社区整合包:内置 Python 环境与模型权重,解压即用,免配置环境变量,双击启动 WebUI。

社区维护 · Windows 10/11 · NVIDIA GPU
🤗

Qwen3-TTS 模型权重

全部模型变体权重开源,国内用户推荐通过 ModelScope 下载,速度更快。

1.7B / 0.6B · Base / CustomVoice / VoiceDesign
🧪

Qwen3-TTS 官方在线 Demo

通义官方部署的浏览器试用空间,可体验声音克隆、音色创造与多语言合成。

Hugging Face Space / ModelScope Studio
📖

Qwen3-TTS 文档与 API

官方技术博客、模型说明与云端 API 文档,支持 vLLM-Omni 服务化部署。

Qwen Blog / DashScope API
Qwen3-TTS · FAQ

Qwen3-TTS 常见问题

Qwen3-TTS 是什么?
Qwen3-TTS 是阿里通义实验室 Qwen 团队开源的多模态文本转语音(TTS)模型,基于 12Hz 离散语音编码与 Multi-Codebook LM 架构,支持声音克隆、音色控制与音色创造,提供 1.7B 与 0.6B 两个版本,采用 Apache-2.0 协议开源。
Qwen3-TTS 怎么在线使用?
无需 GPU 与本地部署,通过在线服务即可直接使用 Qwen3-TTS 完成声音克隆、音色控制与多语言语音合成;也可以从 GitHub 获取源码自行部署,或使用社区 Windows 一键整合包本地运行。
Qwen3-TTS 支持哪些语言?
Qwen3-TTS 支持 10 种语言:中文、英文、日文、韩文、西班牙文、德文、法文、俄文、葡萄牙文、意大利文。
Qwen3-TTS 支持声音克隆吗?
支持。Qwen3-TTS 提供 3 秒参考音频克隆音色的能力,10 语种平均词错率 1.835%,说话人相似度 0.789,优于 MiniMax 与 ElevenLabs。
Qwen3-TTS 开源吗?可以商用吗?
Qwen3-TTS 采用 Apache-2.0 许可证完全开源,可商用。模型权重发布于 Hugging Face 与 ModelScope。
Qwen3-TTS 本地部署需要什么配置?
Qwen3-TTS 需要 NVIDIA GPU(CUDA),不支持 AMD 与 Apple Silicon。1.7B 版推理显存约 6–8 GB,0.6B 版约 4–6 GB。
Qwen3-TTS 与 CosyVoice 有什么区别?
两者都是开源语音合成模型。Qwen3-TTS 采用 12Hz 离散语音 Tokenizer 与 Multi-Codebook LM 的端到端架构,在音色克隆 WER、说话人相似度等公开评测指标上领先;CosyVoice 3 采用另一套流式架构,可参考双方公开评测数据对比。
Qwen3-TTS 的延迟是多少?
Qwen3-TTS 流式生成首包延迟 97ms。基于 Dual-Track 混合流式架构,单模型同时支持流式与非流式生成。