Qwen3-TTS 模型概述
Qwen3-TTS(qwen3tts)是通义实验室 Qwen 系列在语音方向的开源文本转语音模型,采用 12Hz 离散语音 tokenizer 直接对语音建模,并基于 Dual-Track 混合流式架构,单模型同时支持流式与非流式生成, 端到端首包延迟低至 97ms。模型基于 500 万小时以上语音数据训练,覆盖中文、英文、 日文、韩文等 10 种语言。
Qwen3-TTS 提供三类核心能力:声音克隆(3 秒参考音频克隆音色)、 音色控制(9 个预训练音色 + 情感 / 语速 / 语气调控)、 音色创造(自然语言描述生成全新音色)。 Qwen3-TTS 提供 1.7B 与 0.6B 两个版本,均以 Apache-2.0 协议开源,可商用。
Qwen3-TTS 技术架构
Qwen3-TTS 基于自研 12Hz 离散语音 Tokenizer 与离散多码本语言模型(Multi-Codebook LM)的端到端架构,自回归 + 扩散双轨并行,单模型同时支持流式与非流式生成。
Qwen3-TTS 12Hz Tokenizer
自研 Qwen3-TTS-Tokenizer-12Hz:16 码本 × 2048 词汇,12.5 FPS 帧率,PESQ 3.21 / STOI 0.96,语义与声学信息同时保留。
Qwen3-TTS Multi-Codebook LM
Qwen3-TTS 的离散多码本语言模型主干,将文本与语音统一为 Token 序列联合建模,实现全信息端到端生成,无需外接声码器链路。
Qwen3-TTS Dual-Track 流式
自回归 + 扩散双轨架构,单模型兼容流式与非流式两种模式,首个字输入即可输出音频首包,端到端延迟 97 ms。
Qwen3-TTS 指令驱动
自然语言指令直接控制情感、语速、语气、韵律等多维声学属性;参考音频提供音色条件,支持零样本克隆。
| Qwen3-TTS 语音 Tokenizer 学术对比 | NQ | Codebook Size | FPS | PESQ_WB | PESQ_NB | STOI | UTMOS | SIM |
|---|---|---|---|---|---|---|---|---|
| SpeechTokenizer | 8 | 1024 | 50 | 2.60 | 3.05 | 0.92 | 3.90 | 0.85 |
| X-codec | 2 | 1024 | 50 | 2.68 | 3.27 | 0.86 | 4.11 | 0.84 |
| X-codec 2 | 1 | 65536 | 50 | 2.43 | 3.04 | 0.92 | 4.13 | 0.82 |
| XY-Tokenizer | 8 | 1024 | 12.5 | 2.41 | 3.00 | 0.91 | 3.98 | 0.83 |
| Mimi | 16 | 2048 | 12.5 | 2.88 | 3.42 | 0.94 | 3.87 | 0.87 |
| FireredTTS 2 Tokenizer | 16 | 2048 | 12.5 | 2.73 | 3.28 | 0.94 | 3.88 | 0.87 |
| Qwen3-TTS-Tokenizer-12Hz | 16 | 2048 | 12.5 | 3.21 | 3.68 | 0.96 | 4.16 | 0.95 |
来源:Qwen3-TTS GitHub 官方 README · Tokenizer 学术对比(LibriSpeech test-clean)· Qwen3-TTS 全指标最优
Qwen3-TTS 核心能力
Qwen3-TTS 声音克隆
3 秒参考音频即可克隆目标音色,10 语种平均词错率 1.835%,说话人相似度 0.789,优于 MiniMax 与 ElevenLabs。
Qwen3-TTS 音色控制
9 个高质量预训练音色,支持情感、音量、语速、语气调控;自然语言指令驱动,InstructTTS-Eval 风格一致性 75.4 分。
Qwen3-TTS 音色创造
用自然语言描述生成全新音色,支持多角色长对话;指令遵循与表现力超越 MiniMax-Voice-Design 闭源方案。
Qwen3-TTS 多语言合成
10 种语言中 6 种 WER 低于 ElevenLabs 与 MiniMax;克隆音色可跨语言输出,音色与口音保持一致。
Qwen3-TTS 低延迟流式
Dual-Track 混合架构,单模型兼容流式与非流式,首个字输入即可输出音频首包,端到端延迟 97ms。
Qwen3-TTS 长文本合成
连续合成 10 分钟语音,中英文词错率分别稳定在 2.36% / 2.81%,适用于有声书与长解说场景。
Qwen3-TTS 评测与榜单表现
Qwen3-TTS 的以下数据来自官方技术评测(Seed-tts-eval、TTS multilingual test set、InstructTTS-Eval、LibriSpeech test-clean)。
| Qwen3-TTS-12Hz-1.7B | 0.789 |
| MiniMax-Speech | 0.748 |
| ElevenLabs Multilingual v2 | 0.646 |
| Qwen3-TTS-1.7B-Base | 中文 0.77% · 英文 1.24% |
| CosyVoice 3 | 中文 0.71% · 英文 1.45% |
| MiniMax-Speech | 中文 0.83% · 英文 1.65% |
| F5-TTS | 中文 1.56% · 英文 1.83% |
此外,Qwen3-TTS 在音色创造任务中指令遵循与表现力超越 MiniMax-Voice-Design(InstructTTS-Eval);跨语种音色克隆超越 CosyVoice3,达到 SOTA; 语音 Tokenizer 在 LibriSpeech test-clean 上 PESQ 3.21 / 3.68、STOI 0.96、UTMOS 4.16、说话人相似度 0.95。
Qwen3-TTS 技术规格与参数
| 模型版本 | Qwen3-TTS-12Hz-1.7B / Qwen3-TTS-12Hz-0.6B(Base / CustomVoice / VoiceDesign 变体) |
|---|---|
| 参数量 | 1.7B / 0.6B |
| 模型体积 | 约 4.5 GB / 约 2.5 GB |
| 语音编码 | 12Hz 离散语音 Tokenizer(PESQ 3.21 / STOI 0.96 / UTMOS 4.16) |
| 推理显存 | 6–8 GB(1.7B)/ 4–6 GB(0.6B) |
| 支持语言 | 10 种:中文、英文、日文、韩文、西班牙文、德文、法文、俄文、葡萄牙文、意大利文 |
| 声音克隆 | 3 秒参考音频起步 |
| 音色控制 | 9 个预训练音色 · 自然语言指令(情感 / 语速 / 语气 / 韵律) |
| 延迟 | 首包 97ms(流式) |
| 硬件要求 | NVIDIA GPU(CUDA),不支持 AMD / Apple Silicon |
| 许可证 | Apache-2.0(可商用) |
Qwen3-TTS 1.7B 与 0.6B 版本对比
| 项目 | 1.7B 推荐 | 0.6B(轻量) |
|---|---|---|
| 模型体积 | 约 4.5 GB | 约 2.5 GB |
| 推理显存 | 6–8 GB | 4–6 GB |
| 音质 | 优秀 | 良好 |
| 情感指令跟随 | 稳定 | 不稳定 |
| 长文本稳定性 | 稳定(10 分钟连续合成) | 约 2 分钟后质量下降 |
| 克隆保真度 | 更高 | 尚可 |
| 适用场景 | 生产级合成 | 短片段、原型验证 |
Qwen3-TTS 论文与引用
Qwen3-TTS 技术报告已发布于 arXiv。若此工作对您的研究有帮助,欢迎引用。
技术报告
Qwen3-TTS Technical Report · arXiv:2601.15621 · 2026 年 1 月
论文作者(16 人):Hangrui Hu · Xinfa Zhu · Ting He · Dake Guo · Bin Zhang · Xiong Wang 等,通义实验室 Qwen 团队。
BibTeX
引用格式(官方 README 提供):
@article{Qwen3-TTS,
title={Qwen3-TTS Technical Report},
author={Hangrui Hu and Xinfa Zhu and Ting He
and Dake Guo and Bin Zhang and Xiong Wang
and Zhifang Guo and Ziyue Jiang and Hongkun Hao
and Zishan Guo and Xinyu Zhang and Pei Zhang
and Baosong Yang and Jin Xu and Jingren Zhou
and Junyang Lin},
journal={arXiv preprint arXiv:2601.15621},
year={2026}
}