基于 Qwen3-TTS-Base 基座结合高质量直播领域数据继续训练,此模型在 Zero-shot 和 SFT 推理效果上更符合直播风格的表达节奏与情绪张力。下面对比同一文本下基座模型与 TBLive 领域模型的合成效果。全部音频与文本随仓库一起开源,打开页面即可试听。
三种典型直播话术风格 · 两个开源 TTS 基线 · 一个闭源商业 TTS · Qwen3-TTS 基座 vs Qwen3-TTS-TBLive 领域模型(Zero-shot & Custom-voice)
在文本中嵌入轻量控制标签,即可精准调节停顿节奏与语速快慢,让直播口播更有张力
Qwen3-TTS-TBLive 语音驱动数字人 · 三种直播风格 · 一男两女 · 竖屏直播场景