Live-Streaming Domain TTS · Open-Source Demo

基于 Qwen3-TTS 的
直播领域语音合成大模型

基于 Qwen3-TTS-Base 基座结合高质量直播领域数据继续训练,此模型在 Zero-shot 和 SFT 推理效果上更符合直播风格的表达节奏与情绪张力。下面对比同一文本下基座模型与 TBLive 领域模型的合成效果。全部音频与文本随仓库一起开源,打开页面即可试听。

01直播文案推理对比

三种典型直播话术风格 · 两个开源 TTS 基线 · 一个闭源商业 TTS · Qwen3-TTS 基座 vs Qwen3-TTS-TBLive 领域模型(Zero-shot & Custom-voice)

数据源:仓库内 · 文本 & 音频随仓库一起发布,无需外链

02主播指令控制

在文本中嵌入轻量控制标签,即可精准调节停顿节奏与语速快慢,让直播口播更有张力

03数字人直播视频

Qwen3-TTS-TBLive 语音驱动数字人 · 三种直播风格 · 一男两女 · 竖屏直播场景

视频源:仓库内 · 全部为 9:16 竖屏 H.264 mp4,随仓库一起发布