千问宣布:今天我们正式发布语音合成大模型 Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。