千问发布Qwen-Audio-3.0-TTS,语音合成开始强调自然语言控制
千问正式发布语音合成大模型Qwen-Audio-3.0-TTS。此次发布的模型支持Free-style自然语言指令控制,并针对不同使用需求提供Flash和Plus两个版本。其中,Flash版本主要面向实时交互场景,首包延时达到300毫秒级别;Plus版本则更侧重高质量语音生成。
所谓语音合成,简单来说,就是把文字转换成可以播放的语音。过去不少语音合成工具主要依靠固定参数进行调整,例如设置语速、音量和音调。Qwen-Audio-3.0-TTS支持自然语言指令控制,意味着用户可以用更接近日常表达的方式,描述希望得到的声音效果。
例如,用户可能不再需要逐项调整复杂参数,而是直接说明希望语气更加平静、节奏更快,或者采用更适合讲解内容的表达方式。模型能否准确理解这些要求,还需要结合后续开放范围和实际体验进行判断,但这种交互方式确实降低了语音控制的使用门槛。
Flash版本强调300毫秒级首包延时,主要对应智能助手、实时对话、在线客服等对响应速度比较敏感的场景。这里的“首包延时”,指的是系统接收到请求后,开始返回第一段语音数据所需要的时间,并不等于整段语音已经全部生成完成。
Plus版本则主要面向更加关注声音质量的使用需求,例如有声内容、视频配音、课程旁白和其他需要较完整表达效果的场景。实时性和生成质量之间通常存在一定取舍,因此分别提供不同版本,有利于开发者根据业务需求选择。
不过,模型发布并不代表所有语音生成问题都已经解决。语音合成还要面对长文本语气一致性、多音字、数字和专业术语读法,以及不同场景下的情绪控制等问题。此外,在使用合成语音时,也需要注意声音授权、身份冒用和内容标识等问题,避免将生成语音用于误导他人。
Qwen-Audio-3.0-TTS的发布,反映出语音模型正在从单纯“把文字读出来”,进一步转向理解自然语言要求并控制表达方式。后续值得关注的,是两个版本的具体开放方式、支持语言、调用成本及真实场景中的稳定性。

浙公网安备 33010602011771号