AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单
摘要
阿里发布Qwen-Audio-3.0-TTS模型,在权威语音合成榜单中登顶,支持细粒度标签控制和20种方言,标志着AI语音进入可精细调控的“表演时代”。
核心要点
- 在ChatTTS、CosyVoice等主流模型中排名第一,综合评分最高
- 支持通过细粒度标签控制语气、情感、语速等参数
- 覆盖20种中国方言,包括粤语、吴语、闽南语等
- 模型已开源,可在Hugging Face等平台获取
- 提供API和本地部署两种使用方式
AI 洞察
这一突破意味着AI语音从“能说”进化到“会演”,在虚拟主播、有声书、语音助手等场景中可大幅提升用户体验。方言支持则有助于缩小数字鸿沟,但需注意方言数据隐私和模型偏见问题。未来竞争将聚焦于情感表达的真实性和多语言扩展能力。