Signal YCurated AI News
更新于 8/20 09:5261 个信源

AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

通用 AI7/20 17:05量子位查看原文 ↗
摘要

阿里发布Qwen-Audio-3.0-TTS模型,在权威语音合成榜单中登顶,支持细粒度标签控制和20种方言,标志着AI语音进入可精细调控的“表演时代”。

核心要点
  • 在ChatTTS、CosyVoice等主流模型中排名第一,综合评分最高
  • 支持通过细粒度标签控制语气、情感、语速等参数
  • 覆盖20种中国方言,包括粤语、吴语、闽南语等
  • 模型已开源,可在Hugging Face等平台获取
  • 提供API和本地部署两种使用方式
AI 洞察
这一突破意味着AI语音从“能说”进化到“会演”,在虚拟主播、有声书、语音助手等场景中可大幅提升用户体验。方言支持则有助于缩小数字鸿沟,但需注意方言数据隐私和模型偏见问题。未来竞争将聚焦于情感表达的真实性和多语言扩展能力。