阿里语音大模型 Qwen-Audio-3.1-TTS 在权威评测平台以 1177 Elo 分数夺得全球第一。该模型支持多语种音色迁移与精细情绪控制,且全线 API 降价最高达 95%,大幅降低落地成本。
在第三方 AI 评测平台 Artificial Analysis 近期公布的语音竞技场(Controlled Voice Arena)排行榜中,阿里巴巴发布的语音合成大模型 Qwen-Audio-3.1-TTS 以 1177 的 Elo 评分位列全球第一。

作为阿里新一代语音合成模型,Qwen-Audio-3.1-TTS 支持多语种与方言的高质量合成。与传统语音合成主要解决“发音正确”不同,该模型更加强调语音表现与具体场景的贴合度:
此次登顶的 TTS 模型隶属于阿里在 2026 云栖大会发布的 Qwen-Audio-3.1 系列。该系列还涵盖语音转写(ASR)与实时语音交互(Realtime)两类模型,目前三款模型的 API 服务均已在千问 AI 平台上线。在此之前,阿里语音团队开源的 Qwen-Audio-Agent 与 CosyVoice 等项目已在 GitHub 累计收获数万星标。
伴随模型能力的升级,阿里已将 Qwen-Audio 全线语音模型价格大幅下调,最高降幅达 95%,显著降低了企业与开发者落地语音交互的门槛与成本。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断