Qwen-Audio-3.0系列语音模型正式上线千问AI平台
阿里巴巴正式在千问AI平台上线Qwen-Audio-3.0系列语音模型,包括语音识别、语音合成和实时交互三个版本。该系列在Artificial Analysis语音排行榜上获得三项全球第一,开发者可通过API或Token Plan订阅使用,目前已应用于千问App等产品。
阿里巴巴正式在千问AI平台上线Qwen-Audio-3.0系列语音模型,包括语音识别、语音合成和实时交互三个版本。该系列在Artificial Analysis语音排行榜上获得三项全球第一,开发者可通过API或Token Plan订阅使用,目前已应用于千问App等产品。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
阿里巴巴发布Qwen-Audio-3.0系列语音模型,在Artificial Analysis语音排行榜上拿下ASR、TTS、实时交互三项全球第一,并已集成至千问App等产品。本文梳理其能力、定价与平台策略。
8月17日,阿里巴巴宣布Qwen-Audio-3.0系列语音模型正式上线千问AI平台,开发者可通过API或Token Plan订阅调用。该系列包括语音识别模型Qwen-Audio-3.0-ASR、语音合成模型Qwen-Audio-3.0-TTS,以及实时语音交互对话模型Qwen-Audio-3.0-Realtime。
据官方介绍,ASR模型支持复杂语境和专业领域识别;TTS模型支持多语种、多方言,并可控制情绪、语气与节奏;Realtime模型则支持端到端语音理解与对话,可边听边说、随时打断追问,并支持工具调用。
官方宣称,在全球权威AI评测平台Artificial Analysis今年7月的语音排行榜上,Qwen-Audio-3.0系列斩获语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一,拿下“大满贯”。
需要指出的是,这一成绩来自官方新闻稿,属于source_claim,尚未获得第三方独立验证。评测的具体分数、测试集和对比模型均未披露。
官方表示,该系列模型已在千问App、千问办公、Qoder等产品中应用。这表明语音能力已从模型层走向产品层,但具体应用场景和效果未详细说明。
千问AI平台近期密集上线了多款主力模型,包括新一代基座大模型Qwen3.8-Max、图像生成模型Qwen-image 3.0 pro、视频生成模型Wan3.0,以及Kimi K3等。平台正试图覆盖文本、代码、语音、图像和视频等多模态能力,打造一站式模型调用入口。
Token Plan订阅服务提供限时优惠。个人版分为Lite(39元/月,每7天2500Credits)、Standard(139元/月,4倍Lite用量)、Pro(499元/月,16倍Lite用量)。团队版标准席位50元/席位/月(降至7.6折),高级席位550元/席位/月(降至7.9折),尊享席位1398元/席位/月。
定价策略显示阿里希望降低开发者使用门槛,同时通过多档位覆盖不同规模需求。但Credits的具体消耗规则未公布,实际成本难以评估。
本文主要信息来自阿里云开发者官方公众号,属于第一方发布,但评测成绩、产品能力等均未提供第三方验证或详细数据,因此相关结论应视为官方宣称而非独立确认。
Qwen-Audio-3.0系列在官方口径下已登顶全球语音评测,并快速落地产品与平台,但需独立评测验证其真实水平。阿里正通过多模态模型矩阵和优惠订阅策略,强化千问AI平台对开发者的吸引力。
主报道
主报道来源