返回信息流
新闻事件
阿里云开发者
1 个来源

阿里发布Qwen-Audio-3.0-Realtime语音交互模型

阿里发布Qwen-Audio-3.0-Realtime语音交互模型,支持情感感知、音色克隆、双工对话和动态工具调用,在Artificial Analysis评测中综合排名第一,超越OpenAI GPT-Realtime-2。该模型旨在让语音交互更自然智能,适用于情感陪伴、客服、教育等场景。

SynthePulse Insight · AI 深度解读

Qwen-Audio-3.0-Realtime:阿里语音模型如何实现“懂倾听,更聪明”的实时交互

版本 1 · 1 个来源

阿里云发布Qwen-Audio-3.0-Realtime,在Artificial Analysis多项评测中排名第一,超越OpenAI GPT-Realtime-2。其核心突破在于高表现力语音、双工交互与动态工具调用,但部分基准测试中口语prompt下性能有所下降。

  • Qwen-Audio-3.0-Realtime在Artificial Analysis的Speech Reasoning子项中综合排名第一,超越OpenAI GPT-Realtime-2。
  • 模型支持情感感知生成、韵律动态调整和副语言信息处理,实现拟人化语音交互。
  • 内置多模态双工控制模型,支持声纹级背景过滤,在嘈杂环境下保持流畅对话。
  • 具备动态工具调用能力,可完成路线规划、信息查询等任务,支持多工具协同。
  • 采用On-Policy Distillation和多教师蒸馏框架,兼顾推理能力与响应速度。
  • 在VoiceBench和AudioMultiChallenge等基准测试中表现优异,但口语prompt下分数有所下降。
展开章节目录高表现力与共情对话:突破机械朗读感

高表现力与共情对话:突破机械朗读感

Qwen-Audio-3.0-Realtime能够根据对话语境动态调整语气、节奏、音调和情感表达,实现拟人化语音交互。它支持音色克隆,在S2S语音指令遵循公开Benchmark VStyle上取得SOTA效果。

模型具备情感感知生成、韵律动态调整和副语言信息处理能力,能理解和生成笑声、叹息、犹豫等非语言声音信号。在辩论、角色扮演、情感陪伴等复杂语境下,能调整说话风格和情感表达。

这些能力使其可应用于AI伴侣、智能客服、教育助手等场景,提供有温度的情感支持。

流畅双工交互:嘈杂环境下的精准对话

模型内置多模态感知的双工控制模型,能够感知语音、环境、背景、说话人等丰富信息,进行精准的双工节奏判断。在嘈杂背景、多人交谈、多说话人切换等场景下保持从容。

其多模态感知与智能打断检测能同时分析音频、语义与声纹特征,区分环境杂音与真实插话。Realtime-API中预留了audio_prompt字段,支持开发者实现声纹级抗干扰,精准锁定特定用户。

在Artificial Analysis对话动态子项中取得SOTA成绩,打断检测准确率、响应时延等关键指标全面领先。

Agentic与动态工具调用:不止于聊天

模型具备强大的Agentic能力和动态工具调用机制,能根据对话上下文智能判断何时调用工具、何时日常聊天。在TauBench(涵盖零售、航空、电信等真实业务领域)测试中,能准确拆解复杂口语指令,自动调用外部工具进行多步推理。

核心特性包括动态工具路由、多工具协同、统一能力接入(基于FunctionCall标准协议支持MCP、API、知识库)和上下文感知。可完成路线规划、餐厅推荐、实时新闻查询、股票行情、日程安排、数据分析等任务。

底座支撑:兼顾快与聪明

为解决语音模型智商衰减问题,采用On-Policy Distillation框架,将文本大模型的完整推理能力蒸馏至语音模型。同时引入多教师蒸馏策略,包括口语多轮偏好教师、通用教师、Agentic教师和音频理解教师,确保模型不偏科。

模型提供针对日常问答等极度敏感时延场景的毫秒级响应。在Artificial Analysis的Speech Reasoning子项中综合排名第一,在VoiceBench和AudioMultiChallenge等基准测试中表现优异。

但需注意,在VoiceBench中,plus版本标准prompt得分92.5,口语prompt得分90.5(下降2.0);flash版本标准prompt得分89.8,口语prompt得分87.5(下降2.4)。在AudioMultiChallenge中,plus版本标准prompt得分44.0,口语prompt得分37.6(下降6.4);flash版本标准prompt得分43.6,口语prompt得分38.1(下降5.5)。口语prompt下性能有所下降。

可信度边界

本文信息主要来源于阿里云官方公众号文章,属于产品发布宣传,部分评测数据基于Preview版本。Artificial Analysis排名和基准测试结果均为阿里云自述,未经第三方独立验证。口语prompt下的性能下降数据来自原文,但未说明测试条件。

核心结论

Qwen-Audio-3.0-Realtime在语音表现力、双工交互和工具调用方面有显著提升,并在权威评测中取得领先排名,但口语prompt下的性能下降提示其在实际复杂口语场景中可能仍有局限。

主报道

阿里云开发者

主报道来源