返回信息流
新闻事件
Artificial Analysis (X)
1 个来源

Hugging Face 发布语音代理竞技场,评估语音到语音模型

Hugging Face 宣布推出新的语音代理竞技场(Speech Agent Arena),用于在真实场景中评估语音到语音模型,衡量对话偏好和任务成功率。初步结果显示,谷歌的 Gemini 3.1 Flash Live Preview 在排行榜上领先。

SynthePulse Insight · AI 深度解读会员精读

语音代理竞技场:偏好与任务成功率为何背离?

版本 1 · 1 个来源

Artificial Analysis 发布 Speech Agent Arena,用真实场景评估语音到语音模型。Gemini 3.1 Flash Live Preview 在偏好上领先,但任务成功率却低于 Grok Voice 和 GPT-Realtime 系列,揭示“听起来好”与“做得好”之间的鸿沟。

  • Speech Agent Arena 由 Artificial Analysis 推出,用 15 个代理场景和 20 个非代理场景评估语音模型,衡量对话偏好和任务成功率。
  • Gemini 3.1 Flash Live Preview - Minimal 以 1046 Elo 领跑偏好榜,但任务成功率仅 74.6%,低于 Grok Voice Think Fast 2.0 High 的 94.7%。
  • 任务成功率榜首是 Grok Voice Think Fast 2.0 High(94.7%),其次是 GPT-Realtime-2.1 High(91.5%)和 ElevenLabs Agents(90.5%)。
展开章节目录新基准的定位与设计

新基准的定位与设计

Artificial Analysis 于 2026 年 8 月 21 日发布 Speech Agent Arena,旨在评估语音到语音模型在真实世界场景中的表现。该基准覆盖 15 个代理场景(需要工具调用,如订外卖)和 20 个非代理场景(无需工具调用,如询问营业时间),通过人类参与者与两个隐藏模型的实时对话,收集偏好投票并拟合 Elo 分数。

任务成功率定义为在符合条件的对话中,模型通过正确的最终工具调用完成请求的比例。为减少过拟合,除一个示例外,场景提示、工具模式和参与者指令均保密,参与者为付费筛选的第三方人员。

限时免费

继续阅读完整分析

还有 3 节深入分析和完整结论

加载中

可信度边界

本报道基于 Artificial Analysis 的官方发布,属于一手来源。所有数据均来自其公告,未独立验证。部分结论(如偏好与任务成功率背离的原因)为推断,基于发布内容中的观察。

主报道

Artificial Analysis (X)

主报道来源