返回信息流
新闻事件
A重点72
THE DECODER
1 个来源

新基准测试对AI代理搜索API进行质量、成本和速度排名

Artificial Analysis 发布了“Search Index”基准测试,用于评估面向 AI 代理的搜索 API 提供商在质量、成本和速度方面的表现。在七家提供商中,Parallel、Exa 和 Firecrawl 得分最高。该基准测试旨在帮助开发者选择最适合其 AI 代理的搜索 API。

SynthePulse Insight · AI 深度解读

搜索API基准测试:AI代理的隐藏成本与速度陷阱

版本 1 · 1 个来源

Artificial Analysis发布Search Index基准,首次系统评估搜索API在AI代理中的质量、成本与速度。结果显示,质量与总成本呈反比,而原始速度并非总耗时关键。

  • Artificial Analysis发布Search Index基准,测试7家搜索API提供商在AI代理场景下的质量、成本与速度。
  • 无搜索访问时模型得分仅33,接入搜索后得分升至65-75,Parallel、Exa、Firecrawl领先。
  • 高质量搜索可降低总成本:Parallel高级版相比基础版token使用量减少超40%,总成本更低。
  • 原始速度并非总耗时决定因素:Parallel turbo版单次查询更快,但质量较低导致更多轮次,总耗时相近。
  • Artificial Analysis推荐Parallel、Firecrawl和Parallel (turbo)为成本与性能最佳组合。
展开章节目录基准测试的构成与设计

基准测试的构成与设计

Artificial Analysis发布了名为“Search Index”的基准测试,旨在衡量搜索API提供商在AI代理场景下的质量、成本与速度。首批测试对象包括Parallel、Exa、Firecrawl、You.com、Tavily、Keenable和Brave共7家提供商。

测试采用标准化代理设置,所有提供商使用同一模型GPT-5.6 Luna,仅更换搜索提供商。代理运行在Artificial Analysis的开源框架Stirrup上,每个任务执行25次搜索并抓取网页。

基准由三个权重相等的子测试组成:DeepSearchQA包含900个需要多次搜索的研究问题;BrowseComp子集测试200个需要多步浏览的难以查找的事实;AA-Omniscience覆盖6个知识领域的600个问题。此外,还设置了一个无工具基线,即模型独立回答,作为对比基准。

质量:搜索带来的显著提升

结果显示,无搜索访问时模型得分仅为33分,而接入搜索后得分范围提升至65至75分。其中Parallel、Exa和Firecrawl分别以75、74和73分领先。

这一对比凸显了搜索工具对AI代理回答质量的巨大影响,也说明不同搜索API之间的质量差异可达10分之多,对最终用户体验有实质影响。

成本:质量与总成本的反比关系

基准测试发现,更好的搜索质量能降低总成本。当模型在初始阶段获得良好结果时,其使用的token数量会减少。具体而言,Parallel Search(高级版)相比基础版,token使用量下降超过40%。

尽管高级版的单次搜索成本更高,但总成本反而更低,例如Parallel高级版总成本为0.084美元,而基础版为0.11美元。这表明在评估搜索API时,不能仅看单次查询价格,而应综合考虑整体任务成本。

速度:原始延迟的误导性

原始速度并不总是意味着更快的整体结果。Parallel Search(turbo版)的单次查询响应时间最短,为0.51秒,而基础版为1.03秒,但其质量较低(67分对73分),导致代理需要执行更多轮次搜索。

最终,turbo版与基础版的总任务时间大致相同。这说明在代理场景中,低质量搜索可能因多次重试而抵消速度优势,评估时应关注端到端耗时而非单次查询延迟。

推荐与开放性

Artificial Analysis表示,Parallel、Firecrawl和Parallel (turbo)在成本与性能之间达到了最佳平衡。其他提供商可以申请加入该基准测试,完整方法论已公开。

这一基准的发布为AI代理开发者提供了可量化的参考,有助于在选择搜索API时平衡质量、成本与速度。

可信度边界

本文信息来源于THE DECODER的报道,属于二手来源。所有具体数据(如得分、成本、时间)均来自Artificial Analysis发布的基准测试,但未经独立验证,应视为来源声明而非已确认事实。

核心结论

Search Index基准显示,搜索API的质量直接影响AI代理的总成本与效率,开发者应优先考虑质量而非原始速度或单次查询价格。

主报道

THE DECODER

主报道来源