新基准测试对AI代理搜索API进行质量、成本和速度排名
Artificial Analysis 发布了“Search Index”基准测试,用于评估面向 AI 代理的搜索 API 提供商在质量、成本和速度方面的表现。在七家提供商中,Parallel、Exa 和 Firecrawl 得分最高。该基准测试旨在帮助开发者选择最适合其 AI 代理的搜索 API。
Artificial Analysis 发布了“Search Index”基准测试,用于评估面向 AI 代理的搜索 API 提供商在质量、成本和速度方面的表现。在七家提供商中,Parallel、Exa 和 Firecrawl 得分最高。该基准测试旨在帮助开发者选择最适合其 AI 代理的搜索 API。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Artificial Analysis发布Search Index基准,首次系统评估搜索API在AI代理中的质量、成本与速度。结果显示,质量与总成本呈反比,而原始速度并非总耗时关键。
Artificial Analysis发布了名为“Search Index”的基准测试,旨在衡量搜索API提供商在AI代理场景下的质量、成本与速度。首批测试对象包括Parallel、Exa、Firecrawl、You.com、Tavily、Keenable和Brave共7家提供商。
测试采用标准化代理设置,所有提供商使用同一模型GPT-5.6 Luna,仅更换搜索提供商。代理运行在Artificial Analysis的开源框架Stirrup上,每个任务执行25次搜索并抓取网页。
基准由三个权重相等的子测试组成:DeepSearchQA包含900个需要多次搜索的研究问题;BrowseComp子集测试200个需要多步浏览的难以查找的事实;AA-Omniscience覆盖6个知识领域的600个问题。此外,还设置了一个无工具基线,即模型独立回答,作为对比基准。
结果显示,无搜索访问时模型得分仅为33分,而接入搜索后得分范围提升至65至75分。其中Parallel、Exa和Firecrawl分别以75、74和73分领先。
这一对比凸显了搜索工具对AI代理回答质量的巨大影响,也说明不同搜索API之间的质量差异可达10分之多,对最终用户体验有实质影响。
基准测试发现,更好的搜索质量能降低总成本。当模型在初始阶段获得良好结果时,其使用的token数量会减少。具体而言,Parallel Search(高级版)相比基础版,token使用量下降超过40%。
尽管高级版的单次搜索成本更高,但总成本反而更低,例如Parallel高级版总成本为0.084美元,而基础版为0.11美元。这表明在评估搜索API时,不能仅看单次查询价格,而应综合考虑整体任务成本。
原始速度并不总是意味着更快的整体结果。Parallel Search(turbo版)的单次查询响应时间最短,为0.51秒,而基础版为1.03秒,但其质量较低(67分对73分),导致代理需要执行更多轮次搜索。
最终,turbo版与基础版的总任务时间大致相同。这说明在代理场景中,低质量搜索可能因多次重试而抵消速度优势,评估时应关注端到端耗时而非单次查询延迟。
Artificial Analysis表示,Parallel、Firecrawl和Parallel (turbo)在成本与性能之间达到了最佳平衡。其他提供商可以申请加入该基准测试,完整方法论已公开。
这一基准的发布为AI代理开发者提供了可量化的参考,有助于在选择搜索API时平衡质量、成本与速度。
本文信息来源于THE DECODER的报道,属于二手来源。所有具体数据(如得分、成本、时间)均来自Artificial Analysis发布的基准测试,但未经独立验证,应视为来源声明而非已确认事实。
Search Index基准显示,搜索API的质量直接影响AI代理的总成本与效率,开发者应优先考虑质量而非原始速度或单次查询价格。
主报道
主报道来源