返回信息流
新闻事件
A重点76
Artificial Analysis (X)
2 个来源

推出 Optima:任何人都能创建自定义基准测试

Artificial Analysis 推出了新平台 Optima,允许用户创建自定义基准测试,以评估和比较 AI 模型的性能、速度和成本效率。该平台支持上传现有数据集、导入代理轨迹或描述用例来构建基准,并集成了其研究经验。

SynthePulse Insight · AI 深度解读

Optima发布:让任何人创建自定义AI基准测试

版本 1 · 1 个来源

Artificial Analysis推出Optima平台,允许用户基于自身数据构建基准测试,并比较模型的性能、成本和速度。

  • Optima允许用户上传数据集、导入代理轨迹或描述用例来构建基准测试。
  • 平台支持在最新模型上运行基准测试,并自动更新排行榜。
  • Optima集成了Artificial Analysis的评分方法,包括客观标准和成对比较。
  • 平台跟踪每次任务的成本和耗时,帮助用户找到性价比更高的模型。
展开章节目录Optima的发布与核心功能

Optima的发布与核心功能

2026年8月13日,Artificial Analysis宣布推出Optima,一个允许任何人创建自定义基准测试的平台。该平台旨在利用Artificial Analysis在基准测试方面的研究和经验,帮助用户评估模型在其特定工作负载上的表现。

Optima提供了三种构建基准测试的方式:上传现有评估数据集(支持从Hugging Face导入)、从Arize AI、Braintrust和Langfuse等平台导入代理轨迹,或通过安装Optima技能从编码环境构建。此外,用户还可以通过描述用例并提供示例输入输出来生成基准测试。

运行与评分机制

用户可以在单一点击中跨多个领先模型运行相同的基准测试,并在新模型发布时保持排行榜更新。Optima集成了Artificial Analysis的评分方法,包括基于客观标准或使用与GDPval-AA和AA-Briefcase相同的成对判断方法。对于成对判断,用户选择样本中的偏好响应,Optima利用这些偏好对测试集中的模型进行排名。

性能、成本与效率比较

Optima不仅衡量模型性能,还跟踪每次任务的成本和耗时,提供类别级结果并支持自定义指标。这使得用户能够比较模型之间的权衡,例如找到成本降低10倍但质量下降不明显的模型。

测试者案例与可用性

在发布前,测试者使用Optima回答了诸如“哪个模型可以为我的金融和会计代理节省10倍成本而不显著降低质量?”以及“哪个模型最符合律师的写作风格?”等问题。Optima现已可用,用户可以在artificialanalysis.ai/optima构建自己的基准测试。

可信度边界

本报道基于Artificial Analysis在X平台上的官方发布帖子,属于第一方来源。所有功能描述和测试者案例均来自该帖子,未经过独立验证。

核心结论

Optima的发布降低了创建自定义基准测试的门槛,使企业能够根据自身需求评估模型,并优化成本与性能的平衡。

主报道

Artificial Analysis (X)

主报道来源

同一事件报道

另有 1 个来源报道