返回信息流
新闻事件
A重点78
Artificial Analysis (X)
1 个来源

Artificial Analysis 更新文本到图像竞技场,扩展评估范围

Artificial Analysis 更新了其文本到图像竞技场,扩展了评估范围,涵盖更多用例和能力,并发布了新的排行榜。更新后的评估旨在帮助用户根据特定工作需求选择模型,并提供了对顶级模型的初步分析。

SynthePulse Insight · AI 深度解读

图像生成竞技场更新:GPT Image 2 全面领先,Nano Banana 2 成性价比之王

版本 1 · 1 个来源

Artificial Analysis 更新了文本到图像竞技场,覆盖 10 个用例和 9 项能力。GPT Image 2 在所有榜单上排名第一,但 Nano Banana 2 以三分之一的价格成为多数场景的性价比之选。

  • GPT Image 2 在每个用例和能力榜单上均排名第一。
  • Nano Banana 2 是几乎无处不在的性价比之选,在动画与游戏、消费、营销与广告、UI/UX 中排名前三,价格为每千张图像 67 美元,而 GPT Image 2 为 211 美元。
  • MAI-Image-2.5 是零售与电商的最佳廉价选择,并在布局方面表现出色。
  • Nano Banana Pro 是真人电影的专业选择,是紧随 GPT Image 2 之后最便宜的模型,在知识和人体解剖学方面也表现良好。
  • 更新后的评估涵盖 10 个真实世界用例和 9 项模型能力,包括 UI/UX 设计、真人电影、物理和文本渲染。
展开章节目录评估范围扩展

评估范围扩展

Artificial Analysis 于 2026 年 8 月 7 日宣布更新其文本到图像竞技场,以扩展测试的用例和能力范围,从 UI/UX 设计到真人电影,从物理到文本渲染。更新后的评估不仅衡量哪个模型整体最佳,还衡量哪个模型最适合特定工作。

新方法基于 10 个真实世界用例和 9 项模型能力的分类法,包括营销与广告、零售与电商、真人电影、动画与游戏、建筑与房地产、生产力与知识工作、UI/UX 设计,以及推理、知识、文本渲染、布局、物理和人体解剖学等能力。

整体质量基准现在跨用例和能力均匀采样。每个提示均由人工策划,来自匿名众包数据,并每月刷新。不再能区分模型或偏离实际使用的提示会被淘汰,并添加处于能力前沿的新提示,以跟踪前沿且无法过度拟合。

GPT Image 2 全面领先

对排行榜上排名前 10 的模型的深入分析显示,GPT Image 2 在每个用例和能力排行榜上均排名第一。然而,在较低价格区间,情况有所不同。

在 UI/UX 用例中,GPT Image 2 和 Reve 2.1 并列第一,Nano Banana 2 排名第三,是最佳性价比选择。在真人电影用例中,GPT Image 2 领先,Nano Banana Pro 和 Reve 2.1 紧随其后。

在物理能力方面,GPT Image 2 排名第一,其次是 GPT Image 1.5 和 Nano Banana 2,其中 Nano Banana 2 最便宜。在文本渲染方面,GPT Image 2 排名第一,Reve 2.1 排名第二,Nano Banana 2 是前三名中性价比最高的。

性价比之选

Nano Banana 2 几乎在所有地方都是性价比之选,在动画与游戏、消费、营销与广告、UI/UX 中排名前三,价格为每千张图像 67 美元,而 GPT Image 2 为 211 美元。

MAI-Image-2.5 是零售与电商的最佳廉价选择,并在布局方面表现出色。Nano Banana Pro 是真人电影的专业选择,是紧随 GPT Image 2 之后最便宜的模型,在知识和人体解剖学方面也表现良好。

这些见解表明,模型选择需要根据具体工作负载进行权衡,而不是仅仅依赖整体排名。

可信度边界

本报道基于 Artificial Analysis 在 X 平台发布的官方帖子,属于一手来源。所有排名和价格数据均来自该帖子,但尚未经过独立验证。

核心结论

图像生成模型的选择应基于具体用例和预算。GPT Image 2 在质量上全面领先,但 Nano Banana 2 以更低价格提供了接近的性能,是性价比之选。

主报道

Artificial Analysis (X)

主报道来源