让AI无提示裸考,十余所机构联合发布全新基准:自主科研能力还有多远?
清华大学等十余所机构联合发布了名为 ASI-Bench 的全新基准,旨在衡量 AI 在没有人类方法论指导下的科学自主性。该基准通过逐步减少人类提供的提示,测试 AI 在科研任务中的表现,结果发现 AI 在失去具体操作步骤时性能大幅下降。这一研究揭示了当前 AI 在自主科研方面的局限,为评估 AI 科研能力提供了新视角。
清华大学等十余所机构联合发布了名为 ASI-Bench 的全新基准,旨在衡量 AI 在没有人类方法论指导下的科学自主性。该基准通过逐步减少人类提供的提示,测试 AI 在科研任务中的表现,结果发现 AI 在失去具体操作步骤时性能大幅下降。这一研究揭示了当前 AI 在自主科研方面的局限,为评估 AI 科研能力提供了新视角。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
十余所机构联合发布 ASI-Bench,通过逐步减少人类指导,揭示 AI 自主科研的真正瓶颈不在方法选择,而在执行细节。
ASI-Bench 由清华大学助理教授陈勇超联合 MIT、哈佛、CMU、中科大、微软研究院等十余所机构开发,旨在测量 AI 在没有人类方法论指导时能自主完成多少真实科研工作。与 HLE、Terminal-Bench 等固定任务说明的基准不同,ASI-Bench 将人类指导程度本身设为变量,为每个任务设计 B1 到 B4 四个条件:B1 提供完整方法、公式和步骤;B2 只保留方法提示;B3 仅给研究目标和数据;B4 在 B3 基础上加入无关干扰信息。
为确保任务质量,团队从 1,300 多个候选问题中,经过 5 轮、超过 1,100 次人工评审和 2,000 多次修订,精选出 60 道覆盖 11 个学科的科研项目。开发中进行了超过 1,500 次沙盒运行以检查可复现性和信息泄漏,累计投入超过 3.1 万人工小时。
实验结果显示,18 种模型与智能体组合在 B1 平均得分 50.91,B2 降至 29.10,B3 进一步降至 26.62,B4 为 26.99。最显著的变化发生在 B1 到 B2:仅撤走具体实现步骤,平均分下降 21.82 分;而 B2 到 B3 撤走方法提示,仅下降 2.48 分。这表明 AI 的最大瓶颈并非自主选择方法,而是缺乏操作步骤时难以自行补全实现细节。
表现最好的配置是 Codex 搭配 GPT-5.6 Sol(ultra),B1 得分 71.78,B3 仍有 51.60,是唯一 B3 超过 50 分的组合,但相比 B1 仍下降约 20 分。此外,增加推理预算确实提升自主科研表现:GPT-5.6 Sol 从 xhigh 升至 ultra 后,B3 得分从 40.86 升至 51.60。
计算成本呈现反直觉结果:B1 平均每任务消耗约 435 万 token、运行 37.8 分钟,成本最低;B2 升至最高,平均 691 万 token、49.7 分钟,较 B1 分别增加 59% 和 32%。原因在于 AI 受方法约束却需自行补齐细节,导致更多探索。B3、B4 的 token 消耗约为 540 万和 570 万,反而低于 B2。
Agent 框架显著影响表现:MiMo V2.5 Pro 搭配 MiMo Code 得分为 16.17,换成 Claude Code 后升至 23.25;Kimi K2.7 从 19.72 提升到 27.34。这说明科研能力是模型与系统共同作用的结果,而非模型单独决定。
ASI-Bench 可作为诊断工具:B1 到 B2 降幅大说明系统依赖完整流程,B2 到 B3 降幅大说明方法选择是短板,B3 与 B4 差异反映抗干扰能力。目前基准远未饱和,B3 平均仅 26.62 分,最高 51.60,未来低指导条件下的提升可作为进展参照。
研究团队承认真实科研远比 60 个任务复杂,因此将 ASI-Bench 设计为持续更新的开放基准,未来会加入新学科和任务。但单一评测无法回答 AGI 或 ASI 是否到来,它只是把“AI 能否自己做研究”变成可比较的指标。
本文信息主要来自 DeepTech深科技 对 ASI-Bench 论文的报道,属于二手来源。所有数据(如分数、token 消耗)均来自该报道,未与原始论文核对,因此标记为 source_claim 而非 confirmed。
ASI-Bench 揭示 AI 自主科研的瓶颈不在方法选择,而在执行细节;不完整的人类指导可能增加成本而非降低。
主报道
主报道来源