Epoch和METR发布MirrorCode基准测试,评估AI完成长期编程任务的能力
Epoch和METR发布了MirrorCode基准测试,旨在评估AI系统完成人类需要数周才能完成的编程任务的能力。结果显示,Claude Opus 4.7等先进模型可以在数小时内以高成本解决部分任务,但最困难的任务仍未解决。该基准测试凸显了AI的快速进步,一年前的模型仅能得分30%。
Epoch和METR发布了MirrorCode基准测试,旨在评估AI系统完成人类需要数周才能完成的编程任务的能力。结果显示,Claude Opus 4.7等先进模型可以在数小时内以高成本解决部分任务,但最困难的任务仍未解决。该基准测试凸显了AI的快速进步,一年前的模型仅能得分30%。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Epoch 与 METR 联合发布 MirrorCode 基准测试,评估 AI 系统完成长周期编程任务的能力。结果显示,顶尖模型已能解决部分需人类数周完成的任务,但仍有近三分之一的目标程序无法完美攻克。
MirrorCode 由 Epoch 和 METR 发布,旨在衡量 AI 系统完成人类耗时任务的能力。该基准测试最初于 2026 年 4 月宣布,现已扩展并正式发布。测试要求 AI 仅通过命令行界面访问目标程序,在不接触源代码或网络的情况下,从零开始重新实现该程序。作者指出,这需要设计整个程序的结构,而非逐段翻译代码。
目标程序包括 Apple 开发的配置语言 pkl(6.1 万行代码)、系统发育树工具 gotree(1.6 万行代码)以及 CSV 列选择工具 qsv_select(8.7 万行代码)等。
测试结果令人瞩目:Claude Opus 4.7 在 14 小时内以 251 美元推理成本完成一项任务,而 METR 和 Epoch 估计该任务需要人类 2 至 17 周。Opus 4.7 和 GPT-5.5 均成功用多种编程语言重新实现了 gotree,成本在 100 至 400 美元之间。Opus 4.7 甚至重新实现了更大的 pkl 程序。
AI 模型进步迅速:一年前的领先模型得分仅约 30%,且仅限于日历工具等简单程序。当前模型在 25 个目标中,有 17 个至少获得一次完美评分,另有 4 个获得接近完美的 99% 以上评分。
尽管成绩斐然,MirrorCode 仍保留了足够难度。25 个目标中,8 个从未达到 100% 解决率,4 个从未达到 99%。AI 在 Python 检查器和格式化工具 ruff 上表现最差,此外在数学包 giac_subset 和邮件认证库 mailauth 上也遇到困难。
这表明当前 AI 在复杂、领域特定的软件重构上仍有局限,基准测试并非过于简单。
Import AI 编辑 Jack Clark 评论称,MirrorCode 不仅展示了 AI 编程能力的提升,更关键的是 AI 能够自我导向:仅通过输入输出访问,就能从零开始重新实现外部软件。这意味着智能 AI 智能体可能通过黑盒接触,自举出属于自己的工业文明形式。
这一观点将 MirrorCode 的成果置于更宏大的背景下,暗示 AI 的泛化能力可能远超当前应用。
本文信息主要来源于 Import AI 对 Epoch 和 METR 发布的 MirrorCode 基准测试的报道。所有数据、结论均来自该报道,未引入外部知识。部分解释性内容(如“自我导向”的引申意义)为 Import AI 编辑的推断,已在文中标注。
MirrorCode 基准测试表明,AI 编程能力已取得质的飞跃,能够完成需人类数周的长周期任务,且进步速度惊人。然而,仍有约三分之一的复杂程序无法完美解决,说明当前 AI 在特定领域存在瓶颈。更重要的是,AI 展现出的自我导向能力可能预示着更广泛的自主智能。
主报道
主报道来源