返回信息流
新闻事件
Import AI
1 个来源

Epoch和METR发布MirrorCode基准测试,评估AI完成长期编程任务的能力

Epoch和METR发布了MirrorCode基准测试,旨在评估AI系统完成人类需要数周才能完成的编程任务的能力。结果显示,Claude Opus 4.7等先进模型可以在数小时内以高成本解决部分任务,但最困难的任务仍未解决。该基准测试凸显了AI的快速进步,一年前的模型仅能得分30%。

SynthePulse Insight · AI 深度解读

MirrorCode 基准测试:AI 编程能力逼近人类专家,但仍有硬骨头

版本 1 · 1 个来源

Epoch 与 METR 联合发布 MirrorCode 基准测试,评估 AI 系统完成长周期编程任务的能力。结果显示,顶尖模型已能解决部分需人类数周完成的任务,但仍有近三分之一的目标程序无法完美攻克。

  • MirrorCode 测试 AI 仅凭 CLI 访问重新实现软件程序的能力,包含 25 个目标程序,共 132 个任务实例。
  • Opus 4.7 在 14 小时内以 251 美元推理成本完成一项任务,METR 和 Epoch 认为该任务需人类 2-17 周。
  • 一年前的领先模型得分约 30%,且仅限于简单程序;当前模型进步显著。
  • 25 个目标中,8 个从未达到 100% 解决率,4 个从未达到 99%;AI 在 ruff(Python 检查器)上表现最差。
  • MirrorCode 包含 22 个目标程序的代码和脚手架,涵盖 6 种编程语言。
  • AI 系统能够通过黑盒访问自我导向,重新实现外部软件,暗示其可能自举工业文明能力。
展开章节目录基准测试设计:重新实现而非翻译

基准测试设计:重新实现而非翻译

MirrorCode 由 Epoch 和 METR 发布,旨在衡量 AI 系统完成人类耗时任务的能力。该基准测试最初于 2026 年 4 月宣布,现已扩展并正式发布。测试要求 AI 仅通过命令行界面访问目标程序,在不接触源代码或网络的情况下,从零开始重新实现该程序。作者指出,这需要设计整个程序的结构,而非逐段翻译代码。

目标程序包括 Apple 开发的配置语言 pkl(6.1 万行代码)、系统发育树工具 gotree(1.6 万行代码)以及 CSV 列选择工具 qsv_select(8.7 万行代码)等。

显著成果:AI 完成人类数周工作

测试结果令人瞩目:Claude Opus 4.7 在 14 小时内以 251 美元推理成本完成一项任务,而 METR 和 Epoch 估计该任务需要人类 2 至 17 周。Opus 4.7 和 GPT-5.5 均成功用多种编程语言重新实现了 gotree,成本在 100 至 400 美元之间。Opus 4.7 甚至重新实现了更大的 pkl 程序。

AI 模型进步迅速:一年前的领先模型得分仅约 30%,且仅限于日历工具等简单程序。当前模型在 25 个目标中,有 17 个至少获得一次完美评分,另有 4 个获得接近完美的 99% 以上评分。

未竟之业:仍有硬骨头未啃下

尽管成绩斐然,MirrorCode 仍保留了足够难度。25 个目标中,8 个从未达到 100% 解决率,4 个从未达到 99%。AI 在 Python 检查器和格式化工具 ruff 上表现最差,此外在数学包 giac_subset 和邮件认证库 mailauth 上也遇到困难。

这表明当前 AI 在复杂、领域特定的软件重构上仍有局限,基准测试并非过于简单。

更深远的意义:AI 的自我导向能力

Import AI 编辑 Jack Clark 评论称,MirrorCode 不仅展示了 AI 编程能力的提升,更关键的是 AI 能够自我导向:仅通过输入输出访问,就能从零开始重新实现外部软件。这意味着智能 AI 智能体可能通过黑盒接触,自举出属于自己的工业文明形式。

这一观点将 MirrorCode 的成果置于更宏大的背景下,暗示 AI 的泛化能力可能远超当前应用。

可信度边界

本文信息主要来源于 Import AI 对 Epoch 和 METR 发布的 MirrorCode 基准测试的报道。所有数据、结论均来自该报道,未引入外部知识。部分解释性内容(如“自我导向”的引申意义)为 Import AI 编辑的推断,已在文中标注。

核心结论

MirrorCode 基准测试表明,AI 编程能力已取得质的飞跃,能够完成需人类数周的长周期任务,且进步速度惊人。然而,仍有约三分之一的复杂程序无法完美解决,说明当前 AI 在特定领域存在瓶颈。更重要的是,AI 展现出的自我导向能力可能预示着更广泛的自主智能。

主报道

Import AI

主报道来源