返回信息流
新闻事件
S信号87
Hacker News (AI filter)
1 个来源

AI能独立完成的最大软件项目是什么?

这篇文章来自Epoch AI,探讨了AI在软件开发中的当前极限,提出了AI能自主完成的最大软件项目是什么的问题。文章可能讨论了AI编程能力的最新进展和基准测试。

SynthePulse Insight · AI 深度解读

MirrorCode:AI 能否独立重建整个软件项目?

版本 1 · 1 个来源

Epoch AI 与 METR 联合推出 MirrorCode 基准,测试 AI 在无源码、无网络环境下端到端重建完整程序的能力。结果显示,AI 已能完成部分长期任务,但数据污染与泛化问题仍存疑。

  • MirrorCode 是 Epoch AI 与 METR 联合开发的基准,要求 AI 在无源码、无网络环境下端到端重建完整程序,并通过端到端测试。
  • 基准包含 25 个目标程序,覆盖 Unix 工具、生物信息学、解释器、静态分析、密码学等领域。
  • 最大任务单次运行成本 2600 美元,AI 连续工作 19 天;Claude Opus 4.7 用 14 小时、251 美元重建了 gotree(约 1.6 万行 Go 代码,40+ 命令)。
  • 人类工程师完成最复杂任务估计需数月,而 AI 已能解决部分任务,但数据污染可能虚高成绩。
  • MirrorCode 尚未完全解决,排行榜使用 15 个目标程序、30 个任务,每个任务预算 100 亿 token。
  • 开源了 22 个目标程序(132 个任务实例),保留 3 个私有测试集。
展开章节目录基准设计:长期、端到端、防作弊

基准设计:长期、端到端、防作弊

MirrorCode 是 Epoch AI 与 METR 联合开发的基准,旨在测试 AI 在长期编码任务上的能力。与常见基准(如修复 bug 或实现单个功能)不同,MirrorCode 要求 AI 在无源码、无网络、无作弊途径的沙盒中,端到端重建整个程序,且输出必须与原始程序在端到端测试(包括隐藏测试)上完全一致。

基准包含 25 个目标程序,覆盖 Unix 工具、数据序列化与查询、生物信息学、解释器、静态分析、密码学、压缩等领域。任务规模从“小”到“大”,其中最大任务单次运行成本 2600 美元,AI 连续工作 19 天。

AI 已能完成部分长期任务

尽管任务极具挑战,AI 已能解决部分 MirrorCode 任务。例如,Claude Opus 4.7 重建了 gotree(一个约 1.6 万行 Go 代码、40+ 命令的生物信息学工具包),耗时 14 小时,成本 251 美元。据估计,人类工程师在无 AI 辅助下完成该任务需 2–17 周。

但需注意,最佳 AI 实现通过了 2000/2001 项测试,仅在一个边缘用例上失败,因此并非严格 100% 完成,但被视为“近乎完美”。

数据污染:成绩可能虚高

由于目标程序是开源项目,AI 可能在预训练中见过原始代码,导致成绩虚高。然而,AI 成功重建了通过记忆筛查的多个目标程序,而未能重建筛查显示有记忆迹象的程序,这表明结果并非主要由记忆驱动,但无法完全排除记忆的贡献。

作者认为,MirrorCode 测量的能力可能泛化到未见过的代码库,但这一结论仍属推断。

排行榜与开源情况

MirrorCode 尚未完全解决。排行榜使用 15 个目标程序(Medium 和 Large 桶),每个程序用两种语言(通常 Go 和 Ada)实现,共 30 个任务,每个任务预算 100 亿 token,运行三次。

Epoch AI 开源了 22 个目标程序(共 132 个任务实例,覆盖六种编程语言),保留 3 个目标作为私有测试集。

可信度边界

本报道基于 Epoch AI 官方页面,属于第一方来源。所有数据(如成本、时间、测试通过数)均来自该页面,但部分结论(如泛化能力)为作者推断,且数据污染问题未被完全排除。

核心结论

MirrorCode 表明 AI 已能独立完成部分长期编码任务,但数据污染和泛化问题仍需谨慎对待。

主报道

Hacker News (AI filter)

主报道来源