开源模型靠Harness逼近Opus 5:Prime Intellect多智能体研究突破
Prime Intellect 提出多智能体 Harness 方法,让开源模型在 nanoGPT 优化器速通中逼近顶级闭源模型。实验中,Kimi K3 搭配 Harness 跑出 2930 步,超过 GPT-5.6 Sol 并接近 Opus 5,表明开源模型可通过高效科研流程追赶上闭源模型。
Prime Intellect 提出多智能体 Harness 方法,让开源模型在 nanoGPT 优化器速通中逼近顶级闭源模型。实验中,Kimi K3 搭配 Harness 跑出 2930 步,超过 GPT-5.6 Sol 并接近 Opus 5,表明开源模型可通过高效科研流程追赶上闭源模型。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Prime Intellect的最新实验显示,开源模型Kimi K3在Agent Harness辅助下,以2930步的成绩逼近Claude Opus 5的2920步,超越GPT-5.6 Sol。这动摇了“最强闭源模型率先实现RSI”的剧本,提出AI科研能力可能更多取决于试错吞吐量而非单一模型智力。
Prime Intellect设计了一场nanoGPT优化器速通实验,让18个前沿模型(包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3等)在8张H200上自主完成优化任务。每个Agent获得代码仓库、规则手册和目标指令,但不知道具体改进方向,需自行探索。
任务目标是用尽可能少的训练步数将1.24亿参数GPT的验证集loss降至3.28以下,baseline设为3290步,人类最好纪录为2600步。实验全程断网并锁进sandbox,防止模型直接抄袭现成答案。
最终153次全自主实验,单次最长超8天,但没有任何实验提出真正全新的方法。有效技巧如normalization、学习率调整、权重平均等均可在已有研究中找到类似思路。
然而,模型间的差距并非来自idea,而是试错吞吐量。强模型不会轻易放弃一个idea,会换seed、重新消融,甚至等recipe变化后重测旧方案。例如Opus 5重新调β2刷出新纪录,Fable 5重新探测旧方案省下31个steps。
强模型更擅长处理噪声,能判断小提升是真实改进还是随机波动,甚至发现GPU非确定性导致同一seed重复跑loss变化,并围绕此现象重做实验流程。
Kimi K3在Prime Agent Harness辅助下,跑出2930步,超过GPT-5.6 Sol的3042步,仅比Opus 5的2920步差10步。这显示开源模型搭配Harness可以逼近甚至超越部分顶级闭源模型。
Harness为Kimi K3提供持久运行的IPython内核,使其能主动推翻自己的假设,提高效率。这被视为RSI中科研基础设施重要性的例证。
实验表明,idea本身可能并不稀缺,真正影响成绩的是能否多试几个方向、更快排除错误、抓住微弱信号并叠加。科研能力越来越像试错吞吐量问题。
Prime Intellect因此将重点转向Multi-Agent Harness:让便宜开源模型负责监控和实现,强模型只做关键判断,从而以更低成本跑更多实验。这暗示AI科研能力的提升不一定依赖更强模型,改进“试错机器”同样有效。
这一结果动摇了“最强闭源模型率先跨过AI开发AI临界点,然后赢家通吃”的经典RSI剧本。开源模型+Harness的系统也能达到接近第一梯队的水平。
Prime Intellect计划将Speedrun扩展到训练栈更多环节,并放大实验规模。这指向一种可能:AI开发AI的加速未必来自单一模型的智力爆炸,而可能来自越来越便宜、越来越快的AI科研机器。
本文基于量子位对Prime Intellect研究的报道,所有数据均来自该报道,未获第一方原始论文或官方确认。部分结论(如“idea不稀缺”)为报道中的推断,需谨慎对待。
AI科研能力的提升可能不再依赖单一模型的智力突破,而是取决于试错吞吐量——通过更便宜的模型和更高效的Harness,开源系统也能逼近甚至超越闭源旗舰,这为AI4AI提供了新的发展路径。
主报道
主报道来源