返回信息流
新闻事件
S信号86
量子位
1 个来源

开源模型靠Harness逼近Opus 5:Prime Intellect多智能体研究突破

Prime Intellect 提出多智能体 Harness 方法,让开源模型在 nanoGPT 优化器速通中逼近顶级闭源模型。实验中,Kimi K3 搭配 Harness 跑出 2930 步,超过 GPT-5.6 Sol 并接近 Opus 5,表明开源模型可通过高效科研流程追赶上闭源模型。

SynthePulse Insight · AI 深度解读

开源模型+Harness逼近闭源旗舰:AI科研的试错吞吐量革命

版本 1 · 1 个来源

Prime Intellect的最新实验显示,开源模型Kimi K3在Agent Harness辅助下,以2930步的成绩逼近Claude Opus 5的2920步,超越GPT-5.6 Sol。这动摇了“最强闭源模型率先实现RSI”的剧本,提出AI科研能力可能更多取决于试错吞吐量而非单一模型智力。

  • Prime Intellect让18个前沿模型速通nanoGPT优化器任务,Kimi K3搭配Harness跑出2930步,超过GPT-5.6 Sol的3042步,仅比Opus 5的2920步差10步。
  • 实验共153次全自主运行,单次最长超8天,但没有任何实验提出真正全新的方法,有效技巧均可在已有研究中找到类似思路。
  • 真正拉开差距的是试错吞吐量:强模型更擅长处理噪声、换seed重试、自建工具,而非提出独特idea。
  • Fable 5以2726步的成绩跑得最远,从3290步baseline到2600步人类纪录,吃掉了564步优化空间,约82%。
  • Prime Intellect提出Multi-Agent Harness路线:用便宜开源模型负责监控和实现,强模型只做关键判断,以更低成本跑更多实验。
  • Kimi K3的Harness提供持久IPython内核,使其能主动推翻假设,这被视为RSI中科研基础设施重要性的例证。
展开章节目录实验设计:nanoGPT优化器速通

实验设计:nanoGPT优化器速通

Prime Intellect设计了一场nanoGPT优化器速通实验,让18个前沿模型(包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3等)在8张H200上自主完成优化任务。每个Agent获得代码仓库、规则手册和目标指令,但不知道具体改进方向,需自行探索。

任务目标是用尽可能少的训练步数将1.24亿参数GPT的验证集loss降至3.28以下,baseline设为3290步,人类最好纪录为2600步。实验全程断网并锁进sandbox,防止模型直接抄袭现成答案。

结果:无新方法,但差距在试错

最终153次全自主实验,单次最长超8天,但没有任何实验提出真正全新的方法。有效技巧如normalization、学习率调整、权重平均等均可在已有研究中找到类似思路。

然而,模型间的差距并非来自idea,而是试错吞吐量。强模型不会轻易放弃一个idea,会换seed、重新消融,甚至等recipe变化后重测旧方案。例如Opus 5重新调β2刷出新纪录,Fable 5重新探测旧方案省下31个steps。

强模型更擅长处理噪声,能判断小提升是真实改进还是随机波动,甚至发现GPU非确定性导致同一seed重复跑loss变化,并围绕此现象重做实验流程。

Kimi K3与Harness的突破

Kimi K3在Prime Agent Harness辅助下,跑出2930步,超过GPT-5.6 Sol的3042步,仅比Opus 5的2920步差10步。这显示开源模型搭配Harness可以逼近甚至超越部分顶级闭源模型。

Harness为Kimi K3提供持久运行的IPython内核,使其能主动推翻自己的假设,提高效率。这被视为RSI中科研基础设施重要性的例证。

试错吞吐量:AI科研的新瓶颈

实验表明,idea本身可能并不稀缺,真正影响成绩的是能否多试几个方向、更快排除错误、抓住微弱信号并叠加。科研能力越来越像试错吞吐量问题。

Prime Intellect因此将重点转向Multi-Agent Harness:让便宜开源模型负责监控和实现,强模型只做关键判断,从而以更低成本跑更多实验。这暗示AI科研能力的提升不一定依赖更强模型,改进“试错机器”同样有效。

对RSI剧本的挑战

这一结果动摇了“最强闭源模型率先跨过AI开发AI临界点,然后赢家通吃”的经典RSI剧本。开源模型+Harness的系统也能达到接近第一梯队的水平。

Prime Intellect计划将Speedrun扩展到训练栈更多环节,并放大实验规模。这指向一种可能:AI开发AI的加速未必来自单一模型的智力爆炸,而可能来自越来越便宜、越来越快的AI科研机器。

可信度边界

本文基于量子位对Prime Intellect研究的报道,所有数据均来自该报道,未获第一方原始论文或官方确认。部分结论(如“idea不稀缺”)为报道中的推断,需谨慎对待。

核心结论

AI科研能力的提升可能不再依赖单一模型的智力突破,而是取决于试错吞吐量——通过更便宜的模型和更高效的Harness,开源系统也能逼近甚至超越闭源旗舰,这为AI4AI提供了新的发展路径。

主报道

量子位

主报道来源