返回信息流
新闻事件
A重点80
机器之心
1 个来源

清华团队开源VeriLoop Coder-E1:以循证螺旋驱动可验证的递归式自我改进

清华大学深圳国际研究生院团队正式开源了VeriLoop Coder-E1,一款基于Qwen3.6-27B构建的代码模型,在多项软件工程基准测试中取得领先成绩。该模型采用窄域PEFT微调和Self-Harness机制,通过循证螺旋实现可验证的递归式自我改进。

SynthePulse Insight · AI 深度解读

VeriLoop Coder-E1:循证螺旋如何重新定义递归式自我改进

版本 1 · 1 个来源

清华团队发布开源代码模型 VeriLoop Coder-E1,以循证螺旋机制挑战传统递归式自我改进,强调证据驱动的可验证闭环。

  • VeriLoop Coder-E1 基于 Qwen3.6-27B,在四项软件工程基准中取得高分,32B 以下开源模型中三项第一。
  • 核心创新是循证螺旋:通过证-伪-探-修-验-化链条,让每轮生成受证据约束,实现可验证的递归改进。
  • 模型权重以 Apache 2.0 开源,但 Self-Harness 控制栈保留,团队转向通用 Code Agent 商业化。
  • 发布不足 48 小时即获第三方 GGUF 量化适配,社区下载活跃,但抗抹除能力数据来自第三方,未经官方确认。
展开章节目录开源发布与基准成绩

开源发布与基准成绩

清华大学深圳国际研究生院团队于 2026 年 7 月 29 日发布 VeriLoop Coder-E1,基于 Qwen3.6-27B 构建,面向仓库级代码修复与智能体式软件工程任务。据机器之心报道,模型在 SWE-bench Verified 得 85.20,SWE-bench Pro 62.38,Terminal-Bench 2.0 76.40,DeepSWE 33.63。

截至 2026 年 7 月 27 日,在 32B 及以下开源模型中,VeriLoop Coder-E1 在 SWE-bench Verified、SWE-bench Pro 和 Terminal-Bench 2.0 中排名第一,DeepSWE 排名第二;在全部开源模型中分别排名第二、第一、第一和第五。数据来源为 Hugging Face 排行榜,但文章强调基准评测仅反映特定任务分布下的相对表现,不能推断真实环境整体能力。

循证螺旋:从试错到证据驱动的闭环

VeriLoop Coder-E1 的核心是窄域 PEFT 微调与 Self-Harness 协同。冻结基座,仅训练少量参数强化工具契约遵循、证据-结论绑定等能力,适配器可拆卸加载。Self-Harness 将任务组织为多轮执行链,每轮生成候选后,通过反驳、定向探究、修订、验证,只有通过验证的纠正才进入下一轮。

团队将这一机制定义为循证螺旋,遵循「证-伪-探-修-验-化」逻辑:收集证据、检验假设、针对缺口探究、按失配层级修复、验证有效性、将经验压缩为未来规则。这不同于简单增加推理轮次,而是让每轮调用由新证据改变判断方式。

递归式自我改进的重新定义

团队认为,仅修改自身组件不能证明真实改进,若目标与评价假设未受检验,修改越深越可能固化偏差。他们重新定义递归式自我改进:经证据纠正的方法改变系统未来如何发现和纠正错误,且该方法仍可被新证据证伪。

运行中,验证通过的修订不会直接成为永久规则,而是登记为方法候选,仅在后续独立任务中实际调用并改变证据义务、工具选择等,且再次获得证据支持时,才写入新纠错方法。若后续证据冲突,可缩小范围、降级或回滚。

开源边界与社区响应

团队以 Apache 2.0 开放模型权重、Tokenizer、配置、部分 PEFT 适配器及评测材料,但 Self-Harness 完整实现暂不开放,因其是复杂运行时控制平面,决定系统能否成为通用 Code Agent。团队下一阶段将商业化重心转向通用 Code Agent。

发布不足 48 小时,巴西等第三方开发者制作并发布 GGUF 量化版本,支持 llama.cpp、Ollama 等本地推理。截至 2026 年 7 月 30 日,原始仓库单日下载 413 次,GGUF 仓库 955 次。第三方还报告模型抗抹除能力强,200 次尝试后拒绝率从约 95% 降至约 82%,但此数据未经官方确认。

从代码生成到通用 Code Agent

团队愿景不同于以单体模型为中心的 AGI 路径,强调系统需形成可修正的状态表征,预测行动后果,并在现实推翻预测时改变未来提问与行动方式。软件工程是检验这一观点的严格起点,因为代码仓库提供环境状态,测试与运行轨迹提供外部证据。

通用 Code Agent 将预测代码、依赖、接口变化,执行后以 Git Diff、测试日志对照预测,出现失配即重新探究或回滚。团队表示将继续在公开评测与真实任务中竞争,但不会只在别人挖好的坑里继续铲土。

可信度边界

本文基于机器之心报道,其中基准成绩与排名来自 Hugging Face 排行榜,属于第三方数据;抗抹除能力数据来自第三方开发者,未经官方验证,标注为来源声称。Self-Harness 未开源,其内部机制描述来自团队技术博客,无法独立验证。

核心结论

VeriLoop Coder-E1 不仅是一个高性能开源代码模型,更通过循证螺旋机制重新定义了递归式自我改进:真正的改进不是修改自身,而是让证据驱动的纠正改变未来发现和纠正错误的方式,且保持可证伪性。

主报道

机器之心

主报道来源