清华团队开源VeriLoop Coder-E1:以循证螺旋驱动可验证的递归式自我改进
清华大学深圳国际研究生院团队正式开源了VeriLoop Coder-E1,一款基于Qwen3.6-27B构建的代码模型,在多项软件工程基准测试中取得领先成绩。该模型采用窄域PEFT微调和Self-Harness机制,通过循证螺旋实现可验证的递归式自我改进。
清华大学深圳国际研究生院团队正式开源了VeriLoop Coder-E1,一款基于Qwen3.6-27B构建的代码模型,在多项软件工程基准测试中取得领先成绩。该模型采用窄域PEFT微调和Self-Harness机制,通过循证螺旋实现可验证的递归式自我改进。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
清华团队发布开源代码模型 VeriLoop Coder-E1,以循证螺旋机制挑战传统递归式自我改进,强调证据驱动的可验证闭环。
清华大学深圳国际研究生院团队于 2026 年 7 月 29 日发布 VeriLoop Coder-E1,基于 Qwen3.6-27B 构建,面向仓库级代码修复与智能体式软件工程任务。据机器之心报道,模型在 SWE-bench Verified 得 85.20,SWE-bench Pro 62.38,Terminal-Bench 2.0 76.40,DeepSWE 33.63。
截至 2026 年 7 月 27 日,在 32B 及以下开源模型中,VeriLoop Coder-E1 在 SWE-bench Verified、SWE-bench Pro 和 Terminal-Bench 2.0 中排名第一,DeepSWE 排名第二;在全部开源模型中分别排名第二、第一、第一和第五。数据来源为 Hugging Face 排行榜,但文章强调基准评测仅反映特定任务分布下的相对表现,不能推断真实环境整体能力。
VeriLoop Coder-E1 的核心是窄域 PEFT 微调与 Self-Harness 协同。冻结基座,仅训练少量参数强化工具契约遵循、证据-结论绑定等能力,适配器可拆卸加载。Self-Harness 将任务组织为多轮执行链,每轮生成候选后,通过反驳、定向探究、修订、验证,只有通过验证的纠正才进入下一轮。
团队将这一机制定义为循证螺旋,遵循「证-伪-探-修-验-化」逻辑:收集证据、检验假设、针对缺口探究、按失配层级修复、验证有效性、将经验压缩为未来规则。这不同于简单增加推理轮次,而是让每轮调用由新证据改变判断方式。
团队认为,仅修改自身组件不能证明真实改进,若目标与评价假设未受检验,修改越深越可能固化偏差。他们重新定义递归式自我改进:经证据纠正的方法改变系统未来如何发现和纠正错误,且该方法仍可被新证据证伪。
运行中,验证通过的修订不会直接成为永久规则,而是登记为方法候选,仅在后续独立任务中实际调用并改变证据义务、工具选择等,且再次获得证据支持时,才写入新纠错方法。若后续证据冲突,可缩小范围、降级或回滚。
团队以 Apache 2.0 开放模型权重、Tokenizer、配置、部分 PEFT 适配器及评测材料,但 Self-Harness 完整实现暂不开放,因其是复杂运行时控制平面,决定系统能否成为通用 Code Agent。团队下一阶段将商业化重心转向通用 Code Agent。
发布不足 48 小时,巴西等第三方开发者制作并发布 GGUF 量化版本,支持 llama.cpp、Ollama 等本地推理。截至 2026 年 7 月 30 日,原始仓库单日下载 413 次,GGUF 仓库 955 次。第三方还报告模型抗抹除能力强,200 次尝试后拒绝率从约 95% 降至约 82%,但此数据未经官方确认。
团队愿景不同于以单体模型为中心的 AGI 路径,强调系统需形成可修正的状态表征,预测行动后果,并在现实推翻预测时改变未来提问与行动方式。软件工程是检验这一观点的严格起点,因为代码仓库提供环境状态,测试与运行轨迹提供外部证据。
通用 Code Agent 将预测代码、依赖、接口变化,执行后以 Git Diff、测试日志对照预测,出现失配即重新探究或回滚。团队表示将继续在公开评测与真实任务中竞争,但不会只在别人挖好的坑里继续铲土。
本文基于机器之心报道,其中基准成绩与排名来自 Hugging Face 排行榜,属于第三方数据;抗抹除能力数据来自第三方开发者,未经官方验证,标注为来源声称。Self-Harness 未开源,其内部机制描述来自团队技术博客,无法独立验证。
VeriLoop Coder-E1 不仅是一个高性能开源代码模型,更通过循证螺旋机制重新定义了递归式自我改进:真正的改进不是修改自身,而是让证据驱动的纠正改变未来发现和纠正错误的方式,且保持可证伪性。
主报道
主报道来源