返回信息流
新闻事件
机器之心
1 个来源

Valkor联合浙大、UCL开源Loom:为AI编程Agent提供结构化工程状态层

Valkor联合浙江大学智能计算与软件研究中心和伦敦大学学院(UCL)软件工程团队,正式开源了Loom。Loom旨在解决AI编程Agent在长任务中出现的'局部失忆'问题,通过将复杂交付过程拆解为可恢复的结构化状态链,帮助Agent在测试失败或会话中断后保持上下文一致性,从而提升AI在真实工程中的可靠性。

SynthePulse Insight · AI 深度解读

Loom:为AI编程装上“工程状态层”,终结长任务失控

版本 1 · 1 个来源

当Coding Agent在长任务中陷入“局部失忆”、原地打转时,Loom通过结构化的交付状态链,让AI编程从“一次性Prompt”走向“可随时恢复的工程流程”。

  • 当前AI编程工具在长任务中易被报错噪音淹没,Agent会忘记目标、重复试错,甚至把已修复的Bug改回去。
  • Loom由Valkor、浙江大学智能计算与软件研究中心、UCL软件工程团队联合开源,旨在为Agent提供独立于聊天上下文的工程状态层。
  • Loom将测试失败等事件结构化为待办状态,使Bug不会被淹没,且新Agent可零成本接管任务,无需重读聊天历史。
  • Loom认为长任务失败的根本原因不是Context Window不够长,而是信息噪音过大,工程需要结构化与确定性。
  • Loom不仅提升长任务推进的稳定性,还能捕获Agent在真实执行环境下的动态反馈轨迹,为未来评测和微调提供语料。
展开章节目录AI编程的“调试黑洞”:长任务为何失控?

AI编程的“调试黑洞”:长任务为何失控?

在Vibe Coding降低开发门槛的今天,Coding Agent在短任务中表现惊艳,但一旦上下文拉长,开发者就会陷入“调试黑洞”:Agent在某一轮测试失败后开始疯狂修改代码、高频道歉、连续输出多轮Diff,最终忘记最初目标,甚至把已修复的Bug改回去。整个会话塞满报错和垃圾日志,环境噪声极高,开发者不得不手动切断并新建会话,但必须重新用自然语言拼凑过去一小时的所有信息。

这是目前AI编程工具在大规模真实工程中落地的最大瓶颈:Agent将所有工程线索和垃圾噪音都丢进Chat Context,缺乏一层独立、结构化的Engineering State来做隔离与控制。

Loom的解法:结构化的交付状态链

为了打破这一瓶颈,Valkor联合浙江大学智能计算与软件研究中心、伦敦大学学院(UCL)软件工程团队正式推出并开源了Loom。Loom关注的是AI生成代码之后,如何让复杂软件任务在真实工程流程中持续推进、可验证、可恢复地走完。

Loom的切入点是将一次复杂的软件交付过程拆解为结构化、可随时恢复的状态链,类似于给单机游戏引入“自动存档点”。当Agent运行测试失败时,Loom不会将失败作为终端文本丢进Chat,而是将其捕捉并结构化为独立于聊天记录存在的待办状态。这意味着Bug不会被淹没,失败变成下一步行动的“强约束”;同时,多Agent可以零成本接管——新Agent读取结构化的“交付状态链”后,瞬间知道自己是谁、在哪、下一步该修哪个Bug,无需重读聊天历史。

为什么卷Context Window治不好长任务的绝症?

很多人将长任务失败归咎于Context Window不够长,但Loom认为这在真实工程逻辑上是伪命题。软件开发中,信息量大不等于可靠性高。把几万行编译日志、多轮Diff、测试输出塞进上下文,只会让会话充满杂音,模型容易迷失或误判。

工程的本质是结构化与确定性。Loom的思路不是让模型看更多、记更多,而是帮模型过滤噪音,只提炼出最核心的工程线索:计划进行到哪一步?哪些单测真的Pass了?哪几个文件的Diff已经定型不能再乱动?当这些关键点成为可被编程读取的结构化数据时,衡量AI Coding效能的标准就从“模型能生成多少行代码”转向“长任务持续推进的完备率”。

软件工程:大模型真正落地的确定性沙盒

软件工程可能是Agent最好的反馈场,规则绝对刚性:代码能编译就是能编译,单测挂了就是挂了。AI编程如果想走向严肃的生产环境,就必须重回软件工程的经典常识。Vibe Coding让所有人都能快速搓出Demo,但Demo和能在生产环境跑的真实软件之间,还差一整套可信度验证。如果Coding Agent只管写代码,把验证、对齐、纠错成本全部甩给人类工程师,效率杠杆很快就会见顶。

Loom想探索的不仅是一个好用的开源工具,而是大模型走向严肃生产环境所缺失的状态基础设施。大模型在静态语料库里学到了“完美的最终代码长什么样”,却很难学到“一个复杂的Bug到底是如何被一步步定位、失败、妥协并最终修复的”——这些过程轨迹才是软件工程中最核心的工程判断力。通过这层状态层,Loom不仅让Agent的长任务推进更稳定,也在同时捕获Agent在真实执行环境下的动态反馈轨迹,为未来Agent的动态评测和微调数据收集提供更真实的工程语料。

可信度边界

本文基于机器之心对Loom开源项目的报道,所有事实均来自该单一来源。报道中未提供第三方验证或独立测试数据,部分关于Agent行为模式的描述(如“高频道歉”“连续输出5轮新Diff”)属于对开发者常见体验的概括性描述,未提供具体实验数据。Loom的实际效果有待社区验证。

核心结论

Loom通过结构化的工程状态层,试图解决AI编程在长任务中因上下文噪音导致的失控问题,将AI编程从“一次性Prompt”推向“可恢复的工程流程”,为AI在严肃生产环境中的落地提供了新的基础设施视角。

主报道

机器之心

主报道来源