提升模型性能的六种智能体框架能力
本文探讨了AI智能体的框架设计——即围绕模型的架构——如何显著影响性能和成本。文章指出,上下文渲染、动作执行和状态管理等框架能力可带来基准测试结果两位数的提升。
本文探讨了AI智能体的框架设计——即围绕模型的架构——如何显著影响性能和成本。文章指出,上下文渲染、动作执行和状态管理等框架能力可带来基准测试结果两位数的提升。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
NVIDIA Labs推出的NOOA框架将Agent定义为单一Python类,通过类型注解、按引用传递和代码即行动等六大能力,在SWE-bench Verified、CyberGym L1和ARC-AGI-3上取得领先性能,同时将token消耗降低约一半。
NVIDIA Labs发布的NOOA(NVIDIA Labs Object-Oriented Agents)是一个开源研究预览框架,其核心理念是将Agent定义为单一Python类。类的字段是状态,方法是能力,文档字符串是提示,类型注解是强制契约。方法体为省略号(...)的方法在运行时由LLM驱动的循环完成;方法体正常的方法则作为确定性Python执行。
这种设计使Agent开发回归传统软件开发:Agent可以被diff、代码审查、单元测试、追踪、版本控制和重构——无论是人类还是AI编码Agent,都可以使用他们已有的工具。
NOOA架构识别出六个模型面向的接口能力:类型化输入/输出(Agent调用有类型参数和验证返回值,而非自由文本)、按引用传递(模型操作实时Python对象,看到有界预览而非序列化转储)、代码即行动(模型通过编写Python行动,包含控制流和内联方法调用)、可编程循环工程(编排循环是普通Python,可由开发者和模型自身编写)、显式对象状态(持久化、类型化状态存在于Agent对象上,而非仅对话历史)、模型可调用的Harness API(上下文块和事件历史是模型可检查和管理的API)。
这些能力在多个基准上得到验证。在SWE-bench Verified上,NOOA搭配GPT-5.5达到82.2%,超过提交时的公开排行榜SOTA(79.2%);搭配Opus 4.6达到79.8%,且Agent仅253行通用代码,无基准专用提示。在CyberGym L1上,NOOA搭配GPT-5.5解决86.8%的任务,为得分最高的开源Agent,网络访问被阻断,结果来自对代码本身的推理,未使用网络安全专用引导。在ARC-AGI-3上,单一NOOA Agent搭配GPT-5.5达到50.2%平均RHAE(技能基线+8.5分,记忆子系统+11.8分),搭配GPT-5.6-sol达到85.1%,每局成本低于20美元。
效率方面,NOOA搭配GPT-5.5在SWE-bench Verified上使用29次LLM调用和约1.1M tokens/任务达到82.2%。对比基线需要66次调用和2.2M tokens达到78.2%,或29次调用和1.3M tokens达到78.6%。NOOA在同等或更好性能下,成本约为一半。
NOOA包含一个长期记忆子系统,但并非自动背景摘要管道,而是Agent通过模型可调用的工具自主策划——主动写入、查询和修正记录,同时与当前轮次相关的自发记忆自动浮现到上下文中。记录携带类型、重要性和标签,类型化关系(如“支持”、“矛盾”、“衍生自”)将记录连接成知识图谱而非扁平日志。后台反射过程通过合并重复、链接相关记录、将情节提炼为洞察以及修剪不再相关的信息来整合存储。
Agent无需重新训练即可跨会话积累知识。所有内容持久化在一个人类可读的SQLite文件中,团队可使用标准实践检查、备份和审查。存储的记忆可引用实时Agent状态,保持知识最新。多个Agent可共享同一存储同时保留独立所有权。在ARC-AGI-3评估中,记忆子系统使系统RHAE比使用基于文件的笔记的同一Agent提高+11.8分。
NOOA的高效性源于两个机制。首先,按引用传递:工具结果成为实时Python变量,直接在代码中组合,而非作为文本往返于上下文窗口。模型看到类型化的有界预览,完整值保留在执行环境中。其次,由于按引用传递,NOOA无需上下文压缩即可解决SWE-bench:中位数会话峰值提示token为22–72k,而窗口为200–400k。因为工具结果按引用传递而非序列化到上下文窗口,转录保持仅追加且在整个任务中缓存有效。无需摘要步骤,预填充缓存命中在整个任务中累积。
本文信息来源于NVIDIA官方技术博客,属于第一方来源。所有基准测试结果均为NVIDIA Labs自行报告,尚未经第三方独立验证。文中提及的对比基线数据来自公开排行榜,但具体实现细节未提供。
NOOA通过面向对象设计将Agent开发标准化,同时以六大接口能力在多个基准上实现性能与效率的双重突破,特别是按引用传递机制消除了上下文压缩需求,为构建高效、可维护的AI Agent提供了新范式。
主报道
主报道来源