XYZ AI Lab发布两款Deep Search Agent,刷新多项SOTA,探索AI4AI研发范式
XYZ AI Lab正式发布XYZ-Aquila-mini和XYZ-Aquila-pro两款Deep Search Agent,在多项评测中取得最佳成绩。这些模型通过AI4AI范式开发,即让AI参与驱动完整Agent系统的研发闭环,涉及超过300个Agent Workers的协同调度。这标志着AI正从被研发的对象转变为研发过程中的执行者和改进者,是递归自我改进(RSI)方向的重要进展。
XYZ AI Lab正式发布XYZ-Aquila-mini和XYZ-Aquila-pro两款Deep Search Agent,在多项评测中取得最佳成绩。这些模型通过AI4AI范式开发,即让AI参与驱动完整Agent系统的研发闭环,涉及超过300个Agent Workers的协同调度。这标志着AI正从被研发的对象转变为研发过程中的执行者和改进者,是递归自我改进(RSI)方向的重要进展。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
XYZ AI Lab 发布两款 Deep Search Agent,在七项基准中取得多项 SOTA。更关键的是其背后的 AI4AI 研发范式:让 AI 驱动任务生成、实验执行和反馈迭代,人类则保留规则制定和最终判断权。
XYZ AI Lab 发布的 XYZ-Aquila-mini(35B)和 XYZ-Aquila-pro(397B)不仅是两款 Deep Search Agent,更是 AI4AI 研发范式的系统验证。该范式让 AI 参与驱动完整 Agent 系统的研发闭环,包括任务构造、模型训练、运行时优化和评测验证。
这一方向并非孤立。Google DeepMind 的 AlphaEvolve 已用于数据中心优化和芯片设计;Anthropic 在 2026 年 5 月披露其代码库中超 80% 的新代码由 Claude 编写;OpenAI 在 GPT-5.6 中引入 RSI Index 衡量模型参与 AI 研发的能力;Kimi K3 早期版本也承担了大部分 GPU Kernel 优化工作。
XYZ 的独特之处在于,它并非单点优化,而是将大规模计算资源、多 Agent 协作和完整研发流程整合成闭环,让海量实验转化为可验证、可复现、可积累的研发能力。
Deep Search 任务要求模型经历问题拆解、网页检索、来源判断、跨页面比较、计算、核验和最终作答,长链路中任何环节都可能出错。模型只是系统的一部分,任务构造、工具返回、上下文管理、答案路由和评测隔离都会影响结果。
XYZ-Aquila-mini 在 BrowseComp(78.8)、BrowseComp-ZH(82.9)、DeepSearchQA(89.5)、GAIA(97.1)、LiveBrowseComp(48.7)、HLE(51.1)和 WideSearch(80.8)七项基准中均取得最佳结果。XYZ-Aquila-pro 在 BrowseComp-ZH、LiveBrowseComp 和 WideSearch 上取得最高公开分数,在 DeepSearchQA 上与 Kimi-K2.6 持平。
这些成绩证明的是模型、数据、训练、工具、上下文策略、运行时、评测和基础设施共同组成的系统具有竞争力,而非单一模型的能力。
XYZ 的 AI4AI 系统遵循“人定规则,AI 找路;独立评测,全程留痕”原则。人类定义研发目标、评测标准、资源预算和风险边界;Agent 将复杂问题拆解为可执行任务,由不同 Agent Workers 分析失败轨迹、提出方案、修改代码并运行实验。
实验完成后,候选改动由独立评测器生成可核验证据,门控机制按预设标准决定接受、拒绝或升级至人类审查。每次实验的方案、过程、结果和判断依据均被完整记录,写入共享记忆。有效改动沉淀为可复用经验,失败尝试保留原因和边界,减少重复探索。
Agent 不能修改评测标准、读取私有答案或自行批准方案。当出现证据冲突、疑似数据泄漏、高风险改动或权限越界时,系统暂停自动推进并升级至人类审查。
AI4AI 系统的价值不仅在于执行更多实验,还在于从大量失败轨迹中识别人类未预设的改进方向。例如,团队发现 Agent 找到关键网页却未在答案中使用,问题在于信息被过长上下文淹没。
AI 从轨迹中提出两个候选方向:主动上下文整理(在状态清晰时让模型主动整理证据)和“研究记事本”(将候选答案和来源写入独立工作区并交叉验证)。前者已进入当前系统,后者作为带状态的设计保留。
这表明 AI 开始扩展团队实际能探索的解空间,从海量实验中发现超出人类预设的方案,再送入同一套评测和验收流程。
AI4AI 优化并非围绕单个 checkpoint 调参,而是在任务构造、训练、运行时和强化学习等多个耦合环节寻找可验证改进。任务构造从可靠来源构建证据图,确保问题可检索且答案唯一;训练采用状态对齐的 SFT,仅监督模型当时实际可见的信息。
运行时通过只增不改的审计日志和逐步可见状态,区分证据从未被找到、存在但未呈现、或已获得但未用于回答等问题。强化学习探索过程奖励和上下文管理下的共享前缀复用,以改善长程任务中的信用分配和训练效率。
Deep Search 只是 AI4AI 体系的第一个公开验证场。未来该方法有望扩展到 Coding Agent、通用多工具 Agent 以及法律、医学、科研等场景,底层闭环保持一致:提出候选、执行实验、独立验证、沉淀经验。
本文信息主要来自 XYZ AI Lab 的官方发布和机器之心报道,其中行业背景(如 Anthropic、OpenAI、Kimi 的实践)为第二手来源,具体数字和结论需以原实验室披露为准。评测成绩为 XYZ 自称,未经第三方独立验证。
XYZ-Aquila 的 SOTA 成绩是 AI4AI 研发范式的直接产物,证明了在人类设定边界和规则的前提下,AI 可以驱动复杂 Agent 系统的研发闭环,从失败轨迹中发现新解法,并实现系统级优化。这一范式为 RSI 提供了当前阶段的可验证实现路径。
主报道
主报道来源