返回信息流
新闻事件
InfoQ
1 个来源

GitHub热榜第二:仅靠“自验证”框架让 DeepSeek V4 Flash 反超 Fable 5,成本不到 1/11

一个名为 LLM-as-a-Verifier 的开源框架在 GitHub 上迅速走红,它允许大模型自我验证候选轨迹,无需额外训练奖励模型。在 Terminal-Bench 2.1 基准上,DeepSeek V4 Flash 通过 Best-of-5 自验证将成功率从 79% 提升至 88%,超越 Claude Fable 5,且单任务成本仅为后者的十分之一。该框架由斯坦福、伯克利和英伟达研究院学者联合开发,并已开源。

SynthePulse Insight · AI 深度解读

LLM-as-a-Verifier:不换参数,DeepSeek V4 Flash 如何用自验证反超 Fable 5?

版本 1 · 1 个来源

一个已训练完成的模型,不微调、不换参数,仅靠自验证框架在 Terminal-Bench 2.1 上从 79% 提升至 88%,超越闭源前沿模型,且单任务成本仅为后者的约 1/11。这背后是验证侧计算作为独立 Scaling 轴的逻辑。

  • DeepSeek V4 Flash 在 Terminal-Bench 2.1 上,通过 Best-of-5 自验证,系统成功率从 79% 提升至 88%,超越 Claude Fable 5。
  • 单任务总成本约 0.11 美元,对比 Fable 5 的约 1.3 美元,成本不到后者的十分之一。
  • 框架核心是连续评分:利用 logprob 计算连续验证分数,解决传统 LLM-as-a-Judge 离散评分平局率高达 26.7% 的问题。
  • 验证计算可沿三个方向扩展(评分粒度、重复评估、拆分标准),验证准确率持续提升,构成独立 Scaling 轴。
  • 工程上提出 PPT 排序和前缀缓存,降低候选轨迹比较与重复输入成本。
展开章节目录自验证框架:从 79% 到 88% 的性能跃迁

自验证框架:从 79% 到 88% 的性能跃迁

LLM-as-a-Verifier 是一个开源框架,由 Jacky Kwok 牵头,联合斯坦福大学、加州大学伯克利分校和英伟达研究院学者开发,在 GitHub 热榜上冲到第二。其核心思路是:不额外训练奖励模型或验证器,直接利用现有 LLM 对 Agent 的完整执行轨迹进行细粒度验证和排序。

在 Terminal-Bench 2.1 基准上,DeepSeek V4 Flash 原生成功率仅为 78.7%,Best-of-3 时升至 86.5%,Best-of-5 时达到 88.0%,超越了闭源前沿模型 Claude Fable 5。Oracle(理想选择上限)达到 96.6%,原论文汇总不同配置后最高可达 98.9%。这意味着正确轨迹往往已在候选池中,瓶颈在于挑选。

成本方面,团队测算 DeepSeek 自验证单任务总成本约 0.11 美元,Fable 5 约 1.3 美元,成本不到后者的十分之一。有网友质疑 11 倍差距可能仅来自单 Token 价格差,但论文一作回应称成本已包含生成候选轨迹和验证的全部开销,尽管 Token 消耗更多,但开源模型极低的单价仍带来总成本优势。

从离散裁判到概率显微镜:连续评分机制

传统 LLM-as-a-Judge 要求模型输出 1 到 5 的整数分数,颗粒度过粗,导致两条质量有细微差异的轨迹常被同时判为 4 分或 5 分。原论文实测单次离散评分的平局率高达 26.7%,超过四分之一的候选方案陷入平局,系统无法完成最优筛选。

LLM-as-a-Verifier 的破局点在于截获模型输出评价时的底层对数概率分布(logprob),计算连续验证分数。即使两条轨迹都被判为“4 分”,只要模型对相邻评分档位的概率分布不同,仍可拉开差距。

团队进一步将验证计算沿三个方向扩展:增加评分粒度、对同一轨迹重复评估、把复杂评价拆成多个 criteria 分别判断。实验显示,随着验证预算增加,验证准确率持续提升,这成为将 Verification 定义为独立 Scaling 轴的重要依据。

工程降本与 Agent 算力账本的重估

伴随候选数量增加,全量两两比较的计算复杂度会爆炸。团队提出 Probabilistic Pivot Tournament(PPT)排序,用更少的比较完成排序;工程侧通过前缀缓存降低长 Agent 轨迹的重复输入成本。

过去 Test-time Scaling 多关注多采样、多搜索,LLM-as-a-Verifier 补上了验证侧:候选生成后,验证本身也值得投入计算。对开发者而言,模型选型不应只看单 Token 价格,而应看单位成功任务的总成本。廉价模型多跑几次再筛选,可能比直接调用昂贵旗舰模型更划算。

对开源模型尤其重要:过去高质量验证依赖额外训练 Reward Model、PRM 或调用更强模型做 Judge,而该框架证明现成 LLM 本身就能承担细粒度验证,甚至可同时作为生成者和验证者。Verifier 有机会进入 Agent Harness,成为运行时基础能力。

可信度边界

本文信息主要来自 InfoQ 的报道,属于二手来源。性能数据、成本数字和论文细节均来自该报道,未获第一方论文或官方确认,因此标记为 source_claim。其中成本对比存在网友质疑,团队回应称已包含全部开销,但未提供详细核算。

核心结论

LLM-as-a-Verifier 展示了验证侧计算作为独立 Scaling 轴的潜力:不换参数、不微调,仅靠自验证和连续评分,就能让开源模型在复杂 Agent 任务上超越闭源旗舰,同时大幅降低成本。这提示开发者重新审视算力账本,关注单位成功任务的总成本,而非单 Token 价格。

主报道

InfoQ

主报道来源