返回信息流
新闻事件
S信号86
AI前线
1 个来源

GitHub热榜第二:仅靠“自验证”框架让 DeepSeek V4 Flash 反超 Fable 5,成本不到 1/11

一个名为 LLM-as-a-Verifier 的开源框架在 GitHub 上迅速走红,登上热榜第二。该框架由斯坦福、伯克利和英伟达研究院的学者联合开发,通过让大模型自我验证候选轨迹,在 Terminal-Bench 2.1 基准上使 DeepSeek V4 Flash 的成功率从 79% 提升至 88%,超越 Claude Fable 5,且单任务成本仅为后者的十分之一。该研究展示了无需额外训练奖励模型即可提升 AI Agent 性能的潜力。

SynthePulse Insight · AI 深度解读

LLM-as-a-Verifier:不换参数,如何让 DeepSeek V4 Flash 反超闭源旗舰?

版本 1 · 1 个来源

一个已训练好的模型,不微调、不换参数,仅靠自验证(Best-of-5)就在 Terminal-Bench 2.1 上从 79% 跃升至 88%,超越 Claude Fable 5,且单任务成本不到后者的十分之一。这背后是验证侧计算作为独立 Scaling 轴的逻辑。

  • DeepSeek V4 Flash 在 Terminal-Bench 2.1 上,通过 LLM-as-a-Verifier 框架自验证(Best-of-5),成功率从 79% 升至 88%,超越 Claude Fable 5。
  • 单任务成本约 0.11 美元(DeepSeek)对比 1.3 美元(Fable 5),成本不到十分之一;一作称已包含生成与验证全部开销。
  • 框架核心是用模型底层 logprob 计算连续验证分数,解决传统 LLM-as-a-Judge 离散评分平局率高达 26.7% 的问题。
  • 验证计算可沿三个方向扩展(评分粒度、重复评估、多 criteria),验证准确率持续提升,构成独立 Scaling 轴。
  • 工程上提出 PPT 排序与前缀缓存,避免全量两两比较的复杂度爆炸。
展开章节目录现象:自验证让开源模型反超闭源旗舰

现象:自验证让开源模型反超闭源旗舰

一份名为 LLM-as-a-Verifier 的开源框架在社区引发讨论,并冲上 GitHub 热榜第二。该框架由 Jacky Kwok 牵头,联合斯坦福大学、加州大学伯克利分校和英伟达研究院学者共同推出,核心思路是让模型自身作为验证器,从多条候选轨迹中挑选最优解。

在 Terminal-Bench 2.1 基准上,DeepSeek V4 Flash 不介入验证时原生成功率为 78.7%;采用 Best-of-3 时升至 86.5%;Best-of-5 时达到 88.0%,一举超越闭源前沿模型 Claude Fable 5。Oracle(理想选择上限)达到 96.6%,原论文汇总不同 Agent 配置后最高可达 98.9%。

成本方面,DeepSeek 自验证单任务约 0.11 美元,Fable 5 约 1.3 美元,成本不到后者的十分之一。有网友质疑 11 倍差距可能仅来自单 Token 价格差,因为自验证消耗更多 Token;一作 Jacky 回应称公布成本已包含生成 N 条候选轨迹与后续验证的全部开销,得益于开源模型极低的 Token 单价,单任务总成本依然有优势。

机制:从离散评分到连续验证分数

传统 LLM-as-a-Judge 要求模型输出 1 到 5 分的整数,颗粒度过粗,导致两条质量相近的轨迹常被判为同分。原论文实测单次离散评分平局率高达 26.7%,系统无法完成最优筛选。

LLM-as-a-Verifier 的破局点在于截获模型输出评价时的底层对数概率分布(logprob),利用不同评分 Token 对应的概率分布计算连续验证分数。即使两条轨迹都被判为 4 分,只要相邻评分档位的概率分布不同,仍可拉开差距。

团队将验证计算沿三个方向扩展:增加评分粒度、对同一轨迹重复评估、把复杂评价拆成多个 criteria 分别判断。实验显示,随着验证预算增加,Verification Accuracy 持续提升,这成为论文将 Verification 定义为独立 Scaling 轴的重要依据。

工程与成本:PPT 排序与前缀缓存

候选数量增加时,全量两两比较的计算复杂度会爆炸。团队提出 Probabilistic Pivot Tournament(PPT),用更少的比较完成候选排序;工程侧通过前缀缓存降低长 Agent 轨迹的重复输入成本。

成本测算中,DeepSeek 侧使用 DeepSeek V4 Flash Max,价格按当时 OpenRouter 报价计算,生成多条候选轨迹和后续验证的成本均已包含。

对开发者而言,模型选型不再只看单 Token 价格,而要看单位成功任务的总成本。廉价模型多跑几次再通过 Verifier 筛选,可能比直接调用昂贵旗舰模型更划算。

意义:验证侧成为独立 Scaling 轴

过去 Test-time Scaling 多讨论多采样、多搜索,LLM-as-a-Verifier 补上了另一半:候选生成后,验证本身也值得投入计算。验证信号还可用于进度跟踪和强化学习,为复杂 Agent 提供平滑、高密度的奖励信号(Dense Reward)。

对开源模型尤其重要:过去高质量验证依赖额外训练 Reward Model、PRM 或调用更强模型做 Judge;该团队证明现成 LLM 本身就能承担细粒度验证工作,甚至可以同时作为生成者和验证者。

框架 v0.2.0 新增 DeepSeek V4 Flash 验证支持和 Terminal-Bench 2.1 自验证基准。研究已在 Coding、机器人控制和医疗诊断等多个领域完成验证。

可信度边界

本文信息主要来自 AI 前线(二级媒体)对论文及框架的报道,关键数据(成功率、成本、平局率)均出自该报道,未获第一方论文或官方文档独立核实,故标记为 source_claim。成本数据包含生成与验证全部开销的说法来自论文一作回应,同样为 source_claim。

核心结论

LLM-as-a-Verifier 展示了验证侧计算作为独立 Scaling 轴的潜力:不换参数、不微调,仅靠自验证即可显著提升 Agent 任务成功率,并大幅降低成本。这提示开发者重新审视算力账本,模型选型应关注单位成功任务的总成本,而非单 Token 价格。

主报道

AI前线

主报道来源