GitHub热榜第二:仅靠“自验证”框架让 DeepSeek V4 Flash 反超 Fable 5,成本不到 1/11
一个名为 LLM-as-a-Verifier 的开源框架在 GitHub 上迅速走红,登上热榜第二。该框架由斯坦福、伯克利和英伟达研究院的学者联合开发,通过让大模型自我验证候选轨迹,在 Terminal-Bench 2.1 基准上使 DeepSeek V4 Flash 的成功率从 79% 提升至 88%,超越 Claude Fable 5,且单任务成本仅为后者的十分之一。该研究展示了无需额外训练奖励模型即可提升 AI Agent 性能的潜力。