GitHub热榜第二:仅靠“自验证”框架让 DeepSeek V4 Flash 反超 Fable 5,成本不到 1/11
一个名为 LLM-as-a-Verifier 的开源框架在 GitHub 上迅速走红,它允许大模型自我验证候选轨迹,无需额外训练奖励模型。在 Terminal-Bench 2.1 基准上,DeepSeek V4 Flash 通过 Best-of-5 自验证将成功率从 79% 提升至 88%,超越 Claude Fable 5,且单任务成本仅为后者的十分之一。该框架由斯坦福、伯克利和英伟达研究院学者联合开发,并已开源。