返回信息流
新闻事件
A重点76
AI前线
1 个来源

DeepSeek + Pi 组合在基准测试中胜出,成本仅为 Claude Code 的七分之一

Composio 的公开测试显示,Pi Harness 搭配 DeepSeek V4 Flash 在 30 项高难度任务中成功率最高(66.7%),且平均成本仅 0.028 美元,远低于 Claude Code 的 0.195 美元。开发者 0xEvan 的案例也显示,Pi 的缓存命中率高达 99.93%,处理近 10 亿 Token 仅花费 2.65 美元。这一结果凸显了 Harness 对模型表现的放大效应,挑战了“配置越多越好”的传统思路。

SynthePulse Insight · AI 深度解读

Pi + DeepSeek 组合跑赢 Claude Code?缓存命中率 99.93% 背后的 Harness 乘数效应

版本 1 · 1 个来源

一项公开测试显示,同一模型 DeepSeek V4 Flash 在不同 Harness 中成功率相差 20 个百分点,Pi 以默认配置拿下第一,成本仅为 Claude Code 的七分之一。缓存优化成为关键,但官方 Harness 尚未发布,第三方优化仍有局限。

  • Composio 测试中,Pi Agent 以 66.7% 成功率(30 项任务通过 20 项)排名第一,Claude Code 等通过 16 项,成功率 53.3%。
  • Pi 平均成功任务成本 0.028 美元,Claude Code 为 0.195 美元,相差近 7 倍;中位时间 Pi 132.2 秒,略慢于 Claude Code 的 122.7 秒。
  • 开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash 处理近 10 亿 Token,缓存命中率 99.93%,实际花费 2.65 美元,无缓存预计需 132 美元。
  • Pi 采用默认安装,无额外配置,仅接入 MCP 插件;而 Prime Agent 会话庞大(最多 350 万 Token),导致评分器超时,6 次运行未计分。
  • DeepSeek 官方 Harness 尚未发布,但“DeepSeek Harness 团队”公众号已注册,内测已启动,正式发布在即。
展开章节目录测试结果:Pi 默认配置胜出,成本优势显著

测试结果:Pi 默认配置胜出,成本优势显著

Composio 的公开测试选用 DeepSeek V4 Flash 模型,在 8 种 Harness 中完成 30 项高难度任务。Pi Agent 通过 20 项(66.7%),Oh My Pi 通过 17 项,Claude Code、Codex、Deep Agents 各 16 项,Prime Agent 和 Hermes Agent 各 15 项,OpenCode 14 项。同一模型仅更换 Harness,成功率从 46.7% 升至 66.7%,相差 20 个百分点。

成本差距更明显:Pi 平均成功任务成本 0.028 美元,Claude Code 为 0.195 美元,接近 7 倍。中位时间 Pi 为 132.2 秒,略慢于 Claude Code 的 122.7 秒和 OpenCode 的 129.7 秒,但综合成功率、速度与成本,Pi 表现最突出。

Pi 采用全新默认安装,无自定义设置或调优,仅接入测试所需 MCP 插件。相比之下,Prime Agent 会话庞大,部分消耗 350 万 Token,进行 33 次工具调用,导致评分器超时,6 次运行未计分。这挑战了“配置越多越好”的思路,轻量 Harness 提供更短路径,减少模型迷路机会。

缓存命中率:99.93% 如何实现

开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash 处理近 10 亿 Token,缓存命中率 99.93%,实际花费 2.65 美元,无缓存预计需 132 美元。另一开发者 Shantanu Goel 称,其他 Harness 中缓存命中率通常 94%-97%,Pi 中持续超 99%。

DeepSeek API 采用前缀缓存,匹配需从第一个 Token 开始,前缀变化会导致后续 Token 无法命中。Pi 的可编程性允许开发者修改系统提示词、筛选历史、自定义压缩,甚至改写最终载荷,为缓存优化留出空间。

开源项目 Reasonix 围绕 DeepSeek 前缀缓存设计,核心原则是保持上下文前端稳定、追加而非修改。开发者移植其方法到 Pi 的 DeepPi 声称缓存命中率稳定在 99.7%-99.9%。pi-deepseek-cache 扩展通过冻结日期和工作目录、确定性摘要、SHA-256 哈希诊断等实现类似优化,输入成本降幅达 98%-99%。

Harness 乘数效应与官方 Harness 的期待

Composio 强调不应孤立评测模型,排行榜若只写模型名称而不交代 Harness,分数不完整。Harness 乘数效应指工具可放大或削弱模型表现,选对 Harness 可提升可靠性和效率,选错则相反。

DeepSeek 官方尚未推出 Harness,但“DeepSeek Harness 团队”公众号已注册,内测已启动,正式发布在即。官方 Harness 可能实现原生适配,与模型训练团队协同优化,利用非公开信息,这是第三方无法做到的。

第三方 Harness 只能通过公开 API 逆向优化,存在局限。官方 Harness 的发布可能改变当前生态,但具体能力尚待验证。

可信度边界

本文信息主要来自 AI 前线报道,包含开发者个人声明和 Composio 测试结果。测试数据为来源方提供,未经独立验证;缓存命中率等为开发者声称,非官方确认。

核心结论

Pi 与 DeepSeek 的组合在测试中展现显著优势,核心在于 Harness 对模型表现的放大效应和缓存优化带来的成本降低。但官方 Harness 尚未发布,第三方优化存在局限,未来生态可能因官方介入而改变。

主报道

AI前线

主报道来源