同一模型换 Harness 成功率从 46.7% 升至 66.7%,缓存命中率 99.93% 的成本账
Composio 用同一模型 DeepSeek V4 Flash 对比 8 种 Agent Harness,在 30 项高难度任务中 Pi 通过 20 项(66.7%),Claude Code、Codex、Deep Agents 均只通过 16 项。成本差距更大:Pi 每成功任务仅 0.028 美元,约为 Claude Code 的七分之一。社区数据还显示,Pi 配合 DeepSeek 缓存命中率可达 99.93%,处理近 10 亿输入 Token 只花 2.65 美元,未命中则需约 132 美元。文章剖析了 DeepSeek 前缀缓存机制:匹配必须从第一个 Token 开始,因此 Harness 必须保持上下文前缀稳定。Reasonix 与 pi-deepseek-cache 为此采用冻结环境摘要、追加而非改写、独立会话分离执行/规划模型、确定性摘要哈希等手段,把输入成本降幅做到 98%~99%。适合关注 Agent 工具链选型与 LLM API 成本优化的工程师。