不同配置的效果与成本
PenguinHarness · DeepSeek V4 Flash
Claude Code · Claude Opus 4.8
Codex · GPT-5.5
40 道 SWE-bench Pro 代码任务,覆盖真实仓库级软件工程问题。
BENCHMARK
以统一任务集和评测口径,对比不同 Agent 配置的准确率、Token 用量与成本。
| 正在加载实验结果… |
40 道 SWE-bench Pro 代码任务 · 准确率为现有实验结果的平均值 · Token 与成本为全套题合计 · 成本按官方计价估算。
BENCHMARK 覆盖
40 道任务来自 10 个真实开源仓库,覆盖 Go、JavaScript / TypeScript 和 Python 项目。
覆盖基础设施、功能开关与安全扫描项目。
覆盖社区平台、即时通信与邮件客户端。
覆盖自动化工具、数字图书馆与桌面浏览器。