SWE-bench Essential

面向端到端软件工程的 Benchmark。

40 道 SWE-bench Pro 代码任务,覆盖真实仓库级软件工程问题。

40
代码任务
来自 SWE-bench Pro 的真实仓库级软件工程任务。
8
实验配置
覆盖 PenguinHarness、Claude Code 与 Codex。
86.25%
最佳准确率
Claude Code · Claude Opus 4.8。

BENCHMARK

代码任务排行榜

以统一任务集和评测口径,对比不同 Agent 配置的准确率、Token 用量与成本。

正在加载实验结果…

40 道 SWE-bench Pro 代码任务 · 准确率为现有实验结果的平均值 · Token 与成本为全套题合计 · 成本按官方计价估算。

不同配置的效果与成本

PenguinHarness · DeepSeek V4 Flash Claude Code · Claude Opus 4.8 Codex · GPT-5.5

BENCHMARK 覆盖

覆盖三类主流技术栈

40 道任务来自 10 个真实开源仓库,覆盖 Go、JavaScript / TypeScript 和 Python 项目。

Go · 16 道任务

覆盖基础设施、功能开关与安全扫描项目。

Teleport · 7Flipt · 5Vuls · 4

JavaScript / TypeScript · 14 道任务

覆盖社区平台、即时通信与邮件客户端。

NodeBB · 6Element Web · 5Tutanota · 2Proton Mail · 1

Python · 10 道任务

覆盖自动化工具、数字图书馆与桌面浏览器。

Ansible · 6Open Library · 3qutebrowser · 1