← 返回内容列表

SWE-bench 与代码能力评测:AI 编程到底有多强

SWE-bench 与代码能力评测:AI 编程到底有多强

SWE-bench 为何成为 AI 编程的「高考」?它测的到底是什么。

当我们说「某款 AI 编程工具很强」,凭什么信?2026 年行业公认的「高考」叫 SWE-bench。理解它,才能看懂各家工具的成绩单。

它到底考什么

SWE-bench 的题目来自真实开源项目的 GitHub Issue:给定一个 bug 或功能请求、以及整个代码仓库,AI 需要读懂上下文、改对文件、让测试通过。它不考「写个函数」,而考「在真实、复杂、跨多文件的工程里把事做成」。

为什么它是硬基准

三个特点让它难以「刷分作弊」:第一,任务需要跨文件理解与修改,靠背答案没用;第二,结果由自动测试验证,不是人工打分;第三,题目来自生产级项目,覆盖真实工程的杂乱与依赖。SWE-bench Verified 是其经过人工校验的子集,更权威。

一次 SWE-bench 评测的闭环真实仓库+IssueAgent 改代码跑测试验证通过率越高,说明「真能干活」的能力越强

图1:用真实测试替代理查,结果更难造假

怎么读分数

头部工具在 SWE-bench Verified 上的通过率已到 80% 以上(如 Claude Code 约 87.6%),意味着「大多数真实 Issue 它能自己修好」。但要注意:基准分数反映的是「最难那类工程任务」的能力上限,日常小任务实际体验往往更好。

局限

SWE-bench 主要考「修已知问题」,不太考「从零设计架构」「理解业务逻辑」「与人协作」。所以它是重要信号,但不是全部。

关联推荐

评论 (0)

加载评论中…