概念 ›SWE-bench
概述
SWE-bench 是一个用于评估 AI 模型真实世界软件工程能力的基准测试,特别聚焦于解决实际的 GitHub issue。SWE-bench Verified 是经过人工验证的子集,确保测试问题的质量和准确性。它是衡量 AI 编码能力最受关注的基准之一,直接反映了模型在现实软件开发场景中的表现。Claude 系列模型在该基准上持续取得领先成绩,展现了 Anthropic 在 Agentic-Coding 领域的技术实力。
关键信息
Claude 系列模型在 SWE-bench 上的成绩
| 模型 | SWE-bench Verified 得分 | 备注 |
|---|---|---|
| Claude 3.7 Sonnet | 70.3%(高算力)/ 63.7%(基础 pass@1) | 首个混合推理模型 |
| Claude Opus 4 | 72.5%(标准)/ 79.4%(高算力) | 世界最佳编码模型 |
| Claude Sonnet 4 | 72.7%(标准)/ 80.2%(高算力) | 性能与效率平衡 |
| Claude Opus 4.6 | 81.42%(25 次试验平均) | 最先进成绩 |
| Claude Opus 4.7 | 未公布具体数字 | Rakuten-SWE-Bench 解决率是 Opus 4.6 的 3 倍 |
测试方法
- 基础方法:使用简单的脚手架(scaffold),配备 bash 工具和文件编辑工具
- 高算力方法:使用并行尝试(parallel attempts)、对回归测试的拒绝采样(rejection sampling)和评分模型
- Claude 3.7 Sonnet 的测试中,500 个测试用例中有 11 个因基础设施不兼容而被排除
基准意义
- SWE-bench 聚焦于真实世界的软件问题,而非竞赛题
- 评估模型理解代码库、定位问题、制定修复方案并实施的端到端能力
- 与 Extended-Thinking 和工具使用能力密切相关
- 高分反映了模型在实际软件工程工作中的可靠性
相关基准
- TAU-bench:评估复杂现实世界智能体任务的能力
- Terminal-bench:评估终端环境中的智能体编码能力
- CursorBench:Opus 4.7 得分 70%,Opus 4.6 为 58%
相关概念
来源
暂无来源