概念 SWE-bench

SWE-bench

概念 2 min read · 2026-05-02 #benchmark#evaluation#coding#performance

概述

SWE-bench 是一个用于评估 AI 模型真实世界软件工程能力的基准测试,特别聚焦于解决实际的 GitHub issue。SWE-bench Verified 是经过人工验证的子集,确保测试问题的质量和准确性。它是衡量 AI 编码能力最受关注的基准之一,直接反映了模型在现实软件开发场景中的表现。Claude 系列模型在该基准上持续取得领先成绩,展现了 Anthropic 在 Agentic-Coding 领域的技术实力。

关键信息

Claude 系列模型在 SWE-bench 上的成绩

模型SWE-bench Verified 得分备注
Claude 3.7 Sonnet70.3%(高算力)/ 63.7%(基础 pass@1)首个混合推理模型
Claude Opus 472.5%(标准)/ 79.4%(高算力)世界最佳编码模型
Claude Sonnet 472.7%(标准)/ 80.2%(高算力)性能与效率平衡
Claude Opus 4.681.42%(25 次试验平均)最先进成绩
Claude Opus 4.7未公布具体数字Rakuten-SWE-Bench 解决率是 Opus 4.6 的 3 倍

测试方法

  • 基础方法:使用简单的脚手架(scaffold),配备 bash 工具和文件编辑工具
  • 高算力方法:使用并行尝试(parallel attempts)、对回归测试的拒绝采样(rejection sampling)和评分模型
  • Claude 3.7 Sonnet 的测试中,500 个测试用例中有 11 个因基础设施不兼容而被排除

基准意义

  • SWE-bench 聚焦于真实世界的软件问题,而非竞赛题
  • 评估模型理解代码库、定位问题、制定修复方案并实施的端到端能力
  • Extended-Thinking 和工具使用能力密切相关
  • 高分反映了模型在实际软件工程工作中的可靠性

相关基准

  • TAU-bench:评估复杂现实世界智能体任务的能力
  • Terminal-bench:评估终端环境中的智能体编码能力
  • CursorBench:Opus 4.7 得分 70%,Opus 4.6 为 58%

相关概念

来源

暂无来源