> ML_BENCHMARK // SWE-BENCH-SOFTWARE-ENGINEERING_v1.0
SWE-bench (Software Engineering GitHub Issue Benchmark)
Autonomous Coding Agents · task-code-generation · active-headroom
Autonomous Coding Agentsactive-headroomhigh-vram-dependent
Evaluation Protocol
Agent receives an entire GitHub repository and natural language issue description, generates git patch diff executed inside Docker container.
Baseline & Metrics
Canonical Baseline:GPT-4 (naive): 1.7% | SWE-agent + Claude 3.5 Sonnet: ~49.0%
Evaluated Metrics:
Resolved Rate (% of issues passing full test regressions)
Contamination & Leakage Risks
Issues before pretraining cutoff may be partially memorized; test cases must strictly execute uncommitted tests.
Reproducibility Concerns
Execution depends on deterministic Docker build environments and exact Python dependency versions.
CONNECTED DATASETSWE-bench: Real-World GitHub Software Engineering IssuesSoftware Engineering & Autonomous Agents · 2,294 real-world GitHub issues and pull request test patches across 12 popular open-source Python repos
View Dataset Spec