Skip to main content

> ML_BENCHMARK // SWE-BENCH-SOFTWARE-ENGINEERING_v1.0

SWE-bench (Software Engineering GitHub Issue Benchmark)

Autonomous Coding Agents · task-code-generation · active-headroom

Autonomous Coding Agentsactive-headroomhigh-vram-dependent

Değerlendirme Protokolü

Ajan tüm GitHub deposunu ve doğal dil sorun açıklamasını alır, Docker konteynerinde çalıştırılan git yama farkı üretir.

Temel Model & Metrikler

Kanonik Temel (Baseline):GPT-4 (naive): 1.7% | SWE-agent + Claude 3.5 Sonnet: ~49.0%
Değerlendirilen Metrikler:
Resolved Rate (% of issues passing full test regressions)

Eğitim Verisi Kirliliği ve Sızıntı

Ön eğitim kesme tarihinden önceki sorunlar kısmen ezberlenmiş olabilir; testler işlenmemiş testleri çalıştırmalıdır.

Tekrarlanabilirlik Endişeleri

Yürütme belirleyici Docker ortamlarına ve tam Python bağımlılık sürümlerine bağlıdır.

BAĞLANTILI VERİ KÜMESİSWE-bench: Real-World GitHub Software Engineering IssuesSoftware Engineering & Autonomous Agents · 2,294 real-world GitHub issues and pull request test patches across 12 popular open-source Python repos
Veri Kümesini İncele