> ML_BENCHMARK // SWE-BENCH-SOFTWARE-ENGINEERING_v1.0
SWE-bench (Software Engineering GitHub Issue Benchmark)
Autonomous Coding Agents · task-code-generation · active-headroom
Autonomous Coding Agentsactive-headroomhigh-vram-dependent
Değerlendirme Protokolü
Ajan tüm GitHub deposunu ve doğal dil sorun açıklamasını alır, Docker konteynerinde çalıştırılan git yama farkı üretir.
Temel Model & Metrikler
Kanonik Temel (Baseline):GPT-4 (naive): 1.7% | SWE-agent + Claude 3.5 Sonnet: ~49.0%
Değerlendirilen Metrikler:
Resolved Rate (% of issues passing full test regressions)
Eğitim Verisi Kirliliği ve Sızıntı
Ön eğitim kesme tarihinden önceki sorunlar kısmen ezberlenmiş olabilir; testler işlenmemiş testleri çalıştırmalıdır.
Tekrarlanabilirlik Endişeleri
Yürütme belirleyici Docker ortamlarına ve tam Python bağımlılık sürümlerine bağlıdır.
BAĞLANTILI VERİ KÜMESİSWE-bench: Real-World GitHub Software Engineering IssuesSoftware Engineering & Autonomous Agents · 2,294 real-world GitHub issues and pull request test patches across 12 popular open-source Python repos
Veri Kümesini İncele