> ML_LITERATURE // JIMENEZ-2024-SWE-BENCH-CAN-LANGUAGE-MODELS-RESOLVE-REAL-WORLD-GITHUB-ISSUES_v1.0
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan · International Conference on Learning Representations (ICLR) (2024)
benchmark2024industry-standardartifactsAvailable
Temel Katkı (Principal Contribution)
En iyi açık kaynaklı Python depolarından 2.294 gerçek dünya yazılım mühendisliği sorununu tam test paketlerinin yürütülmesiyle değerlendiren SWE-bench'i oluşturdu.
Operasyonel ve Mühendislik Uygunluğu
task-code-generation, task-autonomous-agents için dağıtım seçimlerini ve mimari belirlemeyi doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Değerlendirme alanları genelinde standart ampirik düzenlilik ve istatistiksel kararlılık geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Performans özellikleri alan dağılımına ve hesaplama tahsisi parametrelerine bağlıdır
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
