Skip to main content

> ML_LITERATURE // JIMENEZ-2024-SWE-BENCH-CAN-LANGUAGE-MODELS-RESOLVE-REAL-WORLD-GITHUB-ISSUES_v1.0

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan · International Conference on Learning Representations (ICLR) (2024)

benchmark2024industry-standardartifactsAvailable

Temel Katkı (Principal Contribution)

En iyi açık kaynaklı Python depolarından 2.294 gerçek dünya yazılım mühendisliği sorununu tam test paketlerinin yürütülmesiyle değerlendiren SWE-bench'i oluşturdu.

Operasyonel ve Mühendislik Uygunluğu

task-code-generation, task-autonomous-agents için dağıtım seçimlerini ve mimari belirlemeyi doğrudan yönlendirir.

Temel Varsayımlar (Assumptions)

  • Değerlendirme alanları genelinde standart ampirik düzenlilik ve istatistiksel kararlılık geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Performans özellikleri alan dağılımına ve hesaplama tahsisi parametrelerine bağlıdır

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: