> ML_LITERATURE // CHEN-2021-EVALUATING-LARGE-LANGUAGE-MODELS-TRAINED-ON-CODE-HUMANEVAL_v1.0
Evaluating Large Language Models Trained on Code (Codex / HumanEval)
Mark Chen, Jerry Tworek, Heewoo Jun, Sheng Shen, Christine Zheng Ponder, Ronan McGrew, Lilian Weng, Hao Shen, Alex Ray, Heidy Khlaaf, Girish Sastry, Gillian Hadfield, Alec Radford, Ilya Sutskever, Wojciech Zaremba · arXiv preprint (2021)
benchmark2021industry-standardartifactsAvailable
Temel Katkı (Principal Contribution)
HumanEval kıyaslamasını ve pass@k işlevsel doğruluk değerlendirmesini tanıtarak OpenAI Codex ve GitHub Copilot'u başlattı.
Operasyonel ve Mühendislik Uygunluğu
task-code-generation için dağıtım seçimlerini ve mimari belirlemeyi doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Değerlendirme alanları genelinde standart ampirik düzenlilik ve istatistiksel kararlılık geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Performans özellikleri alan dağılımına ve hesaplama tahsisi parametrelerine bağlıdır
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
