> ML_DATASET // HUMANEVAL-DATASET_v1.0
HumanEval: Handcrafted Python Coding Benchmark
OpenAI (Chen et al. 2021) · Code Generation & Functional Correctness · 164 handwritten Python programming problems with docstrings, solutions, and unit test cases
Code Generation & Functional CorrectnessMIT164 handwritten Python programming problems with docstrings, solutions, and unit test casesopen
Veri Profili ve Özellikler
Etiket Tipi:Docstring specification and test assertions evaluated via pass@k execution
Diller:en, code
Lisans Seviyesi:permissive-open-source
Modaliteler:text, code
Amaçlanan Kullanım (Intended Use)
- Kod üreten LLM'lerin standart işlevsel doğruluk değerlendirmesi (pass@1)
Yasaklanan / Kaçınılması Gereken Kullanım
- Tüm depo yazılım mühendisliği yeteneğinin tek başına kesin ölçüsü olarak kullanımı
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
El yapımı algoritma bulmacaları; sıfır kişisel veri.
Bilinen Önyargılar (Known Bias):
Küçük kapsam (164 problem); Python standart kütüphane aritmetiği ve metin manipülasyonu odağı.
Veri Sızıntısı Riski (Known Leakage):
GitHub taranmış ön eğitim külliyatlarında ciddi ezberleme sızıntısı.
