Skip to main content

> ML_DATASET // HUMANEVAL-DATASET_v1.0

HumanEval: Handcrafted Python Coding Benchmark

OpenAI (Chen et al. 2021) · Code Generation & Functional Correctness · 164 handwritten Python programming problems with docstrings, solutions, and unit test cases

Code Generation & Functional CorrectnessMIT164 handwritten Python programming problems with docstrings, solutions, and unit test casesopen

Veri Profili ve Özellikler

Etiket Tipi:Docstring specification and test assertions evaluated via pass@k execution
Diller:en, code
Lisans Seviyesi:permissive-open-source
Modaliteler:text, code

Amaçlanan Kullanım (Intended Use)

  • Kod üreten LLM'lerin standart işlevsel doğruluk değerlendirmesi (pass@1)

Yasaklanan / Kaçınılması Gereken Kullanım

  • Tüm depo yazılım mühendisliği yeteneğinin tek başına kesin ölçüsü olarak kullanımı

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

El yapımı algoritma bulmacaları; sıfır kişisel veri.

Bilinen Önyargılar (Known Bias):

Küçük kapsam (164 problem); Python standart kütüphane aritmetiği ve metin manipülasyonu odağı.

Veri Sızıntısı Riski (Known Leakage):

GitHub taranmış ön eğitim külliyatlarında ciddi ezberleme sızıntısı.

Uyumlu Araçlar ve Kütüphaneler