> ML_BENCHMARK // HUMANEVAL-CODE-GENERATION-BENCHMARK_v1.0
HumanEval (Python Code Generation Benchmark)
Code Generation & Functional Correctness · task-code-generation · near-saturation
Code Generation & Functional Correctnessnear-saturationdeterministic-cpu
Değerlendirme Protokolü
Birim test senaryolarına karşı docstring'den kod üretme başarısını değerlendiren 164 el yapımı Python programlama problemi.
Temel Model & Metrikler
Kanonik Temel (Baseline):Codex: 28.8% | Claude 3.5 Sonnet: 92.0% | DeepSeek-V3: 82.6%
Değerlendirilen Metrikler:
pass@1pass@10pass@100
Eğitim Verisi Kirliliği ve Sızıntı
GitHub üzerinde eğitilen dil modellerinde yaygın ezberleme; pass@1 test senaryolarının harfi harfine ezberlenmesini yansıtabilir.
Tekrarlanabilirlik Endişeleri
Ana makinede rastgele kod çalıştırılmasını önlemek için yalıtılmış korumalı alan (sandbox) gerektirir.
BAĞLANTILI VERİ KÜMESİHumanEval: Handcrafted Python Coding BenchmarkCode Generation & Functional Correctness · 164 handwritten Python programming problems with docstrings, solutions, and unit test cases
Veri Kümesini İncele