Skip to main content

> ML_BENCHMARK // HUMANEVAL-CODE-GENERATION-BENCHMARK_v1.0

HumanEval (Python Code Generation Benchmark)

Code Generation & Functional Correctness · task-code-generation · near-saturation

Code Generation & Functional Correctnessnear-saturationdeterministic-cpu

Değerlendirme Protokolü

Birim test senaryolarına karşı docstring'den kod üretme başarısını değerlendiren 164 el yapımı Python programlama problemi.

Temel Model & Metrikler

Kanonik Temel (Baseline):Codex: 28.8% | Claude 3.5 Sonnet: 92.0% | DeepSeek-V3: 82.6%
Değerlendirilen Metrikler:
pass@1pass@10pass@100

Eğitim Verisi Kirliliği ve Sızıntı

GitHub üzerinde eğitilen dil modellerinde yaygın ezberleme; pass@1 test senaryolarının harfi harfine ezberlenmesini yansıtabilir.

Tekrarlanabilirlik Endişeleri

Ana makinede rastgele kod çalıştırılmasını önlemek için yalıtılmış korumalı alan (sandbox) gerektirir.

BAĞLANTILI VERİ KÜMESİHumanEval: Handcrafted Python Coding BenchmarkCode Generation & Functional Correctness · 164 handwritten Python programming problems with docstrings, solutions, and unit test cases
Veri Kümesini İncele