> ML_BENCHMARK // MMLU-MASSIVE-MULTITASK-LANGUAGE-UNDERSTANDING_v1.0
MMLU (Massive Multitask Language Understanding)
LLM General Knowledge & Reasoning · task-text-generation · near-saturation
LLM General Knowledge & Reasoningnear-saturationhigh-vram-dependent
Değerlendirme Protokolü
57 akademik alanda (beşeri bilimler, STEM, sosyal bilimler, işletme) 5 örnekli (5-shot) çoktan seçmeli soru yanıtlama.
Temel Model & Metrikler
Kanonik Temel (Baseline):Random Guess: 25.0% | GPT-4: 86.4% | Human Expert: ~89.8%
Değerlendirilen Metrikler:
5-shot Accuracy (%)
Eğitim Verisi Kirliliği ve Sızıntı
Ayıklanmamış web verilerinde eğitilen açık ağırlıklı modellerde yüksek veri kirliliği ve sızıntı riski.
Tekrarlanabilirlik Endişeleri
İstem formatına, örnek ayırıcı sözdizimine ve seçenek logit normalizasyon tekniğine karşı aşırı hassas.
