Skip to main content

> ML_BENCHMARK // MMLU-MASSIVE-MULTITASK-LANGUAGE-UNDERSTANDING_v1.0

MMLU (Massive Multitask Language Understanding)

LLM General Knowledge & Reasoning · task-text-generation · near-saturation

LLM General Knowledge & Reasoningnear-saturationhigh-vram-dependent

Evaluation Protocol

5-shot multiple-choice question answering across 57 academic subjects (humanities, STEM, social sciences, business).

Baseline & Metrics

Canonical Baseline:Random Guess: 25.0% | GPT-4: 86.4% | Human Expert: ~89.8%
Evaluated Metrics:
5-shot Accuracy (%)

Contamination & Leakage Risks

High contamination risk in open-weights models trained on uncurated web crawls.

Reproducibility Concerns

Sensitive to prompt format, few-shot delimiter syntax, and choice logit normalization technique.