Skip to main content

> ML_BENCHMARK // ARC-CHALLENGE-REASONING_v1.0

ARC Challenge (AI2 Reasoning Challenge 2590 Question Subset)

Commonsense & Scientific Reasoning · task-question-answering · saturated

Commonsense & Scientific Reasoningsaturatedmoderate

Evaluation Protocol

Multiple-choice question answering on questions that retrieval algorithms and co-occurrence baselines fail to answer correctly.

Baseline & Metrics

Canonical Baseline:Random: 25.0% | GPT-3.5: 85.0% | Claude 3.5 Sonnet: 96.7%
Evaluated Metrics:
25-shot Accuracy (%)

Contamination & Leakage Risks

Widespread memorization across open weights LLMs.

Reproducibility Concerns

Standard choice logit normalization technique.