> ML_BENCHMARK // MATH-COMPETITION-BENCHMARK_v1.0
MATH (Hendrycks High School Competition Benchmark)
Mathematical Reasoning · task-text-generation · active-headroom
Mathematical Reasoningactive-headroomhigh-vram-dependent
Evaluation Protocol
5-shot chain-of-thought generation over 5,000 challenging competition math problems with SymPy symbolic equivalence checking.
Baseline & Metrics
Canonical Baseline:GPT-4 (original): 42.5% | Claude 3.5 Sonnet: 71.1% | DeepSeek-R1: 90.8%
Evaluated Metrics:
Exact Match Accuracy on Final Answer (%)
Contamination & Leakage Risks
Contamination present; symbolic math verification mitigates memorized formatting quirks.
Reproducibility Concerns
Symbolic equivalence checking requires precise SymPy simplification rules for complex algebraic expressions.
CONNECTED DATASETMATH: Measuring Mathematical Problem Solving (Hendrycks et al. 2021)Advanced Mathematical Reasoning · 12,500 high school competition math problems (AMC 10, AMC 12, AIME)
View Dataset Spec