> ML_BENCHMARK // MATH-COMPETITION-BENCHMARK_v1.0
MATH (Hendrycks High School Competition Benchmark)
Mathematical Reasoning · task-text-generation · active-headroom
Mathematical Reasoningactive-headroomhigh-vram-dependent
Değerlendirme Protokolü
SymPy sembolik denklik kontrolü ile 5.000 zorlu yarışma matematik probleminde 5 örnekli düşünce zinciri üretimi.
Temel Model & Metrikler
Kanonik Temel (Baseline):GPT-4 (original): 42.5% | Claude 3.5 Sonnet: 71.1% | DeepSeek-R1: 90.8%
Değerlendirilen Metrikler:
Exact Match Accuracy on Final Answer (%)
Eğitim Verisi Kirliliği ve Sızıntı
Veri kirliliği mevcuttur; sembolik matematik doğrulaması ezberlenmiş biçimlendirme tuhaflıklarını azaltır.
Tekrarlanabilirlik Endişeleri
Sembolik denklik kontrolü karmaşık cebirsel ifadeler için kesin SymPy sadeleştirme kuralları gerektirir.
BAĞLANTILI VERİ KÜMESİMATH: Measuring Mathematical Problem Solving (Hendrycks et al. 2021)Advanced Mathematical Reasoning · 12,500 high school competition math problems (AMC 10, AMC 12, AIME)
Veri Kümesini İncele