> ML_BENCHMARK // ARC-CHALLENGE-REASONING_v1.0
ARC Challenge (AI2 Reasoning Challenge 2590 Question Subset)
Commonsense & Scientific Reasoning · task-question-answering · saturated
Commonsense & Scientific Reasoningsaturatedmoderate
Değerlendirme Protokolü
Erişim algoritmalarının ve birlikte oluşum referanslarının doğru yanıtlamakta başarısız olduğu sorularda çoktan seçmeli soru yanıtlama.
Temel Model & Metrikler
Kanonik Temel (Baseline):Random: 25.0% | GPT-3.5: 85.0% | Claude 3.5 Sonnet: 96.7%
Değerlendirilen Metrikler:
25-shot Accuracy (%)
Eğitim Verisi Kirliliği ve Sızıntı
Açık ağırlıklı LLM'lerde yaygın ezberleme.
Tekrarlanabilirlik Endişeleri
Standart seçenek logit normalizasyon tekniği.
