Skip to main content

> ML_BENCHMARK // ARC-CHALLENGE-REASONING_v1.0

ARC Challenge (AI2 Reasoning Challenge 2590 Question Subset)

Commonsense & Scientific Reasoning · task-question-answering · saturated

Commonsense & Scientific Reasoningsaturatedmoderate

Değerlendirme Protokolü

Erişim algoritmalarının ve birlikte oluşum referanslarının doğru yanıtlamakta başarısız olduğu sorularda çoktan seçmeli soru yanıtlama.

Temel Model & Metrikler

Kanonik Temel (Baseline):Random: 25.0% | GPT-3.5: 85.0% | Claude 3.5 Sonnet: 96.7%
Değerlendirilen Metrikler:
25-shot Accuracy (%)

Eğitim Verisi Kirliliği ve Sızıntı

Açık ağırlıklı LLM'lerde yaygın ezberleme.

Tekrarlanabilirlik Endişeleri

Standart seçenek logit normalizasyon tekniği.