> ML_KIYASLAMALAR_v1.0
Kıyaslama & Değerlendirme Protokolleri
GLUE, MMLU, GSM8K, HumanEval, ARC ve Chatbot Arena dahil olmak üzere 53 kanonik değerlendirme standardı: doygunluk durumu ve test sızıntısı riskleri.
MMLU (Massive Multitask Language Understanding)
5-shot Accuracy (%) · 57 akademik alanda (beşeri bilimler, STEM, sosyal bilimler, işletme) 5 örnekli (5-shot) çoktan seçmeli soru yanıtlama.
HumanEval (Python Code Generation Benchmark)
pass@1, pass@10, pass@100 · Birim test senaryolarına karşı docstring'den kod üretme başarısını değerlendiren 164 el yapımı Python programlama problemi.
SWE-bench (Software Engineering GitHub Issue Benchmark)
Resolved Rate (% of issues passing full test regressions) · Ajan tüm GitHub deposunu ve doğal dil sorun açıklamasını alır, Docker konteynerinde çalıştırılan git yama farkı üretir.
GSM8K (Grade School Math Multi-step Reasoning)
Strict Match Accuracy (%) · 1.319 test probleminde 8 örnekli düşünce zinciri üretimi ve ardından sayısal regex cevap çıkarımı.
MATH (Hendrycks High School Competition Benchmark)
Exact Match Accuracy on Final Answer (%) · SymPy sembolik denklik kontrolü ile 5.000 zorlu yarışma matematik probleminde 5 örnekli düşünce zinciri üretimi.
LMSYS Chatbot Arena (Crowdsourced Human Preference Elo)
Bradley-Terry Arena Elo Rating · Rastgele model eşleştirmeleri ve istatistiksel önyükleme ile keyfi kullanıcı istemlerinde kör yan yana insan A/B testi.
TruthfulQA (Model Falsehood & Hallucination Benchmark)
% Truthful * % Informative (MC1, MC2, Fine-tuned GPT Judge) · İnce ayarlı doğruluk sınıflandırıcısı tarafından değerlendirilen çoktan seçmeli ve serbest üretimde sıfır vuruşlu 817 soru.
ARC Challenge (AI2 Reasoning Challenge 2590 Question Subset)
25-shot Accuracy (%) · Erişim algoritmalarının ve birlikte oluşum referanslarının doğru yanıtlamakta başarısız olduğu sorularda çoktan seçmeli soru yanıtlama.
ImageNet-1K Top-1 Accuracy (ILSVRC 2012 Validation)
Top-1 Accuracy (%), Top-5 Accuracy (%) · 50.000 doğrulama görüntüsü merkez kırpma veya çoklu kırpma üzerinde test zamanı artırma olmadan değerlendirilir.
MS COCO Object Detection (AP @ IoU=0.50:0.95)
mean Average Precision (mAP 0.50:0.95), AP50, AP75, AP_small, AP_medium, AP_large · 5.000 COCO val2017 görselinde veya kör test-dev sunucusunda 0.50'den 0.95'e kadar 10 IoU eşiği ortalaması alınarak değerlendirilir.
MS COCO Instance Segmentation (Mask AP)
Mask mAP (0.50:0.95), Mask AP50, Mask AP75 · 80 nesne sınıfında yer gerçeği segmentasyon maskelerine karşı değerlendirilen piksel düzeyinde poligon maske örtüşmesi.
Cityscapes Semantic Segmentation (mIoU)
mean Intersection-over-Union (mIoU %), iIoU · 500 doğrulama görüntüsü tam 2048x1024 çözünürlükte 19 kentsel sürüş sınıfında değerlendirilir.
LibriSpeech ASR Word Error Rate (WER)
Word Error Rate (WER % on test-clean and test-other) · Dil modeli yeniden puanlaması olmaksızın test-clean ve gürültülü test-other ayrımlarında standart kod çözme değerlendirmesi.
LLM Reasoning & Architecture Standardized Protocol 1
Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 1.
LLM Reasoning & Architecture Standardized Protocol 2
Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 2.
LLM Reasoning & Architecture Standardized Protocol 3
Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 3.
LLM Reasoning & Architecture Standardized Protocol 4
Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 4.
LLM Reasoning & Architecture Standardized Protocol 5
Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 5.
