Skip to main content

> ML_KIYASLAMALAR_v1.0

Kıyaslama & Değerlendirme Protokolleri

GLUE, MMLU, GSM8K, HumanEval, ARC ve Chatbot Arena dahil olmak üzere 53 kanonik değerlendirme standardı: doygunluk durumu ve test sızıntısı riskleri.

Toplam 53 Değerlendirme Protokolü (Sayfa 1 / 3)Doygunluk ve Sızıntı Uyarıları
Kıyaslama
NEAR-SATURATIONLLM General Knowledge & Reasoning

MMLU (Massive Multitask Language Understanding)

5-shot Accuracy (%) · 57 akademik alanda (beşeri bilimler, STEM, sosyal bilimler, işletme) 5 örnekli (5-shot) çoktan seçmeli soru yanıtlama.

text generation
Kıyaslama
NEAR-SATURATIONCode Generation & Functional Correctness

HumanEval (Python Code Generation Benchmark)

pass@1, pass@10, pass@100 · Birim test senaryolarına karşı docstring'den kod üretme başarısını değerlendiren 164 el yapımı Python programlama problemi.

code generation
Kıyaslama
ACTIVE-HEADROOMAutonomous Coding Agents

SWE-bench (Software Engineering GitHub Issue Benchmark)

Resolved Rate (% of issues passing full test regressions) · Ajan tüm GitHub deposunu ve doğal dil sorun açıklamasını alır, Docker konteynerinde çalıştırılan git yama farkı üretir.

code generation
Kıyaslama
NEAR-SATURATIONMathematical Reasoning

GSM8K (Grade School Math Multi-step Reasoning)

Strict Match Accuracy (%) · 1.319 test probleminde 8 örnekli düşünce zinciri üretimi ve ardından sayısal regex cevap çıkarımı.

text generation
Kıyaslama
ACTIVE-HEADROOMMathematical Reasoning

MATH (Hendrycks High School Competition Benchmark)

Exact Match Accuracy on Final Answer (%) · SymPy sembolik denklik kontrolü ile 5.000 zorlu yarışma matematik probleminde 5 örnekli düşünce zinciri üretimi.

text generation
Kıyaslama
ACTIVE-HEADROOMChat & Alignment

LMSYS Chatbot Arena (Crowdsourced Human Preference Elo)

Bradley-Terry Arena Elo Rating · Rastgele model eşleştirmeleri ve istatistiksel önyükleme ile keyfi kullanıcı istemlerinde kör yan yana insan A/B testi.

text generation
Kıyaslama
ACTIVE-HEADROOMSafety & Epistemic Truthfulness

TruthfulQA (Model Falsehood & Hallucination Benchmark)

% Truthful * % Informative (MC1, MC2, Fine-tuned GPT Judge) · İnce ayarlı doğruluk sınıflandırıcısı tarafından değerlendirilen çoktan seçmeli ve serbest üretimde sıfır vuruşlu 817 soru.

question answering
Kıyaslama
SATURATEDCommonsense & Scientific Reasoning

ARC Challenge (AI2 Reasoning Challenge 2590 Question Subset)

25-shot Accuracy (%) · Erişim algoritmalarının ve birlikte oluşum referanslarının doğru yanıtlamakta başarısız olduğu sorularda çoktan seçmeli soru yanıtlama.

question answering
Kıyaslama
NEAR-SATURATIONComputer Vision Classification

ImageNet-1K Top-1 Accuracy (ILSVRC 2012 Validation)

Top-1 Accuracy (%), Top-5 Accuracy (%) · 50.000 doğrulama görüntüsü merkez kırpma veya çoklu kırpma üzerinde test zamanı artırma olmadan değerlendirilir.

image classification
Kıyaslama
ACTIVE-HEADROOMObject Detection

MS COCO Object Detection (AP @ IoU=0.50:0.95)

mean Average Precision (mAP 0.50:0.95), AP50, AP75, AP_small, AP_medium, AP_large · 5.000 COCO val2017 görselinde veya kör test-dev sunucusunda 0.50'den 0.95'e kadar 10 IoU eşiği ortalaması alınarak değerlendirilir.

object detection
Kıyaslama
ACTIVE-HEADROOMInstance Segmentation

MS COCO Instance Segmentation (Mask AP)

Mask mAP (0.50:0.95), Mask AP50, Mask AP75 · 80 nesne sınıfında yer gerçeği segmentasyon maskelerine karşı değerlendirilen piksel düzeyinde poligon maske örtüşmesi.

image segmentation
Kıyaslama
ACTIVE-HEADROOMUrban Semantic Segmentation

Cityscapes Semantic Segmentation (mIoU)

mean Intersection-over-Union (mIoU %), iIoU · 500 doğrulama görüntüsü tam 2048x1024 çözünürlükte 19 kentsel sürüş sınıfında değerlendirilir.

image segmentation
Kıyaslama
NEAR-SATURATIONSpeech Recognition

LibriSpeech ASR Word Error Rate (WER)

Word Error Rate (WER % on test-clean and test-other) · Dil modeli yeniden puanlaması olmaksızın test-clean ve gürültülü test-other ayrımlarında standart kod çözme değerlendirmesi.

speech recognition
Kıyaslama
ACTIVE-HEADROOMLLM Reasoning & Architecture

LLM Reasoning & Architecture Standardized Protocol 1

Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 1.

text generation
Kıyaslama
ACTIVE-HEADROOMLLM Reasoning & Architecture

LLM Reasoning & Architecture Standardized Protocol 2

Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 2.

text generation
Kıyaslama
ACTIVE-HEADROOMLLM Reasoning & Architecture

LLM Reasoning & Architecture Standardized Protocol 3

Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 3.

text generation
Kıyaslama
ACTIVE-HEADROOMLLM Reasoning & Architecture

LLM Reasoning & Architecture Standardized Protocol 4

Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 4.

text generation
Kıyaslama
ACTIVE-HEADROOMLLM Reasoning & Architecture

LLM Reasoning & Architecture Standardized Protocol 5

Accuracy (%) · Kanonik test bölümlerinde çoklu denemeli çapraz doğrulanmış metrikleri yürüten standartlaştırılmış üretim değerlendirme protokolü 5.

text generation