Skip to main content

> ML_BENCHMARKS_ATLAS_v1.0

AI Benchmarks & Evaluation Protocols

53 canonical AI evaluation protocols spanning GLUE, SuperGLUE, MMLU, GSM8K, HumanEval, ARC, and LMSYS Chatbot Arena with saturation and contamination audits.

Showing 17 of 53 Evaluation Protocols (Page 3 of 3)Saturation & Contamination Audits
Benchmark
ACTIVE-HEADROOMComputer Vision & Multimodal

Computer Vision & Multimodal Standardized Protocol 4

Top-1 / mAP (%) · Standardized production evaluation protocol 4 executing multi-trial cross-validated metrics on canonical test partitions.

image classification
Benchmark
ACTIVE-HEADROOMComputer Vision & Multimodal

Computer Vision & Multimodal Standardized Protocol 5

Top-1 / mAP (%) · Standardized production evaluation protocol 5 executing multi-trial cross-validated metrics on canonical test partitions.

image classification
Benchmark
ACTIVE-HEADROOMComputer Vision & Multimodal

Computer Vision & Multimodal Standardized Protocol 6

Top-1 / mAP (%) · Standardized production evaluation protocol 6 executing multi-trial cross-validated metrics on canonical test partitions.

image classification
Benchmark
ACTIVE-HEADROOMComputer Vision & Multimodal

Computer Vision & Multimodal Standardized Protocol 7

Top-1 / mAP (%) · Standardized production evaluation protocol 7 executing multi-trial cross-validated metrics on canonical test partitions.

image classification
Benchmark
ACTIVE-HEADROOMComputer Vision & Multimodal

Computer Vision & Multimodal Standardized Protocol 8

Top-1 / mAP (%) · Standardized production evaluation protocol 8 executing multi-trial cross-validated metrics on canonical test partitions.

image classification
Benchmark
ACTIVE-HEADROOMComputer Vision & Multimodal

Computer Vision & Multimodal Standardized Protocol 9

Top-1 / mAP (%) · Standardized production evaluation protocol 9 executing multi-trial cross-validated metrics on canonical test partitions.

image classification
Benchmark
ACTIVE-HEADROOMComputer Vision & Multimodal

Computer Vision & Multimodal Standardized Protocol 10

Top-1 / mAP (%) · Standardized production evaluation protocol 10 executing multi-trial cross-validated metrics on canonical test partitions.

image classification
Benchmark
ACTIVE-HEADROOMAudio, Speech & Acoustics

Audio, Speech & Acoustics Standardized Protocol 1

WER / F1 (%) · Standardized production evaluation protocol 1 executing multi-trial cross-validated metrics on canonical test partitions.

speech recognition
Benchmark
ACTIVE-HEADROOMAudio, Speech & Acoustics

Audio, Speech & Acoustics Standardized Protocol 2

WER / F1 (%) · Standardized production evaluation protocol 2 executing multi-trial cross-validated metrics on canonical test partitions.

speech recognition
Benchmark
ACTIVE-HEADROOMAudio, Speech & Acoustics

Audio, Speech & Acoustics Standardized Protocol 3

WER / F1 (%) · Standardized production evaluation protocol 3 executing multi-trial cross-validated metrics on canonical test partitions.

speech recognition
Benchmark
ACTIVE-HEADROOMAudio, Speech & Acoustics

Audio, Speech & Acoustics Standardized Protocol 4

WER / F1 (%) · Standardized production evaluation protocol 4 executing multi-trial cross-validated metrics on canonical test partitions.

speech recognition
Benchmark
ACTIVE-HEADROOMAudio, Speech & Acoustics

Audio, Speech & Acoustics Standardized Protocol 5

WER / F1 (%) · Standardized production evaluation protocol 5 executing multi-trial cross-validated metrics on canonical test partitions.

speech recognition
Benchmark
ACTIVE-HEADROOMTabular & Classical ML

Tabular & Classical ML Standardized Protocol 1

ROC-AUC (%) · Standardized production evaluation protocol 1 executing multi-trial cross-validated metrics on canonical test partitions.

binary classification
Benchmark
ACTIVE-HEADROOMTabular & Classical ML

Tabular & Classical ML Standardized Protocol 2

ROC-AUC (%) · Standardized production evaluation protocol 2 executing multi-trial cross-validated metrics on canonical test partitions.

binary classification
Benchmark
ACTIVE-HEADROOMTabular & Classical ML

Tabular & Classical ML Standardized Protocol 3

ROC-AUC (%) · Standardized production evaluation protocol 3 executing multi-trial cross-validated metrics on canonical test partitions.

binary classification
Benchmark
ACTIVE-HEADROOMTabular & Classical ML

Tabular & Classical ML Standardized Protocol 4

ROC-AUC (%) · Standardized production evaluation protocol 4 executing multi-trial cross-validated metrics on canonical test partitions.

binary classification
Benchmark
ACTIVE-HEADROOMTabular & Classical ML

Tabular & Classical ML Standardized Protocol 5

ROC-AUC (%) · Standardized production evaluation protocol 5 executing multi-trial cross-validated metrics on canonical test partitions.

binary classification