> ML_BENCHMARKS_ATLAS_v1.0
AI Benchmarks & Evaluation Protocols
53 canonical AI evaluation protocols spanning GLUE, SuperGLUE, MMLU, GSM8K, HumanEval, ARC, and LMSYS Chatbot Arena with saturation and contamination audits.
Computer Vision & Multimodal Standardized Protocol 4
Top-1 / mAP (%) · Standardized production evaluation protocol 4 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 5
Top-1 / mAP (%) · Standardized production evaluation protocol 5 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 6
Top-1 / mAP (%) · Standardized production evaluation protocol 6 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 7
Top-1 / mAP (%) · Standardized production evaluation protocol 7 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 8
Top-1 / mAP (%) · Standardized production evaluation protocol 8 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 9
Top-1 / mAP (%) · Standardized production evaluation protocol 9 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 10
Top-1 / mAP (%) · Standardized production evaluation protocol 10 executing multi-trial cross-validated metrics on canonical test partitions.
Audio, Speech & Acoustics Standardized Protocol 1
WER / F1 (%) · Standardized production evaluation protocol 1 executing multi-trial cross-validated metrics on canonical test partitions.
Audio, Speech & Acoustics Standardized Protocol 2
WER / F1 (%) · Standardized production evaluation protocol 2 executing multi-trial cross-validated metrics on canonical test partitions.
Audio, Speech & Acoustics Standardized Protocol 3
WER / F1 (%) · Standardized production evaluation protocol 3 executing multi-trial cross-validated metrics on canonical test partitions.
Audio, Speech & Acoustics Standardized Protocol 4
WER / F1 (%) · Standardized production evaluation protocol 4 executing multi-trial cross-validated metrics on canonical test partitions.
Audio, Speech & Acoustics Standardized Protocol 5
WER / F1 (%) · Standardized production evaluation protocol 5 executing multi-trial cross-validated metrics on canonical test partitions.
Tabular & Classical ML Standardized Protocol 1
ROC-AUC (%) · Standardized production evaluation protocol 1 executing multi-trial cross-validated metrics on canonical test partitions.
Tabular & Classical ML Standardized Protocol 2
ROC-AUC (%) · Standardized production evaluation protocol 2 executing multi-trial cross-validated metrics on canonical test partitions.
Tabular & Classical ML Standardized Protocol 3
ROC-AUC (%) · Standardized production evaluation protocol 3 executing multi-trial cross-validated metrics on canonical test partitions.
Tabular & Classical ML Standardized Protocol 4
ROC-AUC (%) · Standardized production evaluation protocol 4 executing multi-trial cross-validated metrics on canonical test partitions.
Tabular & Classical ML Standardized Protocol 5
ROC-AUC (%) · Standardized production evaluation protocol 5 executing multi-trial cross-validated metrics on canonical test partitions.
