> ML_BENCHMARKS_ATLAS_v1.0
AI Benchmarks & Evaluation Protocols
53 canonical AI evaluation protocols spanning GLUE, SuperGLUE, MMLU, GSM8K, HumanEval, ARC, and LMSYS Chatbot Arena with saturation and contamination audits.
LLM Reasoning & Architecture Standardized Protocol 6
Accuracy (%) · Standardized production evaluation protocol 6 executing multi-trial cross-validated metrics on canonical test partitions.
LLM Reasoning & Architecture Standardized Protocol 7
Accuracy (%) · Standardized production evaluation protocol 7 executing multi-trial cross-validated metrics on canonical test partitions.
LLM Reasoning & Architecture Standardized Protocol 8
Accuracy (%) · Standardized production evaluation protocol 8 executing multi-trial cross-validated metrics on canonical test partitions.
LLM Reasoning & Architecture Standardized Protocol 9
Accuracy (%) · Standardized production evaluation protocol 9 executing multi-trial cross-validated metrics on canonical test partitions.
LLM Reasoning & Architecture Standardized Protocol 10
Accuracy (%) · Standardized production evaluation protocol 10 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 1
pass@1 (%) · Standardized production evaluation protocol 1 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 2
pass@1 (%) · Standardized production evaluation protocol 2 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 3
pass@1 (%) · Standardized production evaluation protocol 3 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 4
pass@1 (%) · Standardized production evaluation protocol 4 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 5
pass@1 (%) · Standardized production evaluation protocol 5 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 6
pass@1 (%) · Standardized production evaluation protocol 6 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 7
pass@1 (%) · Standardized production evaluation protocol 7 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 8
pass@1 (%) · Standardized production evaluation protocol 8 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 9
pass@1 (%) · Standardized production evaluation protocol 9 executing multi-trial cross-validated metrics on canonical test partitions.
Code Intelligence & Tool Use Standardized Protocol 10
pass@1 (%) · Standardized production evaluation protocol 10 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 1
Top-1 / mAP (%) · Standardized production evaluation protocol 1 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 2
Top-1 / mAP (%) · Standardized production evaluation protocol 2 executing multi-trial cross-validated metrics on canonical test partitions.
Computer Vision & Multimodal Standardized Protocol 3
Top-1 / mAP (%) · Standardized production evaluation protocol 3 executing multi-trial cross-validated metrics on canonical test partitions.
