> ML_DATASETS_ATLAS_v1.0
AI Datasets Atlas
103 qualified AI datasets across tabular, vision, audio, NLP, and multimodal domains: verified licensing tiers, privacy risks, bias, and contamination audits.
Adult Census Income (Census Income 1994)
Demographics & Economics · 48,842 rows, 14 features · UCI Machine Learning Repository / US Census Bureau
HIGGS Machine Learning Dataset
High Energy Physics · 11,000,000 rows, 28 kinematic features · UCI ML Repository / Baldi et al. (UC Irvine)
Credit Card Fraud Detection Dataset (ULB MLG)
Banking & Financial Fraud · 284,807 transactions, 30 PCA features · Université Libre de Bruxelles (MLG)
California Housing Prices (Pace & Barry 1997)
Real Estate & Economics · 20,640 block groups, 8 continuous features · StatLib / Pace & Barry
Forest CoverType Dataset (Roosevelt National Forest)
Ecology & Forestry · 581,012 rows, 54 cartographic features · UCI Machine Learning Repository / US Forest Service
Statlog (German Credit Data)
Banking & Credit Risk · 1,000 credit applications, 20 attributes · UCI Machine Learning Repository / Prof. Hofmann (Univ. Hamburg)
Ames Housing Dataset (De Cock 2011)
Real Estate & Econometrics · 2,930 properties, 79 explanatory features · Dean De Cock / Truman State University
Breast Cancer Wisconsin (Diagnostic)
Oncology & Medical Diagnostics · 569 biopsy samples, 30 continuous nuclear morphometric features · UCI ML Repository / Wolberg, Street & Mangasarian
Titanic: Machine Learning from Disaster
Maritime History & Survival Analysis · 891 training passengers, 11 features · Kaggle / British Board of Trade
Bank Marketing Dataset (Moro et al. 2014)
Banking & Telemarketing · 45,211 phone campaign contacts, 16 attributes · UCI ML Repository / Moro, Cortez & Rita
Diabetes 130-US Hospitals Readmission (1999-2008)
Healthcare & Hospital Informatics · 101,766 hospital encounters, 47 features · UCI ML Repository / Strack et al.
OpenML-CC18 Curated Classification Benchmark Suite
Meta-Learning & AutoML · 72 diverse tabular datasets across scientific, industrial, and social domains · OpenML Consortium (Bischl et al.)
ImageNet ILSVRC 2012 (ImageNet-1K)
Computer Vision & Object Recognition · 1,281,167 training images across 1,000 synsets · Stanford University / Princeton University (Deng et al.)
MS COCO 2017 (Common Objects in Context)
Computer Vision & Scene Understanding · 118,287 training images, 80 object categories, 5,000 validation images · COCO Consortium / Microsoft Research
PASCAL VOC 2012 (Visual Object Classes)
Computer Vision · 11,530 images containing 27,450 annotated objects across 20 classes · University of Oxford / Microsoft Research (Everingham et al.)
CIFAR-10 Dataset (Krizhevsky 2009)
Computer Vision Education · 60,000 32x32 color images across 10 mutually exclusive classes · University of Toronto (Alex Krizhevsky)
CIFAR-100 Dataset (Krizhevsky 2009)
Computer Vision Education · 60,000 32x32 color images across 100 classes grouped into 20 superclasses · University of Toronto (Alex Krizhevsky)
MNIST Handwritten Digits (LeCun, Cortes & Burges 1998)
Optical Character Recognition & Education · 70,000 28x28 grayscale images of handwritten digits 0-9 · Yann LeCun / Corinna Cortes / Christopher Burges (NYU / Bell Labs)
