Skip to main content

> ML_DATASET // OPENML-CC18-BENCHMARK-SUITE_v1.0

OpenML-CC18 Curated Classification Benchmark Suite

OpenML Consortium (Bischl et al.) · Meta-Learning & AutoML · 72 diverse tabular datasets across scientific, industrial, and social domains

Meta-Learning & AutoMLCC-BY-4.072 diverse tabular datasets across scientific, industrial, and social domainsopen

Veri Profili ve Özellikler

Etiket Tipi:Binary and multiclass classification targets
Diller:en
Lisans Seviyesi:permissive-open-source
Modaliteler:tabular

Amaçlanan Kullanım (Intended Use)

  • AutoML kıyaslaması ve tablosal sınıflandırıcıların titiz karşılaştırılması (XGBoost, LightGBM, CatBoost, Derin Öğrenme)

Yasaklanan / Kaçınılması Gereken Kullanım

  • Bilgisayarlı görü veya yapılandırılmamış NLP omurgalarını değerlendirme

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

Seçilmiş açık erişimli bilimsel veri setleri; tüm kişisel veriler tamamen anonimleştirilmiştir.

Bilinen Önyargılar (Known Bias):

Toplu koleksiyon orta büyüklükteki tablosal kıyaslama görevlerine ağırlık verir.

Veri Sızıntısı Riski (Known Leakage):

OpenML görev tanımları aracılığıyla standartlaştırılmış katı 10 katlı çapraz doğrulama ayrımları.

Uyumlu Araçlar ve Kütüphaneler