> ML_DATASET // THE-PILE-DATASET_v1.0
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
EleutherAI (Gao et al.) · Foundation Model Pretraining · 825 GB diverse text (roughly 300 billion tokens) across 22 diverse subsets
Foundation Model PretrainingCustom Academic Open / Component-specific licenses825 GB diverse text (roughly 300 billion tokens) across 22 diverse subsetsopen
Veri Profili ve Özellikler
Etiket Tipi:Unsupervised pre-training text categorized by source component
Diller:en
Lisans Seviyesi:research-only
Modaliteler:text
Amaçlanan Kullanım (Intended Use)
- Yüksek akıl yürütme ve alan derinliğine sahip açık araştırma modellerini (GPT-NeoX, Pythia) ön eğitme
Yasaklanan / Kaçınılması Gereken Kullanım
- Telif hakkı ihtilaflı alt bileşenlerin ticari yeniden dağıtımı
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
Akademik makaleler, GitHub kodları, mahkeme kararları ve potansiyel kişisel veri içeren web taramaları barındırır.
Bilinen Önyargılar (Known Bias):
Akademik, teknik ve matematiksel metinlerin yüksek yoğunluğu.
Veri Sızıntısı Riski (Known Leakage):
Yaygın kıyaslama soruları içerir (Books3 bileşeni telif hakkı nedeniyle tartışmalıdır).
