Skip to main content

> ML_DATASET // THE-PILE-DATASET_v1.0

The Pile: An 800GB Dataset of Diverse Text for Language Modeling

EleutherAI (Gao et al.) · Foundation Model Pretraining · 825 GB diverse text (roughly 300 billion tokens) across 22 diverse subsets

Foundation Model PretrainingCustom Academic Open / Component-specific licenses825 GB diverse text (roughly 300 billion tokens) across 22 diverse subsetsopen

Veri Profili ve Özellikler

Etiket Tipi:Unsupervised pre-training text categorized by source component
Diller:en
Lisans Seviyesi:research-only
Modaliteler:text

Amaçlanan Kullanım (Intended Use)

  • Yüksek akıl yürütme ve alan derinliğine sahip açık araştırma modellerini (GPT-NeoX, Pythia) ön eğitme

Yasaklanan / Kaçınılması Gereken Kullanım

  • Telif hakkı ihtilaflı alt bileşenlerin ticari yeniden dağıtımı

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

Akademik makaleler, GitHub kodları, mahkeme kararları ve potansiyel kişisel veri içeren web taramaları barındırır.

Bilinen Önyargılar (Known Bias):

Akademik, teknik ve matematiksel metinlerin yüksek yoğunluğu.

Veri Sızıntısı Riski (Known Leakage):

Yaygın kıyaslama soruları içerir (Books3 bileşeni telif hakkı nedeniyle tartışmalıdır).

Uyumlu Araçlar ve Kütüphaneler