> ML_DATASET // C4-COLOSSAL-CLEAN-CRAWLED-CORPUS_v1.0
C4 (Colossal Clean Crawled Corpus)
Google Research / Allen Institute for AI (Raffel et al.) · Foundation Model Pretraining · 750 GB clean English text (roughly 156 billion tokens)
Foundation Model PretrainingODC-BY / Common Crawl Terms750 GB clean English text (roughly 156 billion tokens)open
Veri Profili ve Özellikler
Etiket Tipi:Unsupervised pre-training text
Diller:en
Lisans Seviyesi:permissive-open-source
Modaliteler:text
Amaçlanan Kullanım (Intended Use)
- Büyük temel dil modellerini ön eğitme (T5, LLaMA referansları)
Yasaklanan / Kaçınılması Gereken Kullanım
- Ek veri olmaksızın azınlık lehçelerini temsil etmeyi hedefleme
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
Common Crawl'dan çıkarılmıştır; internette kamuya açık kalıntı kişisel bilgiler içerebilir.
Bilinen Önyargılar (Known Bias):
Ağır İngilizce web yanlılığı; sezgisel filtreleme standart dışı lehçeleri ve halk dilini temizlemiştir.
Veri Sızıntısı Riski (Known Leakage):
Modern tekilleştirme çalışmalarından önce değerlendirme kıyaslama sorularını içeriyordu.
