Skip to main content

> ML_DATASET // C4-COLOSSAL-CLEAN-CRAWLED-CORPUS_v1.0

C4 (Colossal Clean Crawled Corpus)

Google Research / Allen Institute for AI (Raffel et al.) · Foundation Model Pretraining · 750 GB clean English text (roughly 156 billion tokens)

Foundation Model PretrainingODC-BY / Common Crawl Terms750 GB clean English text (roughly 156 billion tokens)open

Veri Profili ve Özellikler

Etiket Tipi:Unsupervised pre-training text
Diller:en
Lisans Seviyesi:permissive-open-source
Modaliteler:text

Amaçlanan Kullanım (Intended Use)

  • Büyük temel dil modellerini ön eğitme (T5, LLaMA referansları)

Yasaklanan / Kaçınılması Gereken Kullanım

  • Ek veri olmaksızın azınlık lehçelerini temsil etmeyi hedefleme

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

Common Crawl'dan çıkarılmıştır; internette kamuya açık kalıntı kişisel bilgiler içerebilir.

Bilinen Önyargılar (Known Bias):

Ağır İngilizce web yanlılığı; sezgisel filtreleme standart dışı lehçeleri ve halk dilini temizlemiştir.

Veri Sızıntısı Riski (Known Leakage):

Modern tekilleştirme çalışmalarından önce değerlendirme kıyaslama sorularını içeriyordu.

Uyumlu Araçlar ve Kütüphaneler