> ML_DATASET // FINEWEB-DATASET_v1.0
FineWeb (15 Trillion High-Quality Web Tokens)
Hugging Face (Lozhkov et al.) · Foundation LLM Pretraining · 15 trillion tokens (44 TB of compressed text across 96 Common Crawl snapshots)
Foundation LLM PretrainingOpen Data Commons Attribution License (ODC-By)15 trillion tokens (44 TB of compressed text across 96 Common Crawl snapshots)open
Veri Profili ve Özellikler
Etiket Tipi:Unsupervised pre-training text with synthetic quality annotations
Diller:en
Lisans Seviyesi:permissive-open-source
Modaliteler:text
Amaçlanan Kullanım (Intended Use)
- Açık ağırlıklı en üst düzey temel dil modeli ön eğitimi
Yasaklanan / Kaçınılması Gereken Kullanım
- Güvenlik sonrası eğitim ve hizalama olmadan doğrudan dağıtım
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
Telefon, e-posta ve IP adreslerini kaldırmak için kişisel veri anonimleştirme filtreleri uygulanmıştır.
Bilinen Önyargılar (Known Bias):
İngilizce ve ticari web içeriğine yönelik web tarama dağılımı yanlılığı.
Veri Sızıntısı Riski (Known Leakage):
Sezgisel minhash tekilleştirme ve kıyaslama arındırması uygulanmıştır.
