Skip to main content

> ML_DATASET // FINEWEB-DATASET_v1.0

FineWeb (15 Trillion High-Quality Web Tokens)

Hugging Face (Lozhkov et al.) · Foundation LLM Pretraining · 15 trillion tokens (44 TB of compressed text across 96 Common Crawl snapshots)

Foundation LLM PretrainingOpen Data Commons Attribution License (ODC-By)15 trillion tokens (44 TB of compressed text across 96 Common Crawl snapshots)open

Veri Profili ve Özellikler

Etiket Tipi:Unsupervised pre-training text with synthetic quality annotations
Diller:en
Lisans Seviyesi:permissive-open-source
Modaliteler:text

Amaçlanan Kullanım (Intended Use)

  • Açık ağırlıklı en üst düzey temel dil modeli ön eğitimi

Yasaklanan / Kaçınılması Gereken Kullanım

  • Güvenlik sonrası eğitim ve hizalama olmadan doğrudan dağıtım

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

Telefon, e-posta ve IP adreslerini kaldırmak için kişisel veri anonimleştirme filtreleri uygulanmıştır.

Bilinen Önyargılar (Known Bias):

İngilizce ve ticari web içeriğine yönelik web tarama dağılımı yanlılığı.

Veri Sızıntısı Riski (Known Leakage):

Sezgisel minhash tekilleştirme ve kıyaslama arındırması uygulanmıştır.

Uyumlu Araçlar ve Kütüphaneler