Skip to main content

> ML_DATASET // FINEWEB-DATASET_v1.0

FineWeb (15 Trillion High-Quality Web Tokens)

Hugging Face (Lozhkov et al.) · Foundation LLM Pretraining · 15 trillion tokens (44 TB of compressed text across 96 Common Crawl snapshots)

Foundation LLM PretrainingOpen Data Commons Attribution License (ODC-By)15 trillion tokens (44 TB of compressed text across 96 Common Crawl snapshots)open

Dataset Profile & Characteristics

Label Type:Unsupervised pre-training text with synthetic quality annotations
Languages:en
License Tier:permissive-open-source
Modalities:text

Intended Use

  • Open-weights state-of-the-art foundation language model pretraining

Prohibited / Discouraged Use

  • Training without safety post-training and alignment

Bias, Leakage & Privacy Risk Analysis

Privacy / Sensitive Data Risks:

PII anonymization filters applied to strip phone numbers, emails, and IP addresses.

Known Bias:

Web crawl distribution biased towards English and commercial web content.

Known Benchmark Leakage:

Heuristic minhash deduplication and benchmark decontamination applied.

Compatible Tools & Libraries