> ML_DATASET // LAION-5B-MULTIMODAL-DATASET_v1.0
LAION-5B: Open Large-Scale Multimodal Dataset
LAION e.V. (Schuhmann et al. 2022) · Multimodal Foundation Pretraining · 5.85 billion CLIP-filtered image-URL and alt-text pairs (2.3B English, 2.2B multilingual)
Multimodal Foundation PretrainingCC-BY-4.0 (Metadata index)5.85 billion CLIP-filtered image-URL and alt-text pairs (2.3B English, 2.2B multilingual)open
Dataset Profile & Characteristics
Label Type:Web image URLs paired with HTML alt-text and CLIP similarity embeddings
Languages:en, multilingual
License Tier:permissive-open-source
Modalities:image, text
Intended Use
- Pretraining open text-to-image diffusion models (Stable Diffusion v1-v2) and open CLIP encoders
Prohibited / Discouraged Use
- Training facial recognition surveillance backbones
Bias, Leakage & Privacy Risk Analysis
Privacy / Sensitive Data Risks:
Web crawl metadata index; contains links to unredacted public web images and personal photographs.
Known Bias:
Internet web scraper biases; NSFW and offensive content filtered heuristically.
Known Benchmark Leakage:
Large-scale deduplication required to prevent memorization of stock photo agency collections.
